Что такое диффузионные языковые модели простыми словами
В 2026 году в новостях всё чаще мелькает термин диффузионные языковые модели (diffusion LM). Например, NVIDIA выпустила Nemotron TwoTower, которая пишет текст в 2,4 раза быстрее обычных моделей. Разберём простыми словами, что это за подход и чем он отличается от привычного.
Как пишут текст обычные модели
Классические языковые модели (ChatGPT, Claude, Gemini и почти все остальные) — авторегрессионные. Это значит, что они генерируют текст по одному токену (кусочку слова) за раз, слева направо:
«Небо» → «сегодня» → «ясное» → «и» → «синее»…
Каждое следующее слово зависит от всех предыдущих. Это надёжно и качественно, но есть узкое место: нельзя написать десятое слово, пока не написано девятое. Генерация принципиально последовательная — а значит, ограничена по скорости.
Откуда взялась «диффузия»
Слово «диффузия» пришло из генерации картинок. Модели вроде Stable Diffusion рисуют изображение так: берут «шум» (случайные точки) и постепенно убирают его, шаг за шагом проявляя картинку. Идея диффузионных языковых моделей — сделать то же самое с текстом.
Как работают диффузионные языковые модели
Вместо того чтобы писать по слову, диффузионная LM:
- начинает с «зашумлённого» блока текста (набор неопределённых токенов);
- за несколько шагов «проявляет» сразу целый блок слов параллельно;
- уточняет результат, пока не получится связный текст.
Ключевое отличие — слова в блоке рождаются не по очереди, а одновременно. Это как разница между «печатать по одной букве» и «проявлять фотографию целиком».
Зачем это нужно: скорость
Главный выигрыш — скорость. Раз токены генерируются параллельно, текст выдаётся быстрее. Nemotron TwoTower от NVIDIA показывает в 2,42 раза выше пропускную способность при сохранении 98,7% качества обычной модели. Для сервисов, где важна мгновенная реакция (чат-боты, автодополнение кода), это большое дело.
Как устроена Nemotron TwoTower (по-простому)
У неё «две башни»:
- Башня контекста (замороженная, обычная авторегрессионная) — держит уже написанный текст и понимает смысл.
- Диффузионная башня — «дорисовывает» новые блоки токенов, опираясь на контекст.
Красота подхода в том, что можно взять готовую обычную модель и добавить к ней вторую башню, не переобучая всё с нуля.
Минусы и ограничения
- Незрелость. Диффузионные LM пока новее и менее отработаны, чем классические.
- Качество на сложных задачах. На самых трудных рассуждениях авторегрессионные модели всё ещё впереди.
- Мало готовых продуктов. Пока это больше исследовательское направление, чем массовый чат-бот.
Почему за этим стоит следить
Если диффузионный подход «дозреет», нас ждёт скачок скорости генерации без потери качества — а значит, более отзывчивые ассистенты и более дешёвая работа с ИИ. Это один из немногих принципиально новых способов ускорить модели, не просто наращивая «железо». Сравнить подходы можно на примере Nemotron TwoTower против Qwen 3.6, а другие модели — в нашем каталоге.