Диффузионные языковые модели: устройство, перспективы и подводные камни
Команды AIRI и SberAI представили подробный обзор диффузионных языковых моделей (dLLM) — альтернативы классическим LLM, которые генерируют текст параллельно, а не по одному токену. Разбираем, как они работают, какие подходы доказали свою эффективность, а какие вызывают сомнения в воспроизводимости.

Диффузионные языковые модели (dLLM) — это класс архитектур, которые генерируют текст не последовательно, а сразу несколькими токенами. В отличие от привычных GPT-подобных моделей, которые предсказывают следующее слово слева направо, dLLM используют итеративный процесс: начинают с шума и постепенно «проявляют» текст. Теоретически это позволяет ускорить генерацию в разы и открывает возможность заполнять пропуски в любом месте текста, а не только продолжать его. На Хабре команды «Интерпретируемый ИИ» и «Основы генеративного ИИ» AIRI вместе с «Генеративной поэзией» SberAI поделились своим опытом работы с такими моделями: что реально работает, а что пока остаётся под вопросом.
Интерес к dLLM растёт: они обещают решить главную проблему современных LLM — медленную авторегрессионную генерацию. Пока ChatGPT и его аналоги выдают ответ по слову за раз, диффузионные модели могут синтезировать целые фразы параллельно. Это особенно важно для задач реального времени: чат-ботов, переводчиков, голосовых ассистентов. Однако на практике всё не так просто: исследователи сталкиваются с проблемами качества, стабильности обучения и воспроизводимости результатов.
Что такое диффузионные языковые модели и как они работают
Диффузионные модели пришли из мира генерации изображений — именно так работают Stable Diffusion и DALL-E. Идея в том, чтобы научить модель постепенно убирать шум из случайного тензора, превращая его в осмысленное изображение. В случае текста вместо пикселей — токены, а вместо шума — случайные или маскированные слова. Модель обучается предсказывать исходный текст по его зашумленной версии, а на этапе генерации стартует с полного шума и за несколько итераций восстанавливает связное предложение.
Ключевое отличие от авторегрессионных LLM в том, что dLLM не зависят от порядка слов. Они могут генерировать текст в любом направлении, заполнять пропуски в середине предложения или даже создавать несколько вариантов продолжения одновременно. Это даёт гибкость, которой нет у классических моделей. Например, можно задать начало и конец текста, а модель заполнит середину — что невозможно для GPT-подобных архитектур.
Однако параллельная генерация требует особых механизмов внимания. В авторегрессионных моделях каждый токен видит только предыдущие, а в dLLM все токены видят друг друга, но с учётом текущего уровня шума. Это усложняет архитектуру и обучение. Исследователи AIRI и SberAI отмечают, что многие публикации о dLLM страдают от неполных описаний, из-за чего сложно воспроизвести результаты.
Предыстория и контекст: от диффузии в изображениях к тексту
Идея применять диффузию к тексту возникла не на пустом месте. Ещё в 2021 году появились первые работы, например DiffuSeq, которые пытались адаптировать диффузионные подходы для генерации текста. Тогда качество оставляло желать лучшего, но направление показалось перспективным. В 2022–2023 годах вышли более серьёзные работы: Diffusion-LM, SSD-LM, а затем и модели, способные конкурировать с авторегрессионными на небольших задачах.
Параллельно развивалась и область «неавторегрессионных» моделей — это попытки генерировать текст блоками, а не по одному токену. Диффузионный подход стал одной из самых ярких ветвей этого направления. Важно, что dLLM не претендуют на замену всех LLM: они скорее дополняют их, предлагая альтернативу для сценариев, где важна скорость или возможность редактирования текста.
Сейчас интерес к dLLM подогревается успехами в области мультимодальных моделей, где диффузия уже доказала свою силу. Например, модели вроде Stable Diffusion для изображений и AudioLDM для звука показывают, что диффузионный принцип универсален. Перенос его на текст — логичный следующий шаг. Но текст дискретен, в отличие от непрерывных пикселей, и это создаёт фундаментальные сложности.
Чем диффузионные модели отличаются от обычных LLM?
Главное отличие — способ генерации. Обычные LLM, такие как GPT-4 или Llama, генерируют текст авторегрессионно: каждый следующий токен зависит от всех предыдущих. Это последовательный процесс, который невозможно распараллелить. Диффузионные модели генерируют текст итеративно, сразу обновляя несколько токенов на каждом шаге. За счёт этого они могут быть быстрее на длинных текстах.
Второе отличие — возможность заполнять пропуски. Авторегрессионные модели умеют только продолжать текст слева направо. dLLM могут работать с любой частью текста: вставить слово в середину, переписать кусок, сгенерировать текст от конца к началу. Это открывает новые возможности для редактирования и постобработки.
Третье отличие — обучение. dLLM обучаются на зашумленных версиях текста, что напоминает методы денойзинга. Это позволяет использовать их для задач, где нужно восстановить повреждённый текст, например, исправить опечатки или заполнить пропуски в документах.
Технические подробности: что работает, а что вызывает вопросы
Авторы обзора выделяют несколько архитектурных решений, которые доказали свою эффективность. Во-первых, использование маскирования вместо непрерывного шума. Вместо того чтобы добавлять гауссов шум к токенам, модели вроде MaskGIT и его текстовых аналогов заменяют часть токенов на специальный [MASK]. Это проще и лучше работает для дискретных данных. Во-вторых, итеративная декодирование: модель сначала предсказывает наиболее уверенные токены, затем постепенно заполняет остальные. Такой подход, как в работе Diffusion-LM, позволяет достигать хорошего качества.
Однако есть и проблемные места. Главный вопрос — масштабируемость. Пока dLLM показывают достойные результаты только на небольших моделях (до 1–2 миллиардов параметров). При увеличении размера качество начинает отставать от авторегрессионных аналогов. Исследователи связывают это с трудностями оптимизации и нехваткой стабильных методов обучения.
Второй вопрос — воспроизводимость. Многие статьи о dLLM не публикуют код и полные конфигурации, что делает невозможным повторение экспериментов. Авторы обзора сами столкнулись с этим, когда пытались воспроизвести результаты чужих моделей. Это серьёзная проблема для развития направления: без воспроизводимости невозможно накопление знаний.
Третий вопрос — оценка качества. Для авторегрессионных моделей существуют стандартные метрики: perplexity, BLEU, ROUGE. Для dLLM они не всегда применимы, так как модель может генерировать несколько вариантов текста одновременно. Нужны новые метрики, учитывающие параллельность и возможность заполнения пропусков.
Кого затронет и как: от исследователей до бизнеса
Для исследователей dLLM — это поле для экспериментов. Возможность генерировать текст нелинейно открывает новые вопросы в лингвистике и когнитивной науке. Например, как модели понимают структуру текста, если они не читают его последовательно? Это может привести к новым теориям о том, как работает язык в мозге.
Для бизнеса главное — скорость. Если dLLM удастся довести до ума, они смогут кратно ускорить работу чат-ботов и систем автоматического перевода. Это снизит затраты на инфраструктуру и улучшит пользовательский опыт. Особенно это актуально для компаний, обрабатывающих большие объёмы текста в реальном времени: поддержка клиентов, мониторинг соцсетей, юридические сервисы.
В России и СНГ интерес к dLLM тоже есть. AIRI и SberAI активно развивают это направление, а их обзор — шаг к систематизации знаний. Возможно, в ближайшие годы мы увидим отечественные диффузионные модели, адаптированные под русский язык. Это важно, так как большинство существующих моделей ориентированы на английский.
Что будет дальше: перспективы и прогнозы
В ближайшие год-два стоит ожидать появления более стабильных и масштабируемых dLLM. Уже сейчас есть работы, которые показывают, что при правильной настройке диффузионные модели могут конкурировать с авторегрессионными на задачах средней сложности. Вероятно, появятся гибридные архитектуры, которые комбинируют сильные стороны обоих подходов: быстрая параллельная генерация для черновика и авторегрессионная доработка для финального текста.
Также важно развитие методов оценки. Без адекватных метрик невозможно объективно сравнивать модели и выбирать лучшие. Возможно, появятся стандартные бенчмарки для dLLM, аналогичные GLUE или SuperGLUE для обычных LLM.
Остаётся открытым вопрос о том, смогут ли dLLM полностью заменить авторегрессионные модели. Пока ответ — нет, но они могут занять свою нишу: быстрая черновая генерация, редактирование текста, заполнение пропусков. В долгосрочной перспективе диффузионный подход может стать основой для новых типов моделей, которые мы пока не можем представить.
Итог
Диффузионные языковые модели — перспективное направление, которое может изменить подход к генерации текста. Они обещают скорость и гибкость, но пока упираются в проблемы масштабирования и воспроизводимости. Обзор AIRI и SberAI — важный шаг к систематизации знаний в этой области. Следить за развитием dLLM стоит всем, кто интересуется будущим искусственного интеллекта: возможно, именно эти модели станут основой следующего поколения языковых систем.