Microsoft представила Differential Transformer V2: новая архитектура для LLM улучшает внимание и снижает шум

Microsoft Research представила новую архитектуру нейросети — Differential Transformer V2 (Diff Transformer V2), которая модифицирует механизм внимания, чтобы уменьшить влияние шума и улучшить фокусировку на релевантных токенах. Модель уже доступна на Hugging Face, а код опубликован на GitHub под лиц

Microsoft представила Differential Transformer V2: новая архитектура для LLM улучшает внимание и снижает шум

Microsoft Research представила новую архитектуру нейросети — Differential Transformer V2 (Diff Transformer V2), которая модифицирует механизм внимания, чтобы уменьшить влияние шума и улучшить фокусировку на релевантных токенах. Модель уже доступна на Hugging Face, а код опубликован на GitHub под лицензией MIT. Это потенциально важный шаг для развития больших языковых моделей, особенно в контексте обработки длинных документов и снижения галлюцинаций.

Почему стандартные трансформеры страдают от шума

Стандартные трансформеры, лежащие в основе таких моделей, как GPT-4 или LLaMA, используют механизм внимания, который вычисляет веса для всех токенов в последовательности. Однако на длинных контекстах этот механизм часто распределяет внимание на нерелевантные токены, что приводит к размыванию фокуса и снижению качества генерации. Особенно остро эта проблема проявляется при работе с документами большого объёма, где модель может "забывать" важные детали или галлюцинировать, опираясь на шумовые сигналы. Diff Transformer V2 решает эту проблему, заменяя стандартное softmax-внимание на дифференциальное внимание.

Как работает Differential Transformer V2

В основе Diff Transformer V2 лежит дифференциальное внимание, которое вычисляет разницу между двумя независимыми механизмами внимания. Подавляя шум, модель фокусируется только на релевантных токенах. Архитектура включает нормализацию и масштабирование для обеспечения стабильности обучения. Эксперименты, проведённые исследователями, показали улучшение на задачах обработки длинных контекстов и языкового моделирования. В частности, модель демонстрирует более точное извлечение информации из длинных текстов и снижение количества ошибок при генерации.

Какие преимущества даёт дифференциальное внимание?

Дифференциальное внимание позволяет модели эффективно отсеивать нерелевантные сигналы, что особенно важно при работе с зашумлёнными данными или длинными последовательностями. В отличие от стандартного внимания, которое может "размазываться" по множеству токенов, дифференциальное внимание создаёт более чёткие границы между важными и второстепенными элементами. Это приводит к повышению качества генерации, снижению галлюцинаций и улучшению обработки длинных документов. Кроме того, архитектура включает механизмы нормализации, которые предотвращают нестабильность градиентов при обучении.

Кого затронет новая архитектура

Разработчики LLM, исследователи в области NLP, инженеры, работающие над улучшением трансформеров, а также компании, использующие большие языковые модели для анализа документов и генерации текста, могут получить выгоду от внедрения Diff Transformer V2. Архитектура может быть интегрирована в существующие модели для повышения их эффективности, особенно в сценариях, где важна работа с длинными контекстами, таких как юридический анализ, обработка медицинских записей или генерация длинных статей.

Что пока остаётся неизвестным

Несмотря на многообещающие результаты, опубликованные Microsoft Research, пока нет независимых бенчмарков, сравнивающих Diff Transformer V2 с другими современными архитектурами, такими как Mamba или RWKV. Также неясно, насколько хорошо модель масштабируется и как она ведёт себя в продакшене. Исследователям предстоит провести дополнительные тесты, чтобы подтвердить преимущества архитектуры на реальных задачах и оценить её вычислительную эффективность.

Перспективы развития дифференциальных трансформеров

Diff Transformer V2 — это не первая попытка улучшить механизм внимания. Ранее исследователи предлагали различные модификации, такие как sparse attention или линейное внимание. Однако дифференциальный подход отличается тем, что он явно моделирует разницу между двумя потоками внимания, что может быть более эффективным для подавления шума. В будущем возможно появление гибридных архитектур, которые комбинируют дифференциальное внимание с другими инновациями, такими как state space models или рекуррентные блоки.

Как начать использовать Diff Transformer V2

Модель уже доступна на Hugging Face, а код — на GitHub под лицензией MIT. Разработчики могут загрузить предобученную версию или дообучить её на своих данных. Для интеграции в существующие проекты потребуется адаптировать код, но благодаря открытой лицензии это не составит труда. Исследователи могут использовать реализацию для экспериментов и сравнения с другими архитектурами.

Заключение

Differential Transformer V2 от Microsoft Research представляет собой значительный шаг вперёд в развитии архитектур нейросетей для обработки естественного языка. Улучшение механизма внимания за счёт подавления шума может повысить качество генерации и снизить галлюцинации, что особенно важно для приложений, работающих с длинными документами. Однако для полной оценки потенциала архитектуры необходимы независимые тесты и анализ масштабируемости. В любом случае, открытая публикация кода и модели способствует быстрому распространению инновации в сообществе.