Weaver ускоряет инференс LLM в 4,37 раза: новый метод спекулятивного декодирования
Исследователи представили метод Weaver для спекулятивного декодирования больших языковых моделей, который ускоряет инференс в 4,37 раза по сравнению со стандартным авторегрессионным декодированием и на 24,7% превосходит оптимизированный baseline DFlash. Разработка решает ключевую проблему факторизов

Исследователи представили метод Weaver для спекулятивного декодирования больших языковых моделей, который ускоряет инференс в 4,37 раза по сравнению со стандартным авторегрессионным декодированием и на 24,7% превосходит оптимизированный baseline DFlash. Разработка решает ключевую проблему факторизованных моделей-черновиков — резкое падение вероятности принятия при увеличении спекулятивного бюджета. Weaver использует факторизованные априорные распределения для параллельного предсказания будущих токенов, а затем с помощью лёгкого авторегрессионного адаптера строит из top-K маргиналов дерево предложений, восстанавливая условные зависимости между токенами. Это позволяет значительно повысить эффективность спекулятивного декодирования без потери качества генерации.
Как работает Weaver
Что такое спекулятивное декодирование и почему оно важно? Спекулятивное декодирование — это техника ускорения генерации текста в LLM, при которой небольшая модель-черновик быстро генерирует несколько гипотез, а основная модель их верифицирует. Это позволяет параллельно обрабатывать несколько токенов, сокращая время инференса без ухудшения качества. Однако существующие факторизованные модели-черновики часто предполагают независимость токенов, что приводит к снижению вероятности принятия при увеличении числа спекулятивных шагов. Weaver решает эту проблему, внося условные зависимости между токенами без полного проецирования словаря, что делает метод особенно эффективным для моделей с Gated Delta Net слоями.
Как Weaver строит деревья предложений? Weaver состоит из двух компонентов: факторизованного черновика и лёгкого авторегрессионного адаптера. Факторизованный черновик параллельно предсказывает маргинальные распределения для будущих токенов, а адаптер на основе top-K маргиналов строит дерево предложений, восстанавливая условные зависимости. Это позволяет избежать предположения о независимости токенов и увеличить вероятность принятия гипотез. Для быстрой верификации деревьев в моделях с Gated Delta Net слоями авторы разработали алгоритм верификации без отката (rollback-free) и реализовали оптимизированные CUDA-ядра в фреймворке SGLang.
Результаты и сравнение с другими методами
Насколько Weaver быстрее стандартного декодирования? В экспериментах Weaver достиг ускорения в 4,37 раза по сравнению с авторегрессионным декодированием. Это значительный прирост, особенно для продакшен-систем, где каждая миллисекунда имеет значение. По сравнению с оптимизированным baseline DFlash, Weaver показал улучшение на 24,7%, что подтверждает эффективность предложенного подхода. Авторы отмечают, что метод особенно хорошо работает для моделей с Gated Delta Net слоями, где традиционные подходы к верификации деревьев менее эффективны.
Какие преимущества перед другими методами спекулятивного декодирования? Основное преимущество Weaver — способность учитывать условные зависимости между токенами без значительного увеличения вычислительной сложности. В отличие от методов, требующих полного проецирования словаря, Weaver использует факторизованные априорные распределения и лёгкий адаптер, что делает его масштабируемым. Кроме того, алгоритм верификации без отката и оптимизированные CUDA-ядра обеспечивают дополнительное ускорение на этапе проверки гипотез.
Кому будет полезен Weaver?
Разработчики и исследователи в области ускорения инференса LLM Метод ориентирован на специалистов, работающих над ускорением генерации текста, особенно тех, кто использует спекулятивное декодирование в продакшене. Weaver может быть интегрирован в существующие фреймворки, такие как SGLang, и не требует значительных изменений в архитектуре основной модели. Это делает его привлекательным для компаний, которые стремятся снизить задержки при работе с LLM.
Пользователи моделей с архитектурой Gated Delta Net Поскольку Weaver оптимизирован для моделей с Gated Delta Net слоями, он будет особенно полезен для тех, кто использует такие архитектуры. Традиционные методы верификации деревьев в этих моделях менее эффективны, и Weaver предлагает решение, адаптированное под их особенности.
Ограничения и открытые вопросы
Какие аспекты остаются неисследованными? В препринте не указаны точные характеристики использованных моделей и датасетов, а также не приведены результаты на более широком наборе бенчмарков. Отсутствует сравнение с другими методами спекулятивного декодирования, кроме DFlash. Также неясно, насколько хорошо Weaver масштабируется на очень большие модели с сотнями миллиардов параметров. Будущие исследования должны прояснить эти вопросы.
Как Weaver можно улучшить в будущем? Возможные направления для улучшения включают адаптацию метода для других архитектур, таких как Transformer с вниманием, а также оптимизацию для работы с моделями, использующими квантование или дистилляцию. Кроме того, можно исследовать комбинирование Weaver с другими техниками ускорения, например, с префиксным кэшированием.
Заключение Weaver представляет собой значительный шаг вперёд в области спекулятивного декодирования LLM. Предложенный метод решает проблему падения вероятности принятия при увеличении спекулятивного бюджета за счёт факторизованных априорных распределений и лёгкого авторегрессионного адаптера. Ускорение в 4,37 раза и превосходство над DFlash на 24,7% делают Weaver перспективным инструментом для ускорения инференса LLM в продакшене. Дальнейшие исследования должны подтвердить его эффективность на более широком спектре моделей и задач.