BiSCo-LLM: сжатие LLM до 2 бит на вес без кодовых книг — новый метод
Исследователи представили BiSCo-LLM — метод сжатия больших языковых моделей до сверхнизкой разрядности, который позволяет хранить веса в формате 2 бита без использования кодовых книг. Это решение может снизить требования к памяти и ускорить инференс на устройствах с ограниченными ресурсами. В основе

Исследователи представили BiSCo-LLM — метод сжатия больших языковых моделей до сверхнизкой разрядности, который позволяет хранить веса в формате 2 бита без использования кодовых книг. Это решение может снизить требования к памяти и ускорить инференс на устройствах с ограниченными ресурсами. В основе метода лежит бинарное сферическое кодирование, которое объединяет преимущества бинаризации и сферического квантования, избегая недостатков традиционного векторного квантования.
Как работает BiSCo-LLM
BiSCo-LLM состоит из трёх ключевых компонентов: бинарного сферического кодирования, остаточного BSQ-этапа и категорийной дистилляции восстановления. Первый компонент отображает локальные блоки весов на единичную гиперсферу и бинаризует их в компактные сферические коды. В отличие от векторного квантования, здесь не хранятся центроиды — основная нагрузка приходится на поток знаков. Это позволяет значительно сократить объём памяти без потери качества.
Как остаточный этап улучшает сжатие?
Остаточный BSQ-этап кодирует ошибку реконструкции базового сферического кодека. Он обеспечивает явный компромисс между степенью сжатия и искажениями, при этом не требует хранения кодовых книг. Это означает, что можно гибко настраивать битрейт в зависимости от требований к точности, не увеличивая накладные расходы на хранение.
Как дистилляция восстанавливает качество?
Категорийная дистилляция восстановления применяется после замены каждого модуля Transformer. Она уменьшает расхождение между локальной реконструкцией весов и поведением собранной модели. Это критически важно для сохранения качества генерации текста, так как сжатие весов может привести к накоплению ошибок.
Для стабилизации чувствительных каналов используется вспомогательный 8-битный защищённый канал. Он учитывается отдельно от основного BSQ-потока и позволяет сохранить точность на тех весах, которые наиболее критичны для производительности модели. В заявленный бюджет хранения включены бинарные коды, нейронные декодеры, нагрузка защищённого канала, LoRA-адаптеры и метаданные.
Почему BiSCo-LLM важен для индустрии
Современные LLM требуют огромных объёмов памяти и высокой пропускной способности при инференсе. Например, модель с 70 миллиардами параметров в формате FP16 занимает около 140 ГБ, что делает её развёртывание на локальных устройствах практически невозможным. Существующие методы сжатия до 2 бит на вес либо теряют точность (квантование), либо требуют хранения кодовых книг (векторное квантование), что увеличивает накладные расходы. BiSCo-LLM предлагает компромисс: высокая степень сжатия без дополнительных затрат на хранение кодовых книг.
Какие проблемы решает BiSCo-LLM?
Основная проблема — это баланс между сжатием и качеством. Традиционное квантование до 2 бит часто приводит к значительному падению точности, особенно на сложных задачах. Векторное квантование может сохранить качество, но требует хранения кодовых книг, что увеличивает объём памяти и усложняет аппаратную реализацию. BiSCo-LLM обходит эти ограничения, используя бинарное сферическое кодирование, которое не требует кодовых книг и при этом обеспечивает высокое качество реконструкции.
Другая проблема — совместимость с существующими аппаратными ускорителями. Многие методы сжатия требуют специализированного оборудования для эффективного инференса. BiSCo-LLM, благодаря своей структуре, может быть реализован на стандартных нейронных процессорах без значительных модификаций.
Кому будет полезен BiSCo-LLM
Метод ориентирован на разработчиков и исследователей, занимающихся развёртыванием LLM на устройствах с ограниченными ресурсами: мобильные телефоны, периферийные устройства, IoT. Компании, стремящиеся снизить затраты на хранение и передачу моделей, также могут выиграть от использования BiSCo-LLM. Например, сервисы, предоставляющие локальный AI-ассистент, смогут запускать более мощные модели на устройствах пользователей без потери производительности.
Какие модели можно сжимать?
Хотя в препринте не указаны точные модели, метод применим к любым архитектурам на основе Transformer, включая LLaMA, GPT и их производные. BiSCo-LLM работает на уровне весов, поэтому не зависит от конкретной архитектуры. Ожидается, что наибольший эффект будет достигнут на больших моделях с десятками миллиардов параметров, где сжатие даёт максимальную экономию.
Что пока остаётся неизвестным
Точные показатели сжатия и качества для конкретных моделей пока не раскрыты. Исследователи не опубликовали результаты экспериментов на стандартных бенчмарках, таких как оценка перплексии или точность на задачах генерации текста. Также неясно, как метод ведёт себя на задачах рассуждения или перевода. Подробные результаты ожидаются в полной версии статьи, которая, вероятно, будет представлена на одной из ведущих конференций по машинному обучению.
Совместимость с аппаратным обеспечением
Ещё один открытый вопрос — насколько BiSCo-LLM совместим с существующими аппаратными ускорителями, такими как GPU или TPU. Метод использует нейронные декодеры и LoRA-адаптеры, что может потребовать дополнительных вычислений. Исследователи утверждают, что метод может быть эффективно реализован на стандартном оборудовании, но конкретные бенчмарки скорости пока отсутствуют.
Перспективы развития
BiSCo-LLM открывает путь к созданию ещё более компактных моделей без потери качества. В будущем возможно объединение этого метода с другими техниками сжатия, такими как прунинг или дистилляция знаний. Кроме того, метод может быть адаптирован для сжатия не только весов, но и активаций, что ещё больше снизит требования к памяти.
Разработчики уже заявили, что планируют открыть исходный код реализации, что позволит сообществу протестировать метод на своих моделях и задачах. Это ускорит внедрение BiSCo-LLM в промышленность и поможет выявить его сильные и слабые стороны.
Заключение
BiSCo-LLM — это многообещающий метод сжатия LLM до 2 бит на вес, который обходит ограничения традиционного квантования и векторного квантования. Он не требует хранения кодовых книг, что упрощает аппаратную реализацию и снижает накладные расходы. Несмотря на то, что полные результаты экспериментов ещё не опубликованы, метод уже привлёк внимание сообщества благодаря своей оригинальной идее. Если он подтвердит свою эффективность на практике, то может стать стандартом для развёртывания LLM на устройствах с ограниченными ресурсами.