Квантизация LLM: точность та же, но поведение меняется — иллюзия эквивалентности

Квантизация больших языковых моделей (LLM) широко применяется для снижения требований к памяти и ускорения инференса, особенно на устройствах с ограниченными ресурсами. Однако новое исследование показывает, что стандартные метрики, такие как точность и перплексия, могут создавать ложное чувство безо

Квантизация LLM: точность та же, но поведение меняется — иллюзия эквивалентности

Квантизация больших языковых моделей (LLM) широко применяется для снижения требований к памяти и ускорения инференса, особенно на устройствах с ограниченными ресурсами. Однако новое исследование показывает, что стандартные метрики, такие как точность и перплексия, могут создавать ложное чувство безопасности: квантизованная модель может демонстрировать ту же точность, но при этом давать правильные ответы на совершенно другие вопросы. Это явление авторы назвали иллюзией эквивалентности.

Что показало исследование

Учёные представили статью, в которой проанализировали поведение нескольких LLM при различных схемах квантизации — от 8-бит до 2-бит. Они обнаружили, что даже при умеренной квантизации, когда точность и перплексия остаются на прежнем уровне, поведение модели существенно меняется. Для количественной оценки этого эффекта авторы ввели новую метрику — согласованность правильных ответов (correctness agreement). Она измеряет перекрытие множеств правильных предсказаний между исходной моделью и её квантизованными версиями. Низкая согласованность означает, что модель отвечает правильно на другие вопросы, хотя общая точность не снижается.

Почему это важно для разработчиков

Квантизация — стандартный инструмент для развёртывания LLM на мобильных устройствах, в периферийных вычислениях или при ограниченном бюджете. Оценка качества квантизации почти всегда опирается на точность и перплексию. Результаты исследования показывают, что эти метрики создают иллюзию эквивалентности: модель может сохранять ту же точность, но давать правильные ответы на другие вопросы. Это критично для приложений, где важна воспроизводимость и предсказуемость поведения модели, например, в медицинских или юридических системах.

Как квантизация влияет на внутренние механизмы модели

Исследователи рассмотрели квантизацию как структурный оператор на весах внимания. Они количественно оценили искажения по слоям с помощью статистических мер, таких как среднеквадратичное отклонение и дивергенция Кульбака-Лейблера. Результаты показали нелинейные точки перелома при низкой битности: при снижении разрядности ниже определённого порога (около 4 бит) поведенческая дивергенция резко возрастает. Кроме того, проекции query и key стабильно более чувствительны к квантизации, чем value и output. Это означает, что изменения в механизме внимания вносят наибольший вклад в изменение поведения.

Кого затронут эти результаты

Разработчиков, использующих квантизацию для развёртывания LLM на мобильных устройствах, в периферийных вычислениях или в условиях ограниченного бюджета. Также исследователей, занимающихся сжатием моделей и оценкой качества. Результаты особенно важны для тех, кто полагается на стандартные метрики при выборе схемы квантизации.

Что пока неизвестно

Насколько результаты обобщаются на другие архитектуры, не рассмотренные в статье, и как метрика согласованности коррелирует с пользовательским опытом в реальных приложениях. Также остаётся открытым вопрос, можно ли адаптировать процесс квантизации для минимизации поведенческой дивергенции без потери точности.

Выводы

Исследование подчёркивает, что стандартные метрики недостаточны для оценки качества квантизации. Разработчикам следует учитывать не только точность, но и согласованность правильных ответов, особенно в приложениях, где критична предсказуемость. Внедрение метрики согласованности в процесс валидации может помочь выявить скрытые изменения поведения и избежать неприятных сюрпризов при развёртывании.