PALS: новый метод прунинга LLM подстраивает разреженность под важность слоёв через перцентили активаций

Прунинг больших языковых моделей (LLM) — один из ключевых методов их сжатия и ускорения, позволяющий уменьшить размер модели и повысить скорость инференса без критической потери качества. Однако стандартные подходы, такие как Wanda и SparseGPT, применяют одинаковый уровень разреженности ко всем слоя

PALS: новый метод прунинга LLM подстраивает разреженность под важность слоёв через перцентили активаций

Прунинг больших языковых моделей (LLM) — один из ключевых методов их сжатия и ускорения, позволяющий уменьшить размер модели и повысить скорость инференса без критической потери качества. Однако стандартные подходы, такие как Wanda и SparseGPT, применяют одинаковый уровень разреженности ко всем слоям, игнорируя тот факт, что некоторые слои критичны для точности, а другие терпят большее прореживание. Исследователи представили новый метод PALS (Percentile-Aware Layerwise Sparsity), который адаптирует долю удаляемых весов для каждого слоя, опираясь на статистику активаций. Этот подход прост, эффективен и не требует дообучения, что делает его привлекательным для практического применения.

Почему прунинг LLM требует индивидуального подхода к слоям

Современные LLM содержат миллиарды параметров, и их развертывание на устройствах с ограниченными ресурсами требует оптимизации. Прунинг уменьшает число ненулевых весов, сокращая модель. Однако не все слои одинаково важны: некоторые играют решающую роль в сохранении точности, тогда как другие могут быть сильно разрежены без заметного ухудшения качества. Равномерное прореживание всех слоёв приводит к избыточным потерям в чувствительных слоях и недоиспользованию потенциала сжатия в устойчивых. Метод PALS решает эту проблему, динамически определяя, сколько весов можно удалить из каждого слоя.

Как работает PALS: перцентили активаций как мера важности

Ключевая идея PALS заключается в использовании статистики активаций для оценки важности слоя. На калибровочных данных для каждого слоя вычисляется 99-й перцентиль величин активаций. Этот показатель отражает, насколько сильно активируются нейроны: высокий перцентиль указывает на то, что слой часто генерирует большие значения, что может свидетельствовать о его значимости. На основе этого значения коэффициент разреженности слоя корректируется в пределах ±5% от целевого глобального уровня. Таким образом, слои с более высокими активациями получают меньшее прореживание, а с низкими — большее.

Важно, что PALS не требует дополнительного обучения или сложных вычислений. Достаточно одного прохода по калибровочным данным для сбора статистики активаций, после чего разреженность распределяется между слоями. Это делает метод пригодным для one-shot прунинга, когда модель не дообучается после удаления весов.

Результаты экспериментов: значительное улучшение на LLaMA-2-7B

Авторы протестировали PALS на нескольких архитектурах. На LLaMA-2-7B при целевом уровне разреженности 50% метод достиг перплексии 10.96 на тесте WikiText-2, тогда как равномерный Wanda показал 12.92. Различие статистически значимо (p < 0.001). Это означает, что PALS позволяет сохранить более высокое качество модели при том же объёме сжатия. Однако эффект зависит от архитектуры: для LLaMA-3-8B улучшения оказались незначительными, а для Mistral-7B отсутствовали. Это может быть связано с тем, что в некоторых моделях слои уже сбалансированы по важности, или с особенностями архитектуры.

Интересно, что распределение разреженности на основе градиентов, которое кажется более теоретически обоснованным, дало результат хуже случайного. Это указывает на то, что градиенты плохо подходят для оценки влияния дискретного удаления весов, так как они отражают локальное поведение, а не глобальную важность после прунинга.

Какие преимущества даёт адаптивный прунинг на практике

Для разработчиков и инженеров, внедряющих LLM на устройствах с ограниченными ресурсами, PALS предлагает простой способ улучшить качество модели при том же уровне сжатия. Метод не требует дообучения, что экономит время и вычислительные ресурсы. Кроме того, он может быть комбинирован с другими техниками оптимизации, такими как квантизация. Однако важно учитывать, что эффективность PALS зависит от модели: для некоторых архитектур выигрыш может быть незначительным.

Какие ограничения и нерешённые вопросы остаются

На данный момент неясно, как PALS поведёт себя на более крупных моделях, например, с 70 миллиардами параметров и выше. Также не проводился анализ влияния на downstream-задачи, такие как ответы на вопросы, генерация текста или перевод. Возможно, что улучшение перплексии не всегда коррелирует с улучшением качества на конкретных задачах. Кроме того, метод использует фиксированное отклонение в ±5%, и оптимальность этого значения требует дальнейших исследований.

Что это значит для будущего сжатия LLM

PALS представляет собой шаг в сторону более интеллектуального прунинга, учитывающего индивидуальные особенности слоёв. Простота и эффективность метода делают его привлекательным для практического использования. В сочетании с другими подходами, такими как структурный прунинг или дистилляция, PALS может способствовать созданию более компактных и быстрых моделей без существенной потери качества. Дальнейшие исследования должны прояснить его применимость к широкому спектру архитектур и задач.

Как разработчики могут применить PALS уже сейчас

Для использования PALS необходимо собрать калибровочные данные (небольшой набор текстов), прогнать модель и вычислить 99-й перцентиль активаций для каждого слоя. Затем, задав целевой уровень разреженности, скорректировать его для каждого слоя в пределах ±5% пропорционально перцентилю. После этого можно применить любой метод прунинга весов, например, Wanda или SparseGPT, но с индивидуальными уровнями разреженности. Реализация не требует сложных библиотек и может быть выполнена на основе существующих фреймворков.

Заключение: стоит ли использовать PALS

PALS — это простой и эффективный метод адаптивного прунинга, который улучшает качество модели при том же уровне сжатия, особенно для архитектур с неравномерной важностью слоёв. Он не требует дообучения и легко интегрируется в существующие пайплайны. Однако перед применением стоит проверить его эффективность на конкретной модели и задаче. Для LLaMA-2-7B улучшение существенно, для других моделей — может быть незначительным. В любом случае, PALS добавляет полезный инструмент в арсенал разработчиков, занимающихся сжатием LLM.