SVD-Prune: метод сжатия визуальных токенов для VLM без потери качества
Исследователи разработали SVD-Prune — метод сокращения визуальных токенов в Vision-Language Models (VLM), который использует сингулярное разложение для отбора наиболее значимых токенов. В отличие от существующих подходов, основанных на локальных эвристиках, SVD-Prune опирается на статистические пока

Исследователи разработали SVD-Prune — метод сокращения визуальных токенов в Vision-Language Models (VLM), который использует сингулярное разложение для отбора наиболее значимых токенов. В отличие от существующих подходов, основанных на локальных эвристиках, SVD-Prune опирается на статистические показатели влиятельности, что позволяет сохранять качество даже при агрессивном сжатии. Метод не требует дообучения и может быть интегрирован как plug-and-play решение.
Как работает SVD-Prune
Современные VLM обрабатывают длинные последовательности визуальных токенов, количество которых может достигать сотен или тысяч. Это приводит к высоким вычислительным затратам и потреблению памяти, особенно при развертывании на устройствах с ограниченными ресурсами. Существующие методы сжатия, такие как отбор на основе весов внимания или норм токенов, часто теряют важную информацию при агрессивном сокращении до 16–32 токенов. Особенно это заметно на изображениях с большим количеством деталей, где каждый токен может нести уникальную информацию.
SVD-Prune решает эту проблему, используя сингулярное разложение матрицы признаков визуальных токенов. Сначала матрица раскладывается на сингулярные векторы и значения. Затем для каждого токена вычисляется leverage score — показатель его вклада в главные сингулярные векторы, которые определяют основную структуру данных. Токены с наибольшими scores отбираются для дальнейшей обработки, а остальные отбрасываются. Такой подход гарантирует, что сохраняются токены, вносящие наибольший вклад в глобальную дисперсию данных, а не просто локально важные.
Почему SVD-Prune превосходит другие методы
Эксперименты показали, что SVD-Prune превосходит предшествующие методы, такие как отбор на основе весов внимания, особенно при экстремальных бюджетах токенов — 32 и 16 токенов. В этих условиях традиционные методы теряют важную информацию, так как они опираются на локальные эвристики, которые могут быть обманчивы. Например, токен с высоким весом внимания может быть важен для одного запроса, но не для общего представления изображения. SVD-Prune, напротив, учитывает глобальную структуру данных, что позволяет сохранять ключевые детали даже при сильном сжатии.
Метод не требует дообучения и совместим с различными архитектурами VLM, что делает его удобным для практического применения. Разработчики могут легко интегрировать SVD-Prune в существующие пайплайны без необходимости переобучать модели. Это особенно важно для инженеров, оптимизирующих модели для развертывания на устройствах с ограниченными ресурсами, таких как мобильные телефоны или встраиваемые системы.
Какие проблемы решает SVD-Prune
Основная проблема современных VLM — высокие вычислительные затраты и потребление памяти при обработке длинных последовательностей визуальных токенов. Это ограничивает их применение в реальных сценариях, где важна скорость и эффективность. SVD-Prune позволяет сократить количество токенов без значительной потери качества, что ведет к более быстрым и экономичным моделям. Пользователи могут ожидать улучшения производительности без ущерба для точности.
Кроме того, метод решает проблему потери информации при агрессивном сжатии. Благодаря использованию leverage scores, SVD-Prune сохраняет токены, которые определяют основную структуру изображения, что критически важно для задач, требующих высокой детализации, например, в медицинской визуализации или анализе спутниковых снимков.
Для кого предназначен SVD-Prune
Метод будет полезен разработчикам VLM, исследователям в области мультимодального обучения, а также инженерам, занимающимся оптимизацией моделей для развертывания на устройствах с ограниченными ресурсами. Компании, использующие VLM в продуктах, смогут снизить затраты на инфраструктуру и улучшить пользовательский опыт за счет более быстрой обработки.
Что пока неизвестно о SVD-Prune
Несмотря на впечатляющие результаты, в статье не сообщается о применении метода к конкретным популярным VLM, таким как LLaVA или BLIP. Также не указаны точные вычислительные затраты на выполнение SVD для больших последовательностей токенов. Хотя SVD является хорошо изученной операцией, его стоимость может быть значительной для очень длинных последовательностей. Будущие исследования должны прояснить эти аспекты.
Какие перспективы у SVD-Prune
SVD-Prune открывает новые возможности для сжатия визуальных токенов в VLM. В будущем метод может быть улучшен за счет адаптивного выбора количества токенов в зависимости от сложности изображения или комбинирования с другими техниками сжатия. Также возможно применение SVD-Prune не только к визуальным токенам, но и к другим модальностям. Разработчики могут ожидать появления новых версий метода, оптимизированных для конкретных архитектур и задач.
В целом, SVD-Prune представляет собой значительный шаг вперед в области сжатия VLM. Он предлагает эффективное решение для снижения вычислительных затрат без потери качества, что делает его ценным инструментом для исследователей и инженеров.