AnchorPrune: метод сжатия визуальных токенов для мультимодальных моделей без потери качества

Исследователи представили AnchorPrune — новый тренировочно-свободный фреймворк для сжатия визуальных токенов в больших мультимодальных моделях (VLM). Этот метод позволяет значительно сократить количество визуальных токенов без потери качества ответов модели, что особенно актуально для современных VL

AnchorPrune: метод сжатия визуальных токенов для мультимодальных моделей без потери качества

Исследователи представили AnchorPrune — новый тренировочно-свободный фреймворк для сжатия визуальных токенов в больших мультимодальных моделях (VLM). Этот метод позволяет значительно сократить количество визуальных токенов без потери качества ответов модели, что особенно актуально для современных VLM, которые обрабатывают изображения с высоким разрешением, генерируя тысячи токенов. AnchorPrune решает проблему избыточности токенов, сохраняя ключевую информацию для ответа на запрос пользователя и снижая вычислительные затраты и задержки при инференсе.

Как работает AnchorPrune

Метод AnchorPrune основан на двухэтапном подходе. На первом этапе строится «защищённый релевантный якорь» (relevance anchor) — набор визуальных токенов, наиболее релевантных текстовому запросу пользователя. Эти токены считаются критически важными для ответа и сохраняются в любом случае. Размер якоря определяется автоматически на основе анализа профиля новизны токенов, отсортированных по релевантности. Это означает, что модель сама решает, сколько токенов необходимо для базового понимания запроса.

На втором этапе оставшийся бюджет токенов распределяется между дополнительными визуальными токенами, выбранными по принципу важности и новизны. Важность оценивается на основе внимания модели к токенам, а новизна — на основе отличия токена от уже выбранных. Таким образом, добавляются только информативные и неповторяющиеся токены, что позволяет сохранить максимальное количество полезной информации при минимальном количестве токенов.

AnchorPrune не требует дообучения или изменения архитектуры модели. Это делает его удобным для интеграции в существующие VLM без дополнительных затрат на обучение. Код метода доступен на GitHub, что позволяет разработчикам легко воспроизвести результаты и адаптировать метод под свои задачи.

Результаты экспериментов

В экспериментах на модели LLaVA-NeXT-7B AnchorPrune показал впечатляющие результаты. При использовании всего 160 из 2880 визуальных токенов (сжатие в 18 раз) метод сохраняет 97,6% производительности модели по сравнению с полным набором токенов. Это означает, что AnchorPrune позволяет значительно ускорить инференс и снизить вычислительные затраты без существенной потери качества ответов.

Сравнение с другими методами сжатия токенов, такими как FastV и Token Merging, показало, что AnchorPrune превосходит их по соотношению производительности и степени сжатия. Например, при аналогичном уровне сжатия AnchorPrune сохраняет на 2-3% больше точности на бенчмарках VQA (Visual Question Answering).

Почему это важно для разработчиков VLM?

Современные мультимодальные модели, такие как LLaVA-NeXT, обрабатывают изображения с высоким разрешением, что приводит к тысячам визуальных токенов. Это увеличивает вычислительные затраты и задержки при инференсе, что критично для реальных приложений, требующих быстрого ответа, например, в чат-ботах, системах автоматического описания изображений или помощниках для людей с нарушениями зрения. AnchorPrune решает проблему избыточности токенов, сохраняя при этом ключевую информацию для ответа на запрос пользователя.

Кого затронет эта технология

Разработчиков мультимодальных моделей, исследователей в области компьютерного зрения и NLP, а также компании, внедряющие VLM в продукты, где важна скорость и стоимость инференса. AnchorPrune может быть особенно полезен для стартапов и небольших команд, которые не имеют доступа к большим вычислительным ресурсам, но хотят использовать мощь VLM. Снижение количества токенов напрямую уменьшает время ответа и затраты на облачные вычисления.

Что пока неизвестно

Насколько метод эффективен для других архитектур VLM, кроме LLaVA-NeXT, и как он ведёт себя на более сложных задачах, требующих высокой детализации изображения, таких как медицинская диагностика или анализ спутниковых снимков. Исследователи планируют протестировать AnchorPrune на других моделях и задачах в будущем. Также остаётся открытым вопрос о том, как метод справляется с видео-входом, где количество токенов может быть ещё больше.

Как начать использовать AnchorPrune

Код AnchorPrune доступен на GitHub в репозитории авторов. Для интеграции в существующую модель LLaVA-NeXT достаточно загрузить скрипты и следовать инструкциям. Метод не требует дообучения, поэтому его можно применить сразу после установки. Разработчики могут настроить параметры сжатия, такие как бюджет токенов, в зависимости от требований к скорости и качеству.

AnchorPrune представляет собой значительный шаг вперёд в области эффективного инференса мультимодальных моделей. Благодаря тренировочно-свободному подходу и впечатляющим результатам, этот метод может стать стандартным инструментом для оптимизации VLM в ближайшем будущем.