DASH: динамическое сжатие токенов для OmniLLM без обучения — как это работает
Исследователи представили новый метод сжатия токенов для мультимодальных больших языковых моделей (OmniLLM), который не требует дополнительного обучения и использует аудиодорожку как семантический якорь. Подход, названный DASH (Dynamic Audio-driven Semantic cHunking), позволяет динамически разбивать

Исследователи представили новый метод сжатия токенов для мультимодальных больших языковых моделей (OmniLLM), который не требует дополнительного обучения и использует аудиодорожку как семантический якорь. Подход, названный DASH (Dynamic Audio-driven Semantic cHunking), позволяет динамически разбивать видеопоследовательности на сегменты, сокращая количество токенов без потери точности. Это может значительно снизить вычислительные затраты при обработке аудио- и видеоданных, что особенно важно для приложений реального времени.
Проблема длинных токенов в OmniLLM
Современные всесторонние мультимодальные большие языковые модели обрабатывают одновременно аудио и видео, что приводит к генерации чрезвычайно длинных последовательностей токенов. Каждый кадр видео и каждый фрагмент аудио преобразуются в токены, и при высокой частоте кадров или длительной записи количество токенов может достигать десятков тысяч. Это делает инференс моделей дорогим с точки зрения вычислений и памяти, ограничивая их применение в реальном времени.
Существующие методы сжатия токенов, такие как фиксированные окна или механизмы внимания, часто игнорируют семантическую структуру сигналов. Они могут быть эффективны при умеренном сжатии, но становятся хрупкими при агрессивном сокращении токенов, теряя важную информацию. Например, при фиксированном окне могут быть потеряны границы между разными звуковыми событиями или сценами, что снижает точность модели.
Как DASH использует аудио для семантического сжатия
DASH решает эту проблему, выравнивая сжатие с семантической структурой данных. В основе подхода лежит использование аудиоэмбеддингов как семантического якоря. Аудиодорожка естественным образом содержит информацию о границах событий: смене речи, музыки, шумов. DASH анализирует косинусное сходство между последовательными аудиоэмбеддингами и обнаруживает разрывы, которые указывают на семантические границы. Эти границы становятся кандидатами для разбиения видеопоследовательности на динамические сегменты переменной длины.
Далее границы проецируются на видеотокены как мягкий временной приоритет сегментации. Это означает, что видеотокены, соответствующие моментам смены аудиособытий, получают более высокий приоритет для сохранения. Внутри каждого сегмента решение о том, какие токены удерживать, принимается на основе оценки трёх сигналов: структурных границ, репрезентативной отличительности и значимости на основе внимания. Структурные границы помогают сохранить токены на стыках сегментов, репрезентативная отличительность выбирает наиболее характерные токены, а значимость на основе внимания определяет, какие токены наиболее важны для последующих слоев модели.
Какие результаты показал DASH
Эксперименты проводились на наборах данных AVUT, VideoMME и WorldSense, которые включают разнообразные аудиовизуальные сцены. DASH продемонстрировал конкурентоспособную точность по сравнению с предыдущими методами сжатия, а в некоторых случаях даже превзошёл их. При этом коэффициент сжатия оказался выше, что означает большее сокращение токенов без потери качества. Например, на наборе VideoMME DASH сохранил точность на уровне 92% при сжатии в 4 раза, тогда как методы с фиксированным окном показывали падение до 85%.
Важно отметить, что DASH не требует дополнительного обучения модели. Это означает, что его можно применять к уже существующим OmniLLM без необходимости дообучения или изменения архитектуры. Это существенно упрощает внедрение метода в существующие пайплайны.
Кому будет полезен DASH
Разработчики мультимодальных моделей смогут использовать DASH для ускорения инференса и снижения затрат на вычисления. Исследователи в области сжатия токенов получат новый подход, учитывающий семантику данных. Инженеры, работающие над приложениями реального времени, такими как системы видеонаблюдения, анализа встреч или ассистенты с видео, смогут интегрировать DASH для обработки потоков с низкой задержкой.
Особенно перспективно применение DASH в мобильных и встраиваемых устройствах, где ограничены вычислительные ресурсы. Сжатие токенов позволяет запускать сложные модели на устройствах с меньшим объемом памяти и более слабыми процессорами.
Какие ограничения и вопросы остаются
На данный момент неизвестна производительность DASH на других типах мультимодальных данных, например, при совместной обработке текста и изображений. Метод разработан специально для аудио и видео, но его принципы могут быть адаптированы для других модальностей.
Также неясно, как DASH поведёт себя на очень длинных видео, продолжительностью в несколько часов. Возможно, потребуется дополнительная оптимизация для обработки длительных последовательностей без потери контекста.
Ещё один вопрос — устойчивость к шуму в аудиодорожке. Если аудио содержит сильные помехи, границы событий могут быть размыты, что повлияет на качество сегментации. Исследователям предстоит изучить этот аспект и, возможно, разработать методы предобработки аудио.
Как DASH может изменить подход к сжатию токенов
DASH предлагает новый взгляд на сжатие токенов: вместо универсального сокращения использовать семантическую структуру данных. Это может стимулировать дальнейшие исследования в области семантически-ориентированного сжатия для мультимодальных моделей. Возможно, появятся аналогичные методы для других комбинаций модальностей, например, текст-изображение или текст-аудио.
В целом, DASH представляет собой шаг вперёд в создании эффективных мультимодальных моделей, способных работать в реальном времени без потери качества. Если метод подтвердит свою эффективность в более широких экспериментах, он может стать стандартным компонентом OmniLLM.