Omni-Embed-Audio: новая модель для поиска аудио по тексту на основе мультимодальных LLM

Модель Omni-Embed-Audio (OEA) представляет собой прорыв в области поиска аудио по тексту, решая проблему несоответствия между традиционными бенчмарками и реальными поисковыми запросами. Исследователи разработали систему на основе мультимодальных больших языковых моделей (MLLM), которая значительно п

Omni-Embed-Audio: новая модель для поиска аудио по тексту на основе мультимодальных LLM

Модель Omni-Embed-Audio (OEA) представляет собой прорыв в области поиска аудио по тексту, решая проблему несоответствия между традиционными бенчмарками и реальными поисковыми запросами. Исследователи разработали систему на основе мультимодальных больших языковых моделей (MLLM), которая значительно превосходит существующие решения в обработке сложных запросов, таких как вопросы, команды и отрицательные формулировки. Это приближает технологию к практическому применению в поисковых сервисах для аудиоконтента.

Как работает Omni-Embed-Audio

Omni-Embed-Audio использует мультимодальные большие языковые модели для создания единого эмбеддинг-пространства, объединяющего аудио и текст. В отличие от традиционных подходов, основанных на CLAP, OEA способен понимать не только простые описания, но и сложные интенции пользователя. Модель обрабатывает запросы в виде вопросов, команд, ключевых слов, перефразировок и исключающих отрицательных запросов, что делает её более гибкой в реальных сценариях.

Почему это важно для поиска аудио

Текущие системы audio-text retrieval, такие как CLAP, хорошо работают на стандартных тестах, но терпят неудачу при столкновении с запросами, типичными для реального использования. Например, пользователь может спросить «Где звук дождя?» или дать команду «Найди звук кошки». OEA демонстрирует значительное превосходство в таких сценариях, что приближает технологию к практическому применению в поисковых системах, голосовых помощниках и сервисах для работы с аудиоконтентом.

Какие типы запросов поддерживает OEA?

Для оценки модели авторы разработали User-Intent Queries (UIQs) — пять типов запросов: вопросы, команды, ключевые слова, перефразировки и исключающие отрицательные запросы. Последние особенно сложны: они требуют от модели отсеивать акустически похожие, но семантически разные аудиофрагменты. Например, запрос «Найди звук собаки, но не лай» заставляет модель игнорировать похожие звуки. Для таких случаев создан пайплайн hard negative mining и метрики HNSR и TFR для оценки способности модели отсеивать отвлекающие сигналы.

Результаты экспериментов

Эксперименты на наборах AudioCaps, Clotho и MECAT показали, что OEA сравнима с SOTA-моделью M2D-CLAP в задаче text-to-audio retrieval, но превосходит её в text-to-text retrieval на 22% относительного улучшения. Кроме того, в различении hard negative OEA показал прирост на 4.3% HNSR@10 и 34.7% TFR@10. Это указывает на то, что бэкбон на основе LLM обеспечивает лучшее семантическое понимание сложных запросов.

Кого затронет эта технология

Разработчиков систем поиска аудио, исследователей в области мультимодального ИИ, а также компании, создающие поисковые сервисы для аудиоконтента. OEA может быть интегрирована в голосовые помощники, системы рекомендаций музыки и звуковых эффектов, а также в инструменты для анализа аудиоданных.

Что пока неизвестно

Пока нет информации о доступности модели для открытого использования или API. Неясно, как OEA будет работать на других языках, кроме английского. Также остаётся открытым вопрос о масштабируемости модели для обработки больших аудиобиблиотек в реальном времени.

Перспективы развития

Omni-Embed-Audio открывает новые возможности для поиска аудио по тексту. Дальнейшие исследования могут быть направлены на мультиязычную поддержку, улучшение обработки длинных аудиофайлов и интеграцию с другими модальностями, такими как видео. Эта модель может стать основой для нового поколения поисковых систем, способных понимать естественный язык пользователя.