Социальные роботы научились предсказывать смену собеседника: новый фреймворк MM-VAP

Исследователи представили новый фреймворк Multimodal Voice Activity Projection (MM-VAP), который позволяет социальным роботам предсказывать, когда один собеседник закончит говорить, а другой начнёт. В отличие от предыдущих решений, MM-VAP использует не только аудио, но и видеоданные, что делает взаи

Социальные роботы научились предсказывать смену собеседника: новый фреймворк MM-VAP

Исследователи представили новый фреймворк Multimodal Voice Activity Projection (MM-VAP), который позволяет социальным роботам предсказывать, когда один собеседник закончит говорить, а другой начнёт. В отличие от предыдущих решений, MM-VAP использует не только аудио, но и видеоданные, что делает взаимодействие более естественным. Работа опубликована на arXiv и описывает подход, который может значительно улучшить диалоговые системы в групповых сценариях.

Почему это важно для социальных роботов

Социальные роботы, выступающие в роли медиаторов в групповых обсуждениях, должны улавливать тонкие сигналы смены реплик. Простое ожидание пауз делает диалог неестественным и замедляет взаимодействие. MM-VAP решает эту проблему, обучаясь на синхронизированных аудио-визуальных сигналах, таких как интонация, жесты и взгляд. Это позволяет роботу предугадывать момент, когда один участник готов передать слово другому, и вмешиваться или реагировать более своевременно.

Как работает MM-VAP: технические детали

Фреймворк расширяет оригинальную аудио-only VAP (Voice Activity Projection) до мультимодального входа. В основе лежат предобученные аудио-визуальные энкодеры, которые адаптируются к задаче с помощью Low-Rank Adaptation (LoRA). После независимого кодирования каждого говорящего применяется межспикерный механизм внимания для моделирования динамики диалога. Выходное пространство из 256 состояний регуляризуется семантической функцией потерь, согласующейся с паттернами диалоговой активности. Такой подход позволяет учитывать не только слова, но и визуальные подсказки, такие как поворот головы или движение рук.

Какие результаты показали эксперименты?

Эксперименты на корпусах NoXi и NoXi+J показали улучшение по сравнению с существующими базовыми методами, особенно для некоторых типов смены реплик. Дополнительное тестирование на корпусе Haru EDR подтвердило применимость подхода для роботов-медиаторов. Однако стоит отметить, что тесты проводились на записанных диалогах, а не в реальном времени с живыми роботами.

Кого затронет эта технология

Разработчиков социальных роботов, исследователей в области человеко-роботного взаимодействия, а также инженеров, создающих диалоговые системы для групповых сценариев. MM-VAP может быть интегрирован в такие системы, как роботы-помощники в офисах, образовательные роботы или даже виртуальные ассистенты, которые участвуют в групповых видеоконференциях.

Что пока неизвестно и остаётся открытым

Не сообщается о тестировании на реальных роботах в живом взаимодействии; результаты получены на записанных корпусах. Остаётся открытым вопрос о вычислительных затратах в реальном времени — сможет ли MM-VAP работать достаточно быстро для интерактивных сценариев. Кроме того, неясно, как фреймворк справится с нестандартными ситуациями, например, когда несколько участников пытаются говорить одновременно.

Будущее мультимодального прогнозирования в диалогах

Развитие таких технологий, как MM-VAP, приближает нас к созданию роботов, которые могут естественно взаимодействовать с людьми в групповых обсуждениях. В будущем можно ожидать интеграции с более сложными моделями понимания контекста и эмоций, что сделает диалоги ещё более плавными. Однако для практического применения потребуется решить вопросы задержки и адаптации к реальным условиям.