Новый бенчмарк EgoExoMem: как ИИ учится рассуждать о памяти с двух точек зрения

Исследователи представили EgoExoMem — первый бенчмарк для оценки способности искусственного интеллекта рассуждать о памяти, используя одновременно видео от первого и третьего лица. Эта задача, известная как кросс-вью рассуждение, имитирует человеческую способность вспоминать события с разных перспек

Новый бенчмарк EgoExoMem: как ИИ учится рассуждать о памяти с двух точек зрения

Исследователи представили EgoExoMem — первый бенчмарк для оценки способности искусственного интеллекта рассуждать о памяти, используя одновременно видео от первого и третьего лица. Эта задача, известная как кросс-вью рассуждение, имитирует человеческую способность вспоминать события с разных перспектив. Бенчмарк включает 2,6 тысячи вопросов с множественным выбором восьми типов, охватывающих временные, пространственные и кросс-вью задачи. Вместе с ним предложен метод E²-Select, который без обучения выбирает ключевые кадры из синхронизированных видео, повышая точность ответов.

Что такое кросс-вью память и почему она важна для ИИ

Человеческая память устроена сложно: мы можем вспомнить событие как участник (эгоцентрическая перспектива) или как наблюдатель (экзоцентрическая перспектива). Например, вспоминая свой день рождения, вы можете представить, как видели гостей своими глазами, или мысленно увидеть себя со стороны. Для искусственного интеллекта, особенно в робототехнике и воплощенных системах, умение интегрировать обе перспективы открывает новые возможности. Эгоцентрические видео, снятые камерой на голове робота, дают детали взаимодействия с объектами, но часто упускают общий контекст. Экзоцентрические видео, снятые со стороны, показывают полную картину, но не передают ощущения участника. Объединение этих видов позволяет ИИ лучше понимать пространственно-временные отношения и строить более полные модели событий.

Как устроен бенчмарк EgoExoMem

EgoExoMem состоит из 2,6 тысяч вопросов с множественным выбором, разделенных на восемь типов. Вопросы проверяют временные навыки (порядок событий, длительность), пространственные (положение объектов, относительное расположение) и кросс-вью (перенос информации между перспективами). Например, ИИ может спросить: "Какой объект был ближе к камере первого лица в момент, когда камера третьего лица зафиксировала движение?" Такие задачи требуют синхронизации информации из двух видеопотоков и демонстрируют, насколько модель способна рассуждать о памяти, а не просто распознавать образы.

Какие типы вопросов включены в бенчмарк?

Восемь типов вопросов охватывают три категории: временные (например, "Какое событие произошло раньше?"), пространственные ("Где находился объект относительно камеры?") и кросс-вью ("Как изменилась точка зрения при переходе от первого к третьему лицу?"). Каждый вопрос требует анализа синхронизированных видео и выбора правильного ответа из нескольких вариантов. Это позволяет оценить не только память, но и способность к рассуждению в разных контекстах.

Метод E²-Select: как выбрать лучшие кадры без обучения

Для эффективной работы с длинными видео исследователи разработали E²-Select — метод, который не требует дополнительного обучения. Он работает в два этапа. Сначала распределяется бюджет кадров между эго- и экзо-видео на основе релевантности запросу: чем больше видео связано с вопросом, тем больше кадров из него выбирается. Затем для каждого вида применяется k-DPP (определительный точечный процесс), который выбирает разнообразные и репрезентативные кадры, избегая дублирования. Такой подход позволяет сократить объем обрабатываемых данных без потери важной информации.

Результаты: насколько хорошо современные ИИ справляются с задачей

Тестирование показало, что лучшая мультимодальная большая языковая модель (MLLM) достигает лишь 55,3% правильных ответов — лишь немного выше случайного угадывания (50% для вопросов с двумя вариантами). Метод E²-Select повышает точность до 58,2%, превосходя базовые подходы, такие как случайный выбор кадров или RAG (Retrieval-Augmented Generation). Однако даже этот результат далек от человеческого уровня. Исследователи выявили систематические конфликты: формулировка вопроса может указывать на одну перспективу, а правильный ответ требует информации из другой. Это подчеркивает новизну и сложность задачи.

Кому это нужно: разработчики роботов и воплощенного ИИ

Бенчмарк и метод E²-Select в первую очередь затронут разработчиков систем воплощенного интеллекта, робототехники и мультимодальных моделей. Например, робот, который убирает со стола, должен помнить, где лежала чашка (эго-вид) и как она выглядела со стороны (экзо-вид), чтобы правильно ее взять. Интеграция двух перспектив улучшит навигацию, взаимодействие с объектами и планирование действий. Кроме того, бенчмарк может быть полезен для создания более совершенных систем памяти и рассуждения, способных адаптироваться к реальным условиям.

Что пока неизвестно: ограничения и будущие вопросы

Несмотря на успех, E²-Select имеет ограничения. Пока неясно, как метод масштабируется на более длинные видео (часы, а не минуты) и другие типы кросс-вью задач, например, с участием нескольких камер. Также не изучена корреляция между результатами бенчмарка и реальными приложениями воплощенного ИИ: насколько улучшение точности на тестовых вопросах приведет к лучшей производительности роботов в реальном мире. Исследователи планируют расширить бенчмарк и изучить эти аспекты в будущем.

Заключение

EgoExoMem открывает новое направление в оценке памяти ИИ, заставляя модели рассуждать с двух перспектив одновременно. Метод E²-Select демонстрирует, что даже простые подходы без обучения могут улучшить результаты, но до человеческого уровня еще далеко. Этот бенчмарк станет важным инструментом для разработки более умных и адаптивных систем искусственного интеллекта.