Новая модель Ego3DLM: предсказание движений человека с учётом 3D-сцены и текста
Учёные представили Ego3DLM — модель, способную предсказывать движения человека от первого лица, одновременно учитывая трёхмерную структуру сцены и текстовые описания. Эта разработка объединяет два ключевых аспекта — физическую реалистичность и семантическую согласованность — в едином процессе, что о

Учёные представили Ego3DLM — модель, способную предсказывать движения человека от первого лица, одновременно учитывая трёхмерную структуру сцены и текстовые описания. Эта разработка объединяет два ключевых аспекта — физическую реалистичность и семантическую согласованность — в едином процессе, что открывает новые возможности для дополненной и виртуальной реальности, робототехники и воплощённого искусственного интеллекта.
Что такое Ego3DLM и как она работает
Ego3DLM — это авторегрессионная модель, которая предсказывает позу человека и текстовое описание его действий одновременно, используя информацию о трёхмерной сцене. В отличие от предыдущих подходов, которые часто игнорировали 3D-контекст или разделяли предсказание позы и языка, новая модель объединяет эти задачи в одном процессе. Она использует три точки отслеживания на теле человека, 3D-признаки сцены и эгоцентрическое видео, чтобы декодировать как прошлую, так и будущую позу, а также прошлое и будущее текстовое описание за один проход.
Почему это важно для AR/VR и робототехники
Точное предсказание движений человека критически важно для множества приложений. В системах дополненной и виртуальной реальности оно позволяет создавать более естественные взаимодействия между пользователем и виртуальными объектами. В робототехнике понимание намерений человека через предсказание движений помогает роботам безопасно и эффективно работать рядом с людьми. Ego3DLM улучшает как физическую реалистичность предсказаний, так и их семантическую согласованность с контекстом сцены, что делает её шагом вперёд по сравнению с существующими методами.
Как модель учитывает трёхмерную сцену?
Одной из ключевых инноваций Ego3DLM является интеграция 3D-информации о сцене в процесс предсказания. Модель использует пространственно-семантическое понимание окружения, что позволяет ей генерировать движения, которые не только правдоподобны с точки зрения биомеханики, но и соответствуют геометрии и функциональности сцены. Например, если человек находится рядом со стулом, модель может предсказать движение присаживания, а не ходьбы, даже если текстовое описание не уточняет действие.
Трёхэтапное обучение модели
Обучение Ego3DLM проходит в три этапа. На первом этапе модель предварительно обучается на задачах пространственно-семантического понимания сцены, что позволяет ей извлекать полезные признаки из 3D-данных. Второй этап включает комплексную настройку по всем четырём выходам: прошлая поза, будущая поза, прошлое описание и будущее описание. На третьем этапе применяется дообучение с подкреплением с использованием группового относительного политического оптимизации (GRPO) и внутри- и межмодальных наград. Такой подход позволяет модели учиться на собственных ошибках и улучшать качество предсказаний.
Результаты на бенчмарке Nymeria
На стандартном бенчмарке Nymeria модель Ego3DLM достигла state-of-the-art результатов в предсказании будущих движений, отслеживании прошлых и описании движений. Это означает, что она превзошла все предыдущие методы по точности и правдоподобию. Особенно впечатляющими стали результаты в задачах, где требуется одновременно учитывать и позу, и текст, что подтверждает эффективность объединённого подхода.
Кому будет полезна эта разработка
Новая модель представляет интерес для разработчиков систем AR/VR, специалистов по человеко-робот-взаимодействию, исследователей в области компьютерного зрения и воплощённого ИИ. Она может быть использована для создания более реалистичных аватаров в виртуальной реальности, улучшения систем отслеживания движений и разработки интеллектуальных помощников, способных предугадывать действия человека.
Какие ограничения остаются?
Несмотря на впечатляющие результаты, авторы не раскрывают детали вычислительных затрат и времени вывода модели. Также отсутствует сравнительный анализ с методами, использующими только видео без 3D-сцены. Это оставляет открытыми вопросы о практической применимости модели в реальном времени и её преимуществах по сравнению с более простыми подходами. Дальнейшие исследования должны прояснить эти аспекты.