PEVA от BAIR: модель предсказания видео от первого лица с учётом позы всего тела
Исследователи из Berkeley AI Research (BAIR) представили модель PEVA (Whole-Body Conditioned Egocentric Video Prediction), которая предсказывает видео от первого лица, учитывая позу всего тела — рук, ног, туловища и головы. Это позволяет генерировать более реалистичные и согласованные с движениями ч

Исследователи из Berkeley AI Research (BAIR) представили модель PEVA (Whole-Body Conditioned Egocentric Video Prediction), которая предсказывает видео от первого лица, учитывая позу всего тела — рук, ног, туловища и головы. Это позволяет генерировать более реалистичные и согласованные с движениями человека видеопоследовательности, что открывает новые возможности для VR/AR, робототехники и систем помощи.
Что такое PEVA и как она работает
PEVA — это генеративная модель, основанная на архитектуре трансформеров и диффузионных моделей. На вход подаётся текущий кадр видео и информация о позе тела в виде скелетных ключевых точек. Модель предсказывает следующий кадр, учитывая движение всех частей тела. Такой подход позволяет модели понимать намерения пользователя и предсказывать изменения в сцене, что особенно важно для эгоцентричных видео, где камера движется вместе с человеком.
Почему учёт позы всего тела критичен для эгоцентричного видео
Предсказание видео от первого лица — сложная задача, так как сцена динамически меняется из-за движения камеры. Учёт позы всего тела даёт модели дополнительный контекст: например, если человек поворачивает голову, модель может предсказать, что появится в поле зрения. Без этой информации модель вынуждена полагаться только на визуальные подсказки, что часто приводит к нереалистичным предсказаниям. Исследователи BAIR показали, что PEVA значительно превосходит модели, использующие только визуальную информацию, особенно в сценариях с быстрыми движениями.
Какие данные использовались для обучения PEVA?
Модель обучалась на синтетических и реальных наборах данных с эгоцентричными видео и аннотациями позы. Синтетические данные позволили получить разнообразные сценарии с точной разметкой, а реальные данные — проверить работу модели в естественных условиях. Использование комбинированного подхода повысило обобщающую способность модели.
Применение PEVA в виртуальной и дополненной реальности
В VR/AR-системах реалистичная генерация контента от первого лица критична для погружения. PEVA может предсказывать, как изменится среда при движении пользователя, что позволяет создавать более плавные и естественные виртуальные миры. Например, при повороте головы в шлеме виртуальной реальности модель может заранее сгенерировать соответствующий вид, уменьшая задержки и улучшая впечатления.
Роль PEVA в робототехнике и системах помощи
Роботы, взаимодействующие с людьми, должны предсказывать их действия. PEVA может помочь роботу понять, что человек собирается сделать, на основе его позы. Например, если человек протягивает руку, робот может предсказать, что он хочет взять предмет, и подготовиться к помощи. Это особенно полезно для ассистивных роботов и систем реабилитации.
Как PEVA сравнивается с другими моделями предсказания видео
Большинство существующих моделей предсказания видео от первого лица игнорируют позу тела или учитывают только положение головы. PEVA использует полную позу тела, что даёт ей преимущество в точности. Эксперименты показали, что модель генерирует более реалистичные кадры с меньшим размытием и лучшей согласованностью во времени. Однако пока не раскрыты детали о времени работы в реальном времени и адаптации к новым сценариям без дообучения.
Какие ограничения есть у PEVA?
На данный момент не опубликованы результаты тестов на окклюзиях частей тела, когда, например, рука скрыта за объектом. Также неизвестно, как модель справляется с быстрыми движениями или нестандартными позами. Возможно, потребуется дополнительное обучение для конкретных применений.
Кому будет полезна PEVA
Разработчики VR/AR-систем смогут использовать PEVA для улучшения реалистичности и снижения задержек. Робототехники — для создания более интуитивных интерфейсов взаимодействия. Исследователи в области компьютерного зрения получат новую базовую модель для задач предсказания. Пользователи иммерсивных приложений оценят более естественное взаимодействие.
Будущие направления развития
Исследователи BAIR планируют улучшить модель для работы в реальном времени и расширить её на предсказание более длинных последовательностей. Возможна интеграция с другими модальностями, например, аудио или текстом, для ещё более точного предсказания. Также ожидается открытие исходного кода для сообщества.
PEVA представляет собой важный шаг вперёд в предсказании эгоцентричного видео. Учёт позы всего тела позволяет модели лучше понимать намерения человека и генерировать более реалистичные видеопоследовательности. Это открывает новые возможности для VR/AR, робототехники и других областей, где важно предвидеть действия пользователя.