MoGe4D: генерация интерактивных 4D-сцен из одного изображения

Создание динамических трехмерных сцен по единственной фотографии — задача, которая долгое время оставалась вызовом для компьютерного зрения. Новый фреймворк MoGe4D, описанный в препринте на arXiv, предлагает принципиально иной подход: он моделирует сцену как плотные 4D-траектории точек, объединяя ге

MoGe4D: генерация интерактивных 4D-сцен из одного изображения

Создание динамических трехмерных сцен по единственной фотографии — задача, которая долгое время оставалась вызовом для компьютерного зрения. Новый фреймворк MoGe4D, описанный в препринте на arXiv, предлагает принципиально иной подход: он моделирует сцену как плотные 4D-траектории точек, объединяя геометрию и движение в едином процессе. Это позволяет генерировать интерактивные видео с произвольными траекториями камеры, сохраняя пространственно-временную согласованность.

Как работает MoGe4D

В основе MoGe4D лежит идея представления динамической сцены через траектории точек в четырехмерном пространстве (3D + время). В отличие от традиционных методов, которые сначала восстанавливают геометрию, а затем отдельно предсказывают движение, новый фреймворк решает обе задачи совместно. Это устраняет типичные несоответствия между формой объекта и его перемещением.

Ключевой компонент — диффузионный генератор траекторий 4D-STraG. Он принимает на вход одно изображение и предсказывает поле траекторий для каждой точки сцены. Генератор обучен на специально созданном датасете TrajScene-60K, который содержит 60 000 видео с плотными 4D-траекториями. Чтобы уменьшить неоднозначность масштаба, используется depth-guided motion normalization — стратегия, нормализующая движение с учетом глубины.

Почему это прорыв

Существующие методы генерации 4D-сцен часто страдают от артефактов: объекты могут «плыть» или неестественно деформироваться при смене ракурса. MoGe4D решает эту проблему благодаря встроенному модулю восприятия движения (Motion Perception Module, MPM), который внедряет априорные знания о типичных движениях. В результате сцены выглядят реалистично даже при сложных перемещениях камеры.

Для визуализации используется модуль синтеза видов 4D-ViSM. Он рендерит 4D-представление в видео, позволяя пользователю свободно менять точку обзора. Эксперименты показывают, что качество генерации значительно выше, чем у аналогов, а временная когерентность сохраняется на протяжении всей последовательности.

Кому пригодится MoGe4D

Разработчики компьютерного зрения получат инструмент для создания динамических сцен без трудоемкого сбора данных. Создатели контента для VR/AR смогут быстро превращать обычные фото в интерактивные окружения. Специалисты по 3D-графике и анимации оценят возможность автоматизировать рутинные этапы работы. Исследователи генеративных моделей найдут в MoGe4D платформу для экспериментов с пространственно-временными представлениями.

Какие ограничения остаются

Пока не раскрыта производительность фреймворка в реальном времени — возможно, для работы потребуются мощные GPU. Также неизвестно, как MoGe4D справляется со сложными сценами, содержащими множество объектов или тонкие структуры. Отсутствуют результаты сравнения на стандартных бенчмарках, таких как DAVIS или Kubric, что затрудняет объективную оценку.

Где найти код

Исследователи опубликовали код на GitHub, что позволяет сообществу протестировать фреймворк и адаптировать его под свои задачи. Это открывает путь к дальнейшим улучшениям и интеграции с другими системами.

Заключение

MoGe4D представляет собой значительный шаг вперед в генерации интерактивных 4D-сцен. Объединяя геометрию и движение в едином диффузионном процессе, он достигает высокой реалистичности и согласованности. Хотя остаются вопросы по производительности и масштабируемости, опубликованный код и датасет дают сообществу инструменты для дальнейших исследований.