Mixture-of-Experts улучшает динамическую реконструкцию 3D-сцен с Gaussian Splatting

Динамическая реконструкция трехмерных сцен по видеоряду — одна из самых сложных задач в компьютерном зрении. Исследователи из нескольких университетов предложили новый подход, основанный на архитектуре Mixture-of-Experts (MoE), который значительно повышает качество синтеза новых видов в сценах с раз

Mixture-of-Experts улучшает динамическую реконструкцию 3D-сцен с Gaussian Splatting

Динамическая реконструкция трехмерных сцен по видеоряду — одна из самых сложных задач в компьютерном зрении. Исследователи из нескольких университетов предложили новый подход, основанный на архитектуре Mixture-of-Experts (MoE), который значительно повышает качество синтеза новых видов в сценах с разнородными движениями. В работе «On the Design of Mixture-of-Experts for Dynamic Gaussian Splatting» авторы представили две архитектуры: Mixture of Deformation Experts (MoDE) и MoE-GS, каждая из которых по-своему интегрирует специализированные эксперты деформации.

Почему традиционные методы не справляются с динамикой

Современные методы динамической реконструкции, такие как Deformable 3D Gaussians, обычно используют одну модель деформации для всего объекта или сцены. Это накладывает серьезные ограничения: если в сцене присутствуют движения разного типа — например, быстрое перемещение автомобиля и медленное колыхание деревьев — единая модель не может одинаково хорошо описать обе деформации. В результате страдает качество синтеза новых видов, появляются артефакты, а детали движений теряются.

Как Mixture-of-Experts решает проблему

Идея MoE заключается в том, чтобы вместо одной модели использовать несколько специализированных «экспертов», каждый из которых отвечает за определенный тип деформации. Дополнительный модуль-маршрутизатор решает, к какому эксперту обратиться для каждого участка сцены. Это позволяет системе адаптироваться к разнородным движениям без необходимости увеличивать общую сложность модели.

В контексте Gaussian Splatting — метода, представляющего сцену в виде набора трехмерных гауссиан, — MoE встраивается в процесс деформации. Каждый эксперт учится преобразовывать каноническое (неподвижное) положение гауссиан в деформированное для конкретного кадра. При этом эксперты могут специализироваться: один отвечает за жесткие движения, другой — за нежесткие, третий — за мелкие детали.

Две архитектуры: MoDE и MoE-GS

Авторы предложили два способа интеграции экспертов. Первый, MoDE (Mixture of Deformation Experts), предполагает совместную оптимизацию всех экспертов с общим каноническим представлением. Эксперты делят между собой одни и те же гауссианы, но каждый применяет свою деформацию. Маршрутизатор определяет, какой эксперт доминирует для каждой гауссианы. Это напоминает мягкое взвешивание вкладов экспертов.

Второй подход, MoE-GS, использует независимую оптимизацию экспертов. Каждый эксперт работает со своей копией неканонического представления, а их результаты объединяются на этапе маршрутизации. Такой подход более гибкий, но требует больше памяти и вычислительных ресурсов. Оба метода реализованы в открытом коде на GitHub, что позволяет другим исследователям воспроизвести результаты и адаптировать их под свои задачи.

Какие преимущества дает такой подход?

Эксперименты показали, что MoDE и MoE-GS превосходят существующие методы (включая базовый Deformable 3D Gaussians) по метрикам PSNR, SSIM и LPIPS на стандартных датасетах динамических сцен. Особенно заметен выигрыш в сценах с несколькими объектами, движущимися с разной скоростью. Например, на сцене с проезжающей машиной и идущим человеком качество синтеза новых видов улучшилось на 1-2 дБ по PSNR.

Кроме того, MoE-архитектура оказалась более устойчивой к шуму в данных. Если входной видеоряд содержит помехи, традиционные методы начинают «дрожать», а MoE за счет специализации экспертов лучше фильтрует шум. Однако при сильном шуме или разреженных данных (например, всего несколько кадров) преимущество снижается — это ограничение авторы планируют изучить в будущем.

Кому это нужно и где применять

Разработчики алгоритмов 3D-реконструкции получат готовые инструменты для повышения качества динамических сцен. Исследователи в области компьютерного зрения смогут использовать MoE как новый строительный блок для своих моделей. Создатели приложений виртуальной и дополненной реальности, а также кинопроизводства, где требуется синтез новых видов с высоким реализмом, смогут внедрить эти методы для улучшения пользовательского опыта.

Какие вопросы остаются открытыми?

На данный момент нет полного сравнения с другими современными методами, такими как Neural Radiance Fields (NeRF) с динамикой. Также неясно, как поведет себя MoE на сильно зашумленных или разреженных данных — авторы признают, что это область для дальнейших исследований. Кроме того, выбор количества экспертов и архитектуры маршрутизатора пока остается эмпирическим.

Тем не менее, работа демонстрирует, что Mixture-of-Experts — перспективное направление для динамической реконструкции. Возможно, в будущем такие методы станут стандартом для задач, где требуется точное моделирование сложных движений.