SpaR3D-MoE: Новая архитектура для 3D-пространственного мышления в мультимодальных LLM
Мультимодальные большие языковые модели (MLLM) достигли впечатляющих успехов в понимании изображений и текста, но их способность работать с трехмерным пространством остается ограниченной. Основная проблема — разрыв между двумерным семантическим пониманием и трехмерной геометрией сцены. Новая архитек

Мультимодальные большие языковые модели (MLLM) достигли впечатляющих успехов в понимании изображений и текста, но их способность работать с трехмерным пространством остается ограниченной. Основная проблема — разрыв между двумерным семантическим пониманием и трехмерной геометрией сцены. Новая архитектура SpaR3D-MoE, представленная на arXiv, предлагает сквозной фреймворк, который решает эту задачу, используя только разреженные RGB-изображения. Система достигает state-of-the-art результатов на бенчмарках VSI-Bench, ScanQA и SQA3D, что открывает новые возможности для навигации, робототехники и автономного вождения.
Почему современные MLLM плохо справляются с 3D-задачами
Современные мультимодальные модели часто терпят неудачу в задачах, требующих пространственного мышления, из-за несовместимости представлений между 2D-смыслами и 3D-геометрией. Существующие подходы обычно требуют дорогостоящих 3D-данных, таких как облака точек или глубинные карты, что ограничивает их применение. Другие методы используют эвристическую выборку кадров из видео, но это нарушает пространственно-временную связность сцены. Кроме того, монолитное слияние мультимодальных токенов часто приводит к конфликту модальностей, когда визуальная и текстовая информация мешают друг другу. SpaR3D-MoE преодолевает эти ограничения, вводя адаптивную выборку ключевых кадров и гетерогенный Mixture-of-Experts с маршрутизацией на основе инструкций и позы.
Как работает SpaR3D-MoE
Фреймворк состоит из двух ключевых компонентов. Первый — адаптивная выборка на основе пространственно-временного многообразия. Вместо случайного или равномерного выбора кадров, этот метод строит граф, который сохраняет топологическую связность сцены. Затем извлекаются наиболее информативные ключевые кадры, что снижает избыточность и улучшает понимание пространственных отношений. Второй компонент — гетерогенный геометрически-индуктивный Mixture-of-Experts. В отличие от традиционных подходов, где все токены обрабатываются одинаково, здесь используется роутер, учитывающий инструкции пользователя и позу камеры. Это позволяет адаптивно распределять мультимодальные токены по специализированным экспертам, каждый из которых обучен обрабатывать определенный тип информации. Таким образом, конфликт модальностей разрешается, а модель лучше понимает пространственные запросы.
Какие результаты показывает SpaR3D-MoE на бенчмарках?
Эффективность SpaR3D-MoE подтверждена экспериментами на нескольких эталонных наборах данных. На бенчмарке VSI-Bench, который оценивает понимание пространственных отношений в сценах, средний балл модели составил 63,5, что на 7,8 пункта выше, чем у лучшего бейзлайна. Особенно впечатляющие результаты достигнуты в задачах Route Plan и Relative Direction — улучшение составило 35,4% и 51,4% соответственно. Это означает, что модель не только лучше понимает, где находятся объекты, но и способна планировать маршруты и определять относительное расположение. На бенчмарках ScanQA и SQA3D, которые включают вопросы по 3D-сценам, SpaR3D-MoE также превзошел существующие методы, демонстрируя превосходство в точности ответов.
Кому будет полезна новая архитектура
Разработка SpaR3D-MoE затрагивает широкий круг специалистов. В первую очередь, это исследователи и инженеры, работающие над мультимодальными AI-системами. Архитектура предлагает эффективный способ интеграции 3D-пространственного мышления без необходимости в дорогих 3D-сенсорах. Компании, занимающиеся навигацией и автономным вождением, могут использовать SpaR3D-MoE для улучшения понимания сцены по обычным камерам. В робототехнике модель может помочь роботам лучше ориентироваться в пространстве и выполнять задачи, требующие пространственного планирования. Кроме того, архитектура может быть полезна для систем дополненной реальности и виртуальной реальности, где важно точное понимание трехмерного окружения.
Ограничения и нерешенные вопросы
Несмотря на впечатляющие результаты, SpaR3D-MoE имеет некоторые ограничения. В статье не указаны требования к вычислительным ресурсам и времени инференса. Поскольку модель использует Mixture-of-Experts, она может быть требовательна к памяти и вычислительной мощности, что может затруднить ее применение на устройствах с ограниченными ресурсами. Также неясно, насколько хорошо метод обобщается на реальные сцены с большим количеством объектов и динамическими элементами. Бенчмарки, на которых тестировалась модель, в основном содержат статичные сцены, поэтому поведение в динамической среде требует дополнительного изучения. Будущие исследования могут быть направлены на оптимизацию производительности и тестирование в более реалистичных условиях.