GemNav: навигация роботов с помощью замороженной мультимодальной LLM и дискретных токенов
Исследователи представили GemNav — политику визуальной навигации для роботов, которая использует замороженную мультимодальную большую языковую модель (MLLM) и дискретные токены для представления путевых точек. Это позволяет обходиться без отдельного визуального энкодера или непрерывной регрессионной

Исследователи представили GemNav — политику визуальной навигации для роботов, которая использует замороженную мультимодальную большую языковую модель (MLLM) и дискретные токены для представления путевых точек. Это позволяет обходиться без отдельного визуального энкодера или непрерывной регрессионной головы, снижая требования к данным и вычислительным ресурсам. В отличие от традиционных подходов, GemNav адаптирует предобученную MLLM с помощью Low-Rank Adaptation (LoRA) только на языковой башне, что делает развёртывание более доступным.
Как работает GemNav
GemNav оперирует дискретными токенами, генерируемыми языковой моделью, для представления путевых точек и навигационных сигналов. Вместо непрерывной регрессии, которая обычно требует отдельной головы действий, модель использует кросс-энтропийное обучение для предсказания токенов. Чтобы восстановить метрическую структуру, теряемую при таком обучении, применяется дополнительная потеря soft-decoded. Это позволяет роботу точно следовать заданному маршруту без специального визуального энкодера.
Почему традиционные подходы требуют больше данных?
Традиционные методы визуальной навигации часто полагаются на специализированные визуальные энкодеры, отдельные головы действий и обучение на тысячах часов данных. Это связано с тем, что они должны извлекать пространственные признаки и преобразовывать их в непрерывные команды управления. GemNav обходит это, используя предобученную MLLM, которая уже содержит богатые визуальные и языковые представления. LoRA-адаптация на языковой башне позволяет эффективно настраивать модель для навигационных задач с минимальным объёмом данных.
Результаты и эффективность
Модель обучается на единственном открытом корпусе длительностью 8,7 часов, что примерно на три порядка меньше, чем у конкурентов. Несмотря на это, GemNav демонстрирует zero-shot перенос на четыре физически различных невидимых среды: открытая парковка, парковка с препятствиями, длинный открытый химический двор и складское помещение. В 20 реальных испытаниях робот останавливается на расстоянии 0,25–0,42 м от цели, что сравнимо с подходами, обученными на значительно большем объёме данных.
Как использование коротких историй изображений влияет на производительность?
Использование коротких историй изображений улучшает офлайн-метрики, но не даёт выигрыша в реальных испытаниях. Это указывает на ограниченность временного контекста при наличии предобученных визуальных признаков. Возможно, для динамических сред требуется более длинная временная память, но в статичных условиях текущая архитектура уже достаточно эффективна.
Кого затронет GemNav?
Разработчиков систем навигации роботов, исследователей в области робототехники и мультимодальных LLM, а также компании, заинтересованные в развёртывании навигационных политик с минимальными требованиями к данным. GemNav может быть особенно полезен для стартапов и лабораторий с ограниченными ресурсами, где сбор тысяч часов данных невозможен.
Что пока неизвестно
Неясно, как масштабируется подход на более длинные горизонты планирования и более сложные динамические среды. Также не сообщается о производительности на других типах роботов или в условиях с изменяющимся освещением. Возможно, потребуется дополнительная настройка для работы в условиях плохой видимости или с неголономными платформами.
Заключение
GemNav представляет собой многообещающий шаг к более эффективной визуальной навигации, используя замороженные MLLM и дискретные токены. Снижение требований к данным на три порядка делает эту технологию доступной для широкого круга применений. Дальнейшие исследования должны сосредоточиться на масштабировании и адаптации к динамическим средам.