GemNav: навигация роботов с помощью замороженной мультимодальной LLM и дискретных токенов

Исследователи представили GemNav — политику визуальной навигации для роботов, которая использует замороженную мультимодальную большую языковую модель (MLLM) и дискретные токены для представления путевых точек. Это позволяет обходиться без отдельного визуального энкодера или непрерывной регрессионной

GemNav: навигация роботов с помощью замороженной мультимодальной LLM и дискретных токенов

Исследователи представили GemNav — политику визуальной навигации для роботов, которая использует замороженную мультимодальную большую языковую модель (MLLM) и дискретные токены для представления путевых точек. Это позволяет обходиться без отдельного визуального энкодера или непрерывной регрессионной головы, снижая требования к данным и вычислительным ресурсам. В отличие от традиционных подходов, GemNav адаптирует предобученную MLLM с помощью Low-Rank Adaptation (LoRA) только на языковой башне, что делает развёртывание более доступным.

Как работает GemNav

GemNav оперирует дискретными токенами, генерируемыми языковой моделью, для представления путевых точек и навигационных сигналов. Вместо непрерывной регрессии, которая обычно требует отдельной головы действий, модель использует кросс-энтропийное обучение для предсказания токенов. Чтобы восстановить метрическую структуру, теряемую при таком обучении, применяется дополнительная потеря soft-decoded. Это позволяет роботу точно следовать заданному маршруту без специального визуального энкодера.

Почему традиционные подходы требуют больше данных?

Традиционные методы визуальной навигации часто полагаются на специализированные визуальные энкодеры, отдельные головы действий и обучение на тысячах часов данных. Это связано с тем, что они должны извлекать пространственные признаки и преобразовывать их в непрерывные команды управления. GemNav обходит это, используя предобученную MLLM, которая уже содержит богатые визуальные и языковые представления. LoRA-адаптация на языковой башне позволяет эффективно настраивать модель для навигационных задач с минимальным объёмом данных.

Результаты и эффективность

Модель обучается на единственном открытом корпусе длительностью 8,7 часов, что примерно на три порядка меньше, чем у конкурентов. Несмотря на это, GemNav демонстрирует zero-shot перенос на четыре физически различных невидимых среды: открытая парковка, парковка с препятствиями, длинный открытый химический двор и складское помещение. В 20 реальных испытаниях робот останавливается на расстоянии 0,25–0,42 м от цели, что сравнимо с подходами, обученными на значительно большем объёме данных.

Как использование коротких историй изображений влияет на производительность?

Использование коротких историй изображений улучшает офлайн-метрики, но не даёт выигрыша в реальных испытаниях. Это указывает на ограниченность временного контекста при наличии предобученных визуальных признаков. Возможно, для динамических сред требуется более длинная временная память, но в статичных условиях текущая архитектура уже достаточно эффективна.

Кого затронет GemNav?

Разработчиков систем навигации роботов, исследователей в области робототехники и мультимодальных LLM, а также компании, заинтересованные в развёртывании навигационных политик с минимальными требованиями к данным. GemNav может быть особенно полезен для стартапов и лабораторий с ограниченными ресурсами, где сбор тысяч часов данных невозможен.

Что пока неизвестно

Неясно, как масштабируется подход на более длинные горизонты планирования и более сложные динамические среды. Также не сообщается о производительности на других типах роботов или в условиях с изменяющимся освещением. Возможно, потребуется дополнительная настройка для работы в условиях плохой видимости или с неголономными платформами.

Заключение

GemNav представляет собой многообещающий шаг к более эффективной визуальной навигации, используя замороженные MLLM и дискретные токены. Снижение требований к данным на три порядка делает эту технологию доступной для широкого круга применений. Дальнейшие исследования должны сосредоточиться на масштабировании и адаптации к динамическим средам.