V-VLAPS: как оценка ценности состояний улучшает планирование роботов в VLA-моделях

Исследователи представили V-VLAPS (Value-Guided Vision-Language-Action Planning and Search) — метод, повышающий качество планирования в моделях Vision-Language-Action (VLA) для роботизированных манипуляций. Этот подход добавляет легковесную голову оценки ценности, обученную на офлайн-траекториях VLA

V-VLAPS: как оценка ценности состояний улучшает планирование роботов в VLA-моделях

Исследователи представили V-VLAPS (Value-Guided Vision-Language-Action Planning and Search) — метод, повышающий качество планирования в моделях Vision-Language-Action (VLA) для роботизированных манипуляций. Этот подход добавляет легковесную голову оценки ценности, обученную на офлайн-траекториях VLA, чтобы предсказывать ожидаемый успех (Monte Carlo returns). Такие предсказания направляют Monte Carlo Tree Search (MCTS) к более перспективным ветвям, что особенно важно в задачах с длинным горизонтом и при распределённом сдвиге.

Почему современные VLA-модели нуждаются в улучшении планирования

Современные VLA-модели демонстрируют сильные априорные действия, однако их реактивное поведение может давать сбои при распределённом сдвиге и в задачах с длинным горизонтом. Существующие методы планирования с VLA используют только априорные вероятности политики и счётчики посещений, что не позволяет исправить неверные предпочтения. V-VLAPS вводит сигнал ценности, что повышает устойчивость планирования и позволяет избежать ошибок, связанных с неоптимальным выбором действий.

Как работает V-VLAPS: оценка ценности и поиск по дереву

V-VLAPS обучает голову ценности на офлайн-данных, полученных из VLA-роллаутов, предсказывая Monte Carlo возвраты. Эта голова ценности затем используется в MCTS для выбора узлов. В экспериментах на пяти наборах задач LIBERO V-VLAPS при стандартном бюджете поиска показал агрегированные результаты, сравнимые с базовым методом без оценки ценности. Анализ показал, что многие жёсткие сбои связаны с корневыми тайм-аутами, где предсказанные ценности слабо разделяются. При увеличении бюджета поиска V-VLAPS улучшил базовый метод во всех наборах задач: +6 процентных пунктов на LIBERO-Object и +4 процентных пункта на LIBERO-10.

Какие задачи решает V-VLAPS в роботизированных манипуляциях?

V-VLAPS особенно эффективен в задачах с длинным горизонтом, где требуется последовательность точных действий. Например, при сборке объектов или перемещении предметов в определённом порядке. Метод помогает роботу лучше оценивать долгосрочные последствия своих действий, что снижает вероятность ошибок и повышает общую успешность выполнения задачи.

Результаты экспериментов и их значение

Эксперименты на наборах данных LIBERO показали, что V-VLAPS превосходит базовые методы при увеличении бюджета поиска. Улучшение на 4–6 процентных пунктов может показаться скромным, но в робототехнике даже небольшой прирост точности критичен для практического применения. Особенно важно, что метод снижает количество корневых тайм-аутов, которые являются одной из основных причин сбоев в планировании.

Кого затронет V-VLAPS

Результаты важны для исследователей и разработчиков в области робототехники, особенно в задачах манипуляции с длинным горизонтом. Метод может быть полезен для создания более надёжных систем автоматизации, например, в промышленных роботах или сервисных роботах. Кроме того, V-VLAPS может быть интегрирован в существующие VLA-модели без значительного увеличения вычислительных затрат.

Что пока неизвестно о V-VLAPS

Неясно, как метод будет работать на реальных роботах, а не только в симуляции. Также требуется дальнейшее исследование для улучшения разделения значений в корневых узлах. Возможно, потребуется адаптация головы ценности под конкретные аппаратные платформы. Кроме того, остаётся открытым вопрос о масштабировании метода на более сложные задачи с большим количеством действий.