Pelican-VLA 0.5: новая архитектура VLA с обобщением внимания без специального обучения

Новая архитектура Pelican-VLA 0.5 объединяет понимание визуально-языковых инструкций, генерацию будущих кадров и предсказание действий в единой модели. Её ключевая особенность — способность фокусироваться на объекте, указанном в инструкции, и области контакта без использования разметки объектов, сег

Pelican-VLA 0.5: новая архитектура VLA с обобщением внимания без специального обучения

Новая архитектура Pelican-VLA 0.5 объединяет понимание визуально-языковых инструкций, генерацию будущих кадров и предсказание действий в единой модели. Её ключевая особенность — способность фокусироваться на объекте, указанном в инструкции, и области контакта без использования разметки объектов, сегментационных масок или тонкой настройки под конкретную задачу. Это открывает путь к созданию более универсальных роботизированных систем, которые могут адаптироваться к новым сценариям без дорогостоящей аннотации данных.

Что такое Pelican-VLA 0.5 и как она работает

Pelican-VLA 0.5 — это визуально-языковая модель действий (VLA), которая объединяет три ключевые функции: понимание инструкций на естественном языке, генерацию будущих кадров и предсказание действий. В отличие от традиционных подходов, где каждая задача требует отдельного обучения, эта модель использует обучаемые Reasoning Slots, вставленные между модулями восприятия и действия. Эти слоты действуют как компактный узкий канал, через который передаётся только релевантная визуальная информация. Такой механизм индуцирует манипуляционно-центрированное внимание во время предварительного обучения, позволяя модели сосредотачиваться на ключевых объектах и областях контакта без явной супервизии.

Почему это важно для робототехники

Способность модели фокусироваться на релевантных объектах без специального обучения на разметке является важным шагом к созданию более универсальных и эффективных роботизированных систем. Традиционные подходы требуют огромных наборов размеченных данных, включая сегментационные маски и аннотации объектов, что делает их дорогими и трудоёмкими. Pelican-VLA 0.5 снижает эту потребность, так как её внимание обучается автоматически в процессе предварительного обучения на задачах. Это упрощает адаптацию к новым сценариям и роботам, что критически важно для промышленного применения.

Как Pelican-VLA 0.5 достигает обобщения внимания без обучения?

Секрет кроется в архитектуре с Reasoning Slots. Эти слоты, расположенные между визуальным кодировщиком и модулем действий, сжимают информацию до компактного представления. Во время предварительного обучения модель учится выделять только те визуальные признаки, которые необходимы для выполнения инструкции. Например, если инструкция гласит «возьми красную чашку», слоты фокусируются на красной чашке и области захвата, игнорируя фон и другие объекты. Это поведение сохраняется при различных структурах политики, включая архитектуру Mixture of Tokens (MoT), и остаётся устойчивым на невидимых сценах и с невидимыми роботами. Эксперименты показывают, что Pelican-VLA 0.5 значительно превосходит другие открытые VLA-модели в задачах, требующих точного внимания к объектам.

Детали архитектуры и экспериментов

Pelican-VLA 0.5 использует модульную структуру: визуальный кодировщик (например, ViT), языковой кодировщик (BERT или GPT) и модуль действий. Reasoning Slots — это набор обучаемых векторов, которые взаимодействуют с визуальными признаками через механизм перекрёстного внимания. После обработки слоты передают сжатое представление в модуль действий, который генерирует последовательность действий (например, перемещения манипулятора). В экспериментах модель тестировалась на симуляционных сценариях с различными объектами и инструкциями. Результаты показали, что внимание модели стабильно фокусируется на указанном объекте и области контакта, даже если объект не встречался во время обучения. Это подтверждает обобщение на уровне внимания.

Кого затронет эта технология

Разработчиков роботизированных систем, исследователей в области обучения роботов и компьютерного зрения, а также инженеров, работающих над интеграцией языковых моделей с управлением роботами. Pelican-VLA 0.5 может быть полезна для задач манипуляции, где требуется точное следование инструкциям, например, на складах, в производстве или домашней робототехнике. Она также упрощает перенос модели на новые аппаратные платформы без переобучения.

Что пока неизвестно

Несмотря на многообещающие результаты, полные сравнения с другими современными VLA-моделями пока не опубликованы. Кроме того, модель протестирована только в симуляции или на ограниченном наборе сценариев. Оценка производительности в реальных роботизированных задачах, таких как сборка или уход за больными, ещё предстоит. Также неясно, как модель справляется с динамическими средами и многозадачностью. Будущие исследования должны прояснить эти аспекты.

Будущее VLA-моделей

Pelican-VLA 0.5 представляет собой шаг к более автономным и адаптивным роботам. Сочетание понимания языка, предсказания будущего и генерации действий в одной архитектуре с автоматическим вниманием может снизить барьеры для внедрения роботов в реальные приложения. Если модель подтвердит свою эффективность в реальных задачах, она может стать основой для следующего поколения роботизированных систем, которые учатся на ходу и требуют минимального вмешательства человека.