Нейро-символический планировщик EvoPlan: безопасное управление роботами с гарантиями
Исследователи представили EvoPlan — нейро-символический фреймворк для планирования действий роботов, который объединяет гибкость больших языковых моделей с формальными гарантиями безопасности. Система работает полностью локально, без облачных зависимостей, и использует эволюционный подход для генера

Исследователи представили EvoPlan — нейро-символический фреймворк для планирования действий роботов, который объединяет гибкость больших языковых моделей с формальными гарантиями безопасности. Система работает полностью локально, без облачных зависимостей, и использует эволюционный подход для генерации и верификации планов. Это важный шаг к созданию надежных автономных роботов, способных работать в реальных условиях.
Современные LLM-планировщики умеют генерировать естественные и контекстно-зависимые планы, но не могут гарантировать их безопасность. Классические PDDL-планировщики, напротив, обеспечивают формальную верификацию, но требуют полной спецификации задачи и не адаптируются к нестандартным ситуациям. EvoPlan объединяет сильные стороны обоих подходов: LLM отвечает за генерацию и исправление планов, а формальные верификаторы (PDDL и Signal Temporal Logic) проверяют их на выполнимость и безопасность. Такой симбиоз позволяет достичь гибкости без потери надежности, что критически важно для робототехники.
Архитектура и ключевые компоненты
EvoPlan состоит из трех основных модулей, каждый из которых решает свою задачу.
Как извлекаются временные логические ограничения из демонстрационных данных?
Первый компонент — офлайн-вывод STL-ограничений. Из демонстрационных данных, например, из набора nuPlan для автономного вождения, система извлекает временные логические правила. Эти правила описывают безопасное поведение, такое как обязательная остановка на красный свет или соблюдение дистанции. Для сценариев, где негативные примеры отсутствуют, используются контрфактические возмущения и LLM-генератор нарушений. Затем ограничение подгоняется с помощью эволюционного поиска, что позволяет адаптировать правила к конкретной среде.
Как работает эволюционный PDDL-планировщик?
Второй компонент — эволюционный PDDL-планировщик. LLM предлагает начальный план, который затем итеративно улучшается. Программные валидаторы отсеивают невыполнимые варианты, а проверенная часть плана постепенно растет. Тестирование на бенчмарке ALFWorld Text показало, что EvoPlan превосходит сильные базовые модели и демонстрирует устойчивость к несовпадению словаря целей и действий. Это означает, что система способна работать даже с неполными или неточными описаниями задачи.
Как обеспечивается безопасность во время выполнения?
Третий компонент — цикл выполнения с ограничениями. План компилируется в последовательность путевых точек, которые проверяются на соответствие извлеченным STL-ограничениям. Если возникает нарушение, запускается перепланирование. Полный пайплайн был продемонстрирован в симуляторе Gazebo, что подтверждает его работоспособность в смоделированных условиях.
Значение для робототехники и ИИ
EvoPlan представляет собой шаг к практическому применению ИИ в робототехнике, где безопасность является критическим требованием. Разработчики систем автономного вождения, навигационных роботов и исследователи в области нейро-символического ИИ получат инструмент, который сочетает гибкость обучения с формальной верификацией. Потенциально технология может быть использована в любых сценариях, где роботы работают в реальном мире с высокими требованиями к безопасности.
Ограничения и нерешенные вопросы
На данный момент производительность EvoPlan продемонстрирована только в симуляции, а не на реальных роботах. Кроме того, масштабируемость эволюционного поиска для сложных многозадачных сценариев остается под вопросом. Также неясно, как извлеченные ограничения обобщаются на новые ситуации, не представленные в демонстрационных данных. Эти аспекты требуют дальнейших исследований.
Тем не менее, EvoPlan задает новое направление в области нейро-символического планирования, показывая, что формальные гарантии и гибкость могут сосуществовать. Будущие работы, вероятно, будут направлены на улучшение масштабируемости и тестирование в реальных условиях.