Роботы научились уклоняться от препятствий без обучения на тысячах часов данных

Исследователи представили метод динамического уклонения от препятствий для автономных роботов, который не требует обучения на тысячах часов данных или использования симуляторов. Вместо этого подход опирается на предобученные модели компьютерного зрения и вычисление времени до столкновения (TTC) для

Роботы научились уклоняться от препятствий без обучения на тысячах часов данных

Исследователи представили метод динамического уклонения от препятствий для автономных роботов, который не требует обучения на тысячах часов данных или использования симуляторов. Вместо этого подход опирается на предобученные модели компьютерного зрения и вычисление времени до столкновения (TTC) для каждого ключевого пикселя. Это позволяет роботам избегать препятствий в реальном времени, используя только одну камеру и минимальные вычислительные ресурсы.

Как работает новый метод уклонения от препятствий Традиционные подходы к уклонению от препятствий либо требуют огромных объёмов размеченных данных для обучения, либо страдают от проблемы переноса из симуляции в реальность — когда модель, обученная в виртуальной среде, плохо работает в реальном мире. Новый метод решает эту проблему, работая исключительно на реальных данных. Для настройки гиперпараметров требуется всего 74 секунды данных, а сама модель не нуждается в дополнительном обучении.

Какие технологии лежат в основе метода Метод использует UniDepth — предобученную модель монокулярной оценки глубины, которая позволяет получать плотные карты глубины из обычного RGB-видео. Это значит, что роботу не нужны дорогие стереокамеры или LiDAR. Для отслеживания ключевых точек применяется пайплайн SuperPoint + SuperGlue, который находит и сопоставляет характерные точки на последовательных кадрах. Затем вычисляется трёхмерное положение этих точек и время до столкновения (TTC) — сколько секунд осталось до контакта с препятствием. На основе минимального TTC выбирается 2D-примитив движения для уклонения, например, поворот влево или вправо.

Почему это важно для робототехники Традиционные методы уклонения от препятствий либо требуют огромных объёмов размеченных данных, либо страдают от проблемы переноса из симуляции в реальность. Новый подход работает исключительно на реальных данных и не требует дополнительного обучения модели — только 74 секунды данных для настройки гиперпараметров. Это делает его особенно привлекательным для разработчиков, которые не имеют доступа к большим наборам данных или мощным вычислительным ресурсам.

Какие результаты показали тесты На реальных данных из набора M3ED точность (precision) метода составила 0.49, полнота (recall) — 0.38 для кадров с TTC менее 1 секунды. В 84% случаев верно определяется направление уклонения. Метод обнаружил хотя бы один опасный кадр для 20 из 22 уникальных физических препятствий. Это означает, что робот способен заметить большинство препятствий и правильно выбрать сторону для уклонения в подавляющем большинстве ситуаций.

Кого затронет эта технология Разработчиков автономных мобильных роботов, особенно работающих в неструктурированных outdoor-средах — например, в доставке, сельском хозяйстве, поисково-спасательных операциях. Также метод представляет интерес для исследователей в области компьютерного зрения и робототехники, которые ищут способы снизить зависимость от больших данных и симуляторов.

Какие ограничения пока остаются Не указана производительность в реальном времени — скорость обработки кадров может быть критичной для высокоскоростных роботов. Также неясно, как метод ведёт себя при большом количестве одновременно движущихся объектов или в условиях плохой освещённости. Эти аспекты требуют дальнейших исследований.

Перспективы развития метода В будущем авторы планируют интегрировать метод с более сложными контроллерами движения и протестировать его на реальных роботах в динамичных сценах. Также возможно улучшение точности за счёт использования более современных моделей глубины и трекинга. Пока что метод демонстрирует, что для базового уклонения от препятствий не нужны тысячи часов данных — достаточно умного использования существующих моделей компьютерного зрения.