Google DeepMind представила Gemini Robotics 2: ИИ с интеллектом всего тела для роботов
12 марта 2025 года Google DeepMind анонсировала Gemini Robotics 2 — новое поколение ИИ-моделей для робототехники, способное обрабатывать сенсорную информацию от всего тела робота одновременно. Это позволяет выполнять сложные задачи с высокой точностью и адаптивностью, что знаменует переход от узкосп
12 марта 2025 года Google DeepMind анонсировала Gemini Robotics 2 — новое поколение ИИ-моделей для робототехники, способное обрабатывать сенсорную информацию от всего тела робота одновременно. Это позволяет выполнять сложные задачи с высокой точностью и адаптивностью, что знаменует переход от узкоспециализированных промышленных роботов к универсальным машинам. Система уже вызвала широкий резонанс в инженерном сообществе благодаря интеграции тактильных и проприоцептивных данных.
Предыстория и контекст
Разработка Gemini Robotics 2 стала логическим продолжением многолетних исследований DeepMind в области робототехники с использованием обучения с подкреплением. Первая версия Gemini Robotics, анонсированная в 2024 году, уже демонстрировала способность роботов планировать действия на основе визуальной информации. Однако ключевым ограничением была задержка между обработкой данных и выполнением движений — система не могла одновременно учитывать сигналы от всех датчиков тела.
Проблема «целостного интеллекта» долгое время оставалась одним из главных вызовов в робототехнике. Большинство современных промышленных роботов управляются по принципу «рука-глаз»: камера направляет манипулятор, но остальные части корпуса остаются пассивными или программируются отдельно. Gemini Robotics 2 решает эту задачу за счет сквозной нейронной сети, которая объединяет потоки данных от камер, тактильных датчиков и инерциальных измерительных блоков в единую модель управления.
Интересно, что параллельно с DeepMind аналогичные исследования ведут компании Meta (проект Habitat) и Tesla (Optimus), но ни одна из них пока не представила работающий прототип с «интеллектом всего тела». Таким образом, анонс Gemini Robotics 2 можно считать значимым шагом вперед в области универсальной робототехники.
Как работает «интеллект всего тела»?
В основе Gemini Robotics 2 лежит концепция «сквозного обучения» (end-to-end learning). Вместо того чтобы программировать отдельные модули для зрения, осязания и моторики, инженеры DeepMind обучили единую нейронную сеть на огромном массиве данных — симуляциях и реальных экспериментах. Сеть получает на вход сырые показания датчиков, а на выходе генерирует команды для всех исполнительных механизмов робота одновременно.
Ключевое новшество — использование так называемых «тактильных карт» (tactile maps), которые позволяют роботу чувствовать не только точку контакта, но и распределение давления по всей поверхности тела. Это особенно важно при манипуляции хрупкими или скользкими объектами. Например, в демонстрационном ролике робот уверенно держит яйцо, не разбивая его, и одновременно открывает дверь другой рукой, сохраняя равновесие на наклонной плоскости.
Технические подробности и сравнение с конкурентами
Архитектура Gemini Robotics 2 построена на Transformer-подобной сети с механизмом внимания, адаптированным для обработки временных рядов и мультимодальных данных. DeepMind не раскрывает точное количество параметров, но отмечает, что модель работает на встроенном оборудовании с задержкой менее 10 миллисекунд — это критично для реального времени.
Сравнение с конкурентами: роботы Boston Dynamics (например, Atlas) демонстрируют впечатляющую динамику, но их движения жестко запрограммированы и не адаптируются к неожиданным изменениям среды. Роботы Figure AI, напротив, используют нейросети, но пока не могут одновременно управлять всеми конечностями. Gemini Robotics 2 сочетает оба подхода: адаптивность нейросетей и физическую точность традиционных контроллеров.
Важно отметить, что система не требует предварительного программирования для каждой новой задачи. Робот способен обобщать опыт: если он научился открывать дверь, то сможет применить этот навык к двери другой формы, просто «почувствовав» ее рукой. Это достигается за счет симуляционного обучения с доменной рандомизацией — параметры окружения меняются случайным образом, что заставляет модель искать инвариантные стратегии.
Кого затронет и как
Разработка Gemini Robotics 2 имеет потенциальное влияние на несколько отраслей. В промышленности такие роботы могут заменить людей на операциях сборки, где требуется деликатное обращение с деталями — например, в электронике или фармацевтике. В логистике они способны сортировать хрупкие товары без повреждений. В домашней сфере — помогать пожилым людям с бытовыми задачами, такими как приготовление пищи или уборка.
Для разработчиков и исследователей DeepMind обещает выпустить API и симуляционную среду для тестирования моделей, что ускорит внедрение технологии. В России и странах СНГ интерес к таким решениям растет, особенно в контексте автоматизации производств, но пока нет локальных аналогов. Однако ограничением может стать стоимость: для работы Gemini Robotics 2 требуется мощное вычислительное оборудование, которое может быть недоступно малому бизнесу.
Что будет дальше
DeepMind планирует продолжить обучение модели в более сложных сценариях, включая взаимодействие с людьми в неструктурированной среде. Ожидается, что первые коммерческие внедрения появятся в течение двух-трех лет, причем в партнерстве с производителями роботов, такими как Apptronik или Agility Robotics. Также возможно открытие части наработок для академического сообщества, чтобы стимулировать развитие безопасной робототехники.
В более отдаленной перспективе «интеллект всего тела» может стать основой для роботов-аватаров, управляемых удаленно через интернет, или для полностью автономных сервисных роботов. Однако остаются вопросы безопасности: как гарантировать, что робот не причинит вред человеку при случайном касании? DeepMind утверждает, что встроенные механизмы ограничения силы и обучение с подкреплением с учетом безопасности являются приоритетом.
Итог
Gemini Robotics 2 от Google DeepMind знаменует переход от узкоспециализированных промышленных роботов к универсальным машинам, способным адаптироваться к реальному миру. «Интеллект всего тела» — не просто маркетинговый термин, а реальный прорыв в интеграции сенсорики и моторики. Следить за развитием этой технологии стоит всем, кто интересуется будущим автоматизации, — она может изменить не только производство, но и нашу повседневную жизнь.