Google DeepMind Gemini 2.5 Computer Use: модель для управления интерфейсами
Google DeepMind представила Gemini 2.5 Computer Use — новую модель, которая позволяет искусственному интеллекту напрямую взаимодействовать с экраном компьютера. Она доступна в предварительной версии через API и построена на базе Gemini 2.5 Pro, самой мощной модели компании. Это шаг к созданию ИИ-аге

Google DeepMind представила Gemini 2.5 Computer Use — новую модель, которая позволяет искусственному интеллекту напрямую взаимодействовать с экраном компьютера. Она доступна в предварительной версии через API и построена на базе Gemini 2.5 Pro, самой мощной модели компании. Это шаг к созданию ИИ-агентов, способных выполнять действия, подобно человеку: кликать, заполнять формы, навигировать по меню. Разработчики уже могут протестировать её в Google AI Studio и Vertex AI.
Как работает Gemini 2.5 Computer Use
Модель использует мультимодальные возможности Gemini 2.5 Pro, чтобы анализировать визуальную структуру интерфейсов. Она не просто распознаёт текст на экране, а понимает, где находятся кнопки, поля ввода, выпадающие списки и другие элементы. После анализа модель генерирует последовательность действий: перемещение курсора, нажатие клавиш, скроллинг. Это позволяет ей выполнять сложные многошаговые задачи, например, заполнение формы на сайте или настройку приложения.
Какие задачи может решать эта модель?
Gemini 2.5 Computer Use предназначена для автоматизации рутинных операций, которые требуют визуального восприятия. Например, она может открыть веб-страницу, найти нужную информацию, скопировать её в документ и отправить по электронной почте. Разработчики могут интегрировать модель в свои агенты для тестирования программного обеспечения, сбора данных или управления корпоративными системами. В отличие от традиционных RPA-решений, которые полагаются на жёсткие скрипты, Gemini 2.5 Computer Use адаптируется к изменениям интерфейса, что делает её более гибкой.
Почему это важно для индустрии ИИ
До сих пор большинство ИИ-агентов работали через текстовые или API-интерфейсы. Gemini 2.5 Computer Use открывает путь к агентам, которые могут "видеть" экран и выполнять действия, как человек. Это приближает ИИ к полноценному автономному использованию компьютера. Например, модель может помочь людям с ограниченными возможностями управлять компьютером голосом или стать основой для персональных ассистентов, которые выполняют задачи без участия пользователя.
Как это повлияет на разработчиков и бизнес?
Для разработчиков это означает появление нового инструмента для создания агентов, которые взаимодействуют с любым графическим интерфейсом. Компании, использующие RPA, смогут заменить скрипты на ИИ-агентов, способных обрабатывать нестандартные ситуации. Тестировщики ПО получат возможность автоматизировать проверку пользовательских сценариев. Конечные пользователи могут ожидать более умных ассистентов, которые не просто отвечают на вопросы, а выполняют действия на компьютере.
Что пока неизвестно о Gemini 2.5 Computer Use
Google пока не раскрыла точные лимиты производительности модели, стоимость API и дату общего доступа. Также неясно, насколько хорошо она справляется с динамическими интерфейсами, такими как видео или анимации. Предварительная версия доступна ограниченному кругу разработчиков, и компания собирает обратную связь для улучшения модели. Ожидается, что в будущем Gemini 2.5 Computer Use станет частью более широкой экосистемы ИИ-агентов от Google.
Как начать использовать Gemini 2.5 Computer Use
Чтобы получить доступ, разработчикам нужно зарегистрироваться в Google AI Studio или Vertex AI и запросить предварительную версию. Модель работает через API, и для неё потребуется настроить окружение. Google предоставляет документацию и примеры кода для быстрого старта. Пока доступ ограничен, но компания планирует расширить его в ближайшие месяцы.
Будущее автономных ИИ-агентов
Gemini 2.5 Computer Use — это шаг к созданию ИИ, который может самостоятельно управлять компьютером. В сочетании с другими моделями Google, такими как Gemini 2.5 Pro, она может стать основой для агентов, способных выполнять сложные задачи без участия человека. Это изменит подход к автоматизации и откроет новые возможности для бизнеса и разработчиков.