AI-агенты для кодинга уязвимы к sandbox-эскейпам: исследование
Исследователи обнаружили, что популярные AI-агенты для написания кода могут быть взломаны через sandbox-эскейпы, несмотря на заявления о безопасности. Уязвимость позволяет злоумышленникам манипулировать выводами агентов и внедрять вредоносный код.

Исследователи выявили критические уязвимости в AI-агентах для программирования, которые позволяют злоумышленникам обходить песочницы (sandbox) и внедрять вредоносный код в процесс разработки. Это ставит под сомнение заявления о безопасности таких инструментов, как GitHub Copilot, Cursor и других.
Уязвимость sandbox-эскейпов в AI-агентах
Специалисты по безопасности из компании [Invariant Labs](https://invariantlabs.ai/) обнаружили, что AI-агенты для кодинга, включая популярные инструменты, могут быть легко скомпрометированы через sandbox-эскейпы. Они представили свои выводы на конференции [AI Risk and Vulnerability Championship](https://aivillage.org/) в рамках Def Con 32. Суть проблемы заключается в том, что компоненты, работающие вне песочницы, могут читать и манипулировать выводами агента, что открывает путь для атак.
В ходе исследования были протестированы такие агенты, как [GitHub Copilot](https://github.com/features/copilot), [Cursor](https://cursor.com/), [OpenHands](https://github.com/All-Hands-AI/OpenHands) и [Aider](https://aider.chat/). Все они оказались уязвимыми к так называемым "sandbox-эскейпам" — методам, позволяющим коду вырваться за пределы изолированной среды и получить доступ к основной системе. Злоумышленники могут использовать эту уязвимость для внедрения вредоносных инструкций, которые агент будет выполнять без ведома разработчика.
Предыстория и контекст
AI-агенты для кодинга становятся всё более популярными, поскольку они автоматизируют рутинные задачи и повышают производительность разработчиков. Однако, как показало исследование, эти инструменты не так безопасны, как заявляют их создатели. Проблема усугубляется тем, что многие агенты используют архитектуру, в которой выводы обрабатываются вне песочницы, что создаёт дополнительные векторы атак.
Ранее уже были сообщения о том, что AI-агенты могут быть подвержены prompt-injection атакам, но sandbox-эскейпы представляют собой более серьёзную угрозу, так как позволяют атакующему получить полный контроль над системой. Это особенно критично для предприятий, которые внедряют такие инструменты в свои процессы разработки, не осознавая потенциальных рисков.
Как происходит sandbox-эскейп?
Sandbox-эскейп в AI-агентах происходит следующим образом: агент выполняет код в изолированной среде, но результаты этого кода передаются компоненту, работающему вне песочницы. Если злоумышленник может контролировать или перехватывать этот канал передачи, он может внедрить вредоносные команды, которые будут выполняться с правами хоста. Например, атакующий может подменить вывод агента, заставив его выполнить нежелательные действия, такие как кража данных или установка вредоносного ПО.
Технические детали исследования
Исследователи из Invariant Labs продемонстрировали несколько векторов атак. Один из них включает использование специально созданных репозиториев, которые при клонировании агентом выполняют вредоносный код. Другой вектор основан на манипуляции выводом агента через перехват системных вызовов. В частности, они показали, как можно изменить содержимое файлов, которые агент читает, чтобы внедрить вредоносные инструкции.
Уязвимости были подтверждены для всех протестированных агентов. При этом разработчики агентов не всегда оперативно реагируют на сообщения об уязвимостях. Например, GitHub Copilot и Cursor имеют программы bug bounty, но не все найденные проблемы были признаны критическими.
Кого затронет и как
Эта уязвимость затрагивает разработчиков, использующих AI-агентов для написания кода, а также компании, которые внедряют такие инструменты в свои процессы. Злоумышленники могут использовать sandbox-эскейпы для атак на цепочки поставок, внедряя вредоносный код в проекты с открытым исходным кодом. Это особенно опасно для организаций, которые полагаются на автоматизированные инструменты без дополнительной проверки.
Для российских и СНГ-разработчиков это также актуально: многие из них используют открытые инструменты, такие как OpenHands и Aider, которые также уязвимы. Рекомендуется обновлять агенты до последних версий и внимательно следить за их безопасностью.
Что будет дальше
Исследователи планируют опубликовать подробный отчёт о своих находках, чтобы помочь разработчикам устранить уязвимости. Ожидается, что производители AI-агентов выпустят исправления, но пока неизвестно, когда это произойдёт. В долгосрочной перспективе необходимо пересмотреть архитектуру таких инструментов, чтобы обеспечить более надёжную изоляцию и защиту от атак.
Пока же пользователям рекомендуется быть осторожными и не выполнять код, полученный из ненадёжных источников, без предварительной проверки.
Итог
Исследование показало, что AI-агенты для кодинга не так безопасны, как заявляется. Sandbox-эскейпы представляют реальную угрозу, которую необходимо учитывать при использовании этих инструментов. Следите за обновлениями от разработчиков и применяйте дополнительные меры безопасности, чтобы защитить свои проекты.