Защита ИИ-агентов: как MCP-отравление превращает инструменты в канал утечки данных
ИИ-агенты всё чаще переходят от простого чтения информации к выполнению действий: отправке писем, изменению документов, управлению приложениями. Вместе с этим появляются новые векторы атак, и один из самых коварных — так называемое MCP-отравление (Model Context Protocol tool poisoning). Microsoft Se

ИИ-агенты всё чаще переходят от простого чтения информации к выполнению действий: отправке писем, изменению документов, управлению приложениями. Вместе с этим появляются новые векторы атак, и один из самых коварных — так называемое MCP-отравление (Model Context Protocol tool poisoning). Microsoft Security в свежем блоге предупреждает: злоумышленники манипулируют описаниями инструментов, которые использует агент, превращая доверенного помощника в инструмент утечки данных. Разберёмся, как работает эта атака, почему она опасна и как её предотвратить.
Что такое MCP-отравление и как оно работает
MCP (Model Context Protocol) — это открытый протокол, который позволяет ИИ-агентам подключаться к внешним инструментам и сервисам. Когда агент получает задачу, он анализирует описания доступных инструментов и решает, какой из них использовать. Атака строится на том, что злоумышленник внедряет вредоносное описание в инструмент, которым агент доверяет. Например, вместо ожидаемого «отправить письмо» агент может получить описание, которое на самом деле запускает команду на удаление данных или отправку конфиденциальной информации на внешний сервер.
Microsoft приводит пример: атакующий может создать инструмент, который выглядит как безобидный «калькулятор», но при вызове он на самом деле выполняет произвольный код или обращается к внутренним API. Проблема усугубляется тем, что агенты часто работают в автоматическом режиме, без проверки каждого действия человеком. Если описание инструмента выглядит правдоподобно, агент выполнит команду, даже если она приведёт к утечке данных.
Ключевая особенность MCP-отравления — атака направлена не на пользователя, а на самого агента. Это меняет модель угроз: раньше фишинг обманывал людей, теперь он обманывает ИИ. И если человек может заподозрить неладное, агент — нет, особенно если он обучен доверять описаниям инструментов.
Предыстория и контекст
Рост популярности ИИ-агентов в корпоративной среде начался несколько лет назад, но именно в 2025–2026 годах они стали массово выполнять действия, а не просто генерировать текст. Компании внедряют агентов для автоматизации рутины: обработки заявок, управления документами, взаимодействия с CRM. Вместе с этим появился и MCP — стандарт, который позволяет агентам подключаться к разным системам. MCP быстро стал де-факто стандартом, его поддержали крупные игроки, включая OpenAI, Anthropic и Microsoft.
Однако безопасность MCP долгое время оставалась на втором плане. Разработчики сосредоточились на функциональности, а не на защите. Это привело к тому, что инструменты, подключаемые через MCP, часто не проходят должную проверку. Злоумышленники, заметив это, начали экспериментировать с манипуляцией описаниями. Исследования в области безопасности ИИ уже показывали, что модели можно обмануть изменением входных данных, но MCP-отравление — это более практичная атака, которая эксплуатирует реальную инфраструктуру.
Microsoft подчёркивает, что проблема не гипотетическая: уже зафиксированы случаи, когда вредоносные MCP-серверы распространялись через публичные репозитории и маркетплейсы. Разработчики, не подозревая опасности, подключали их к своим агентам, открывая доступ к корпоративным данным.
Как защититься от атаки?
Главный совет Microsoft — не доверять инструментам без проверки. Агент должен иметь доступ только к тем инструментам, которые действительно необходимы для выполнения задач. Принцип минимальных привилегий здесь работает так же, как и для обычных пользователей: если агенту не нужен доступ к базе клиентов, не давайте его.
Кроме того, важно проверять описания инструментов на предмет аномалий. Если описание содержит странные команды, ссылки на внешние ресурсы или обещает неожиданные функции, это повод насторожиться. Microsoft рекомендует использовать цифровые подписи для инструментов, чтобы гарантировать их подлинность. Также стоит внедрить мониторинг действий агента: если он вдруг начинает выполнять необычные операции, система должна отправлять предупреждение.
Технические детали и анализ рисков
MCP-отравление работает на нескольких уровнях. Во-первых, атакующий может изменить описание инструмента в репозитории, если у него есть доступ к системе контроля версий. Во-вторых, он может создать поддельный инструмент, который имитирует легитимный. В-третьих, он может использовать социальную инженерию, чтобы убедить разработчика подключить вредоносный MCP-сервер.
Microsoft выделяет несколько типов вредоносных описаний: те, которые содержат прямые команды, те, которые используют косвенные инструкции для модели, и те, которые эксплуатируют уязвимости в самом MCP. Например, атакующий может включить в описание скрытый текст, который модель интерпретирует как команду, но человек не заметит. Это особенно опасно, потому что модели часто обрабатывают текст не так, как люди.
Для обнаружения атаки Microsoft предлагает использовать поведенческий анализ: отслеживать, какие инструменты вызывает агент и какие действия выполняет. Если поведение отклоняется от нормы, это сигнал. Также полезно регулярно аудитить конфигурацию агентов и хранить логи всех действий.
Кого затронет и как
Атака в первую очередь угрожает предприятиям, которые активно внедряют ИИ-агентов в бизнес-процессы. Особенно уязвимы компании, использующие публичные MCP-репозитории без проверки. Разработчики, создающие инструменты для ИИ, также в зоне риска: если их инструмент скомпрометирован, пострадают все, кто его использует.
Для пользователей последствия могут быть серьёзными: утечка персональных данных, финансовые потери, репутационный ущерб. В России и СНГ ситуация аналогична: многие компании внедряют ИИ-агентов, но часто экономят на безопасности. Эксперты рекомендуют обратить внимание на локальные регуляции, такие как законы о персональных данных, и учитывать их при настройке агентов.
Что будет дальше
Microsoft уже работает над улучшением MCP и предлагает стандарты безопасности для инструментов. Ожидается, что в ближайшее время появятся обновления протокола, которые включат механизмы проверки подлинности и контроля доступа. Также вероятно, что сообщество разработчиков создаст инструменты для автоматического сканирования MCP-серверов на предмет вредоносного кода.
Компаниям стоит уже сейчас пересмотреть свои стратегии использования ИИ-агентов: провести аудит текущих инструментов, внедрить принципы минимальных привилегий и настроить мониторинг. Чем раньше будут приняты меры, тем меньше риск стать жертвой атаки.
Итог
MCP-отравление — это реальная угроза, которая подчёркивает важность безопасности в мире ИИ. Агенты, которые должны упрощать нашу жизнь, могут стать инструментом для кражи данных, если не принять меры. Следите за обновлениями Microsoft Security и не забывайте: доверие к ИИ должно быть основано на проверке, а не на слепой вере.