Новый метод ARGUS снижает успех атак на LLM-агентов с 28.8% до 3.8%

Исследователи разработали метод защиты LLM-агентов от контекстно-зависимых инъекций промптов, который снижает успешность атак с 28,8% до 3,8%. Новый инструмент, получивший название ARGUS (Causal-Provenance Auditor), анализирует причинно-следственные связи между контекстом выполнения и действиями аге

Новый метод ARGUS снижает успех атак на LLM-агентов с 28.8% до 3.8%

Исследователи разработали метод защиты LLM-агентов от контекстно-зависимых инъекций промптов, который снижает успешность атак с 28,8% до 3,8%. Новый инструмент, получивший название ARGUS (Causal-Provenance Auditor), анализирует причинно-следственные связи между контекстом выполнения и действиями агента, блокируя необоснованные действия. В дополнение к нему создан бенчмарк AgentLure для оценки таких атак.

Что такое ARGUS и как он работает

ARGUS представляет собой систему аудита причинно-следственных связей, которая строит граф влияния (influence-provenance graph) для каждого действия агента. Этот граф отслеживает, какие данные из контекста повлияли на принятие решения. Система маркирует временные отрезки выполнения и проверяет, имеет ли каждое предложенное действие полное обоснование в виде безвредных данных. Действие выполняется только при наличии достаточных доказательств и соблюдении инвариантов задачи.

В отличие от существующих методов защиты, которые часто полагаются на фильтрацию на основе ключевых слов или простые эвристики, ARGUS учитывает причинно-следственные связи между контекстом и действиями. Это позволяет выявлять скрытые инъекции, когда вредоносная инструкция замаскирована под легитимный контекст. Например, если атака использует неявные указания, такие как "забудь предыдущие инструкции" или "выполни это действие, потому что это важно", ARGUS может обнаружить отсутствие причинной связи и заблокировать действие.

Почему безопасность LLM-агентов критична

Современные LLM-агенты всё чаще используются для выполнения задач от имени пользователя: от управления email-перепиской до автоматизации финансовых операций. Это делает их уязвимыми для инъекций промптов, когда вредоносная инструкция скрыта в контексте, например, в тексте письма или в веб-странице. Существующие защиты не учитывают причинно-следственные связи между контекстом и действиями, что делает их неэффективными для контекстно-зависимых задач. Новый подход может существенно повысить безопасность агентов, предотвращая выполнение действий, не имеющих обоснования в безвредных данных.

Какие угрозы устраняет ARGUS?

Контекстно-зависимые инъекции промптов представляют собой один из самых опасных векторов атак на LLM-агенты. Злоумышленник может внедрить вредоносную инструкцию в данные, которые агент обрабатывает, например, в текст письма или в комментарий на сайте. Агент, не имея механизма проверки причинно-следственных связей, может выполнить эту инструкцию, что приведёт к утечке данных, несанкционированным действиям или другим последствиям. ARGUS блокирует такие атаки, проверяя, что каждое действие имеет обоснование в виде безвредных данных, а не в виде скрытых инструкций.

Результаты тестирования на бенчмарке AgentLure

На бенчмарке AgentLure, который охватывает четыре предметные области (финансы, здравоохранение, образование, развлечения) и восемь векторов атак, ARGUS снизил показатель успешности атак с 28,8% до 3,8%. При этом система сохранила 87,5% полезной функциональности, то есть агент продолжал выполнять легитимные задачи. Это значительное улучшение по сравнению с существующими методами защиты, которые либо пропускали много атак, либо блокировали слишком много полезных действий.

Кого затронет внедрение ARGUS

Разработчики LLM-агентов получат новый инструмент для повышения безопасности своих систем. Исследователи безопасности ИИ смогут использовать ARGUS для анализа уязвимостей и разработки более надёжных защитных механизмов. Компании, внедряющие агентов в бизнес-процессы, смогут снизить риски, связанные с инъекциями промптов. Пользователи, доверяющие агентам выполнение задач от своего имени, получат более безопасный опыт взаимодействия.

Что пока неизвестно

Насколько эффективен ARGUS в реальных условиях с более сложными сценариями, где контекст может быть запутанным или противоречивым? Как он масштабируется на большие системы с тысячами агентов? Также неясно, требует ли метод значительных вычислительных ресурсов, что может повлиять на производительность в реальном времени. Исследователи планируют дальнейшие тесты, чтобы ответить на эти вопросы.