Детерминированные шлюзы предотвращают тихие нарушения политики в ИИ-агентах с инструментами

Исследователи из arXiv представили работу, в которой изучается сбойный режим в LLM-агентах, использующих инструменты: агенты могут нарушать политики, которые они призваны соблюдать, при этом внешне успешно выполняя задачу. В среде с разрешительными политиками инструмент может выполнить любой коррект

Детерминированные шлюзы предотвращают тихие нарушения политики в ИИ-агентах с инструментами

Исследователи из arXiv представили работу, в которой изучается сбойный режим в LLM-агентах, использующих инструменты: агенты могут нарушать политики, которые они призваны соблюдать, при этом внешне успешно выполняя задачу. В среде с разрешительными политиками инструмент может выполнить любой корректный вызов, даже если соответствующее изменение состояния запрещено политикой предметной области. Результат — тихое неверное состояние (например, отменённое бронирование или изменённое количество пассажиров), которое не обнаруживается ни инструментом, ни отчётом агента. Это явление представляет собой серьезную угрозу для надежности ИИ-систем, особенно в тех сферах, где даже малейшая ошибка может привести к катастрофическим последствиям.

Почему это важно

Эта проблема подрывает доверие к ИИ-агентам, особенно в таких критических областях, как авиаперевозки, финансы или здравоохранение, где незаметные нарушения политики могут привести к серьёзным последствиям. Предложенное решение — лёгкое, детерминированное и не требующее дообучения модели, что делает его практичным для внедрения. В отличие от сложных методов, таких как fine-tuning или reinforcement learning, данный подход может быть интегрирован в существующие системы без значительных затрат времени и ресурсов. Это особенно важно для компаний, которые уже развернули ИИ-агентов и ищут способы повысить их безопасность без переобучения моделей.

Как работают детерминированные шлюзы

Исследование проводилось на домене авиалиний бенчмарка τ²-bench. На бюджетном агенте 78% наблюдаемых сбоев были тихими неверными состояниями без ошибок инструмента; совокупный уровень сбоев воспроизводим на разных начальных значениях сида. Предложенное вмешательство — детерминированные, read-only шлюзы предварительного выполнения, которые проверяют предлагаемый вызов и текущее состояние перед записью. Эти шлюзы не изменяют модель и не требуют доступа к её внутренностям; они просто анализируют запрос агента и текущее состояние системы, чтобы определить, не приведет ли выполнение к нарушению политики. Если шлюз обнаруживает потенциальное нарушение, он блокирует вызов и возвращает агенту сообщение об ошибке, что позволяет агенту скорректировать свои действия.

Какие результаты показали шлюзы в тестах?

Набор из четырёх шлюзов повысил успешность полного бенчмарка с 29,6% до 42,0% на gpt-4o-mini (+12,4 процентных пункта; P=0,0012), и этот прирост воспроизводится на независимом наборе из 15 сидов (+12,3 п.п.; P=0,0008). Эффект сконцентрирован на задачах, где шлюзы срабатывают: на 26 из 50 задач успешность выросла на +19,2 п.п., а на 24 задачах без срабатывания изменение незначимо. Это указывает на то, что шлюзы целенаправленно исправляют именно те ситуации, где агенты склонны к нарушениям, не влияя на задачи, где агенты и так действуют корректно. Два отрицательных контроля (самопринудительная розничная область и BFCL) показывают, что шлюзы помогают, когда инструменты разрешительны, и почти не влияют, когда инструменты уже самопринудительны. Таким образом, эффективность шлюзов зависит от контекста: они наиболее полезны в средах с мягкими ограничениями, где агенты могут легко совершить ошибку.

Кого затронут эти результаты

Разработчиков LLM-агентов, особенно в областях с чёткими политиками (авиация, финансы, здравоохранение), а также исследователей безопасности ИИ и пользователей, полагающихся на автоматизированные системы с инструментами. Для разработчиков это означает, что они могут внедрить простой и эффективный механизм защиты, не требующий дорогостоящего переобучения. Исследователи безопасности получают новый инструмент для анализа и предотвращения нарушений политики, а конечные пользователи — более надежные системы, которые реже допускают скрытые ошибки.

Что пока неизвестно и какие перспективы

Необходимы дополнительные исследования на других доменах и моделях, чтобы подтвердить обобщаемость результатов. Также требуется изучить, как шлюзы влияют на производительность и может ли быть найдена более оптимальная архитектура шлюзов. В качестве предположительных данных (не основного утверждения) тот же сбойный режим сохраняется на frontier-моделях: gpt-5.2 при стандартном рассуждении всё ещё пытается выполнять запрещённые записи, и тот же набор шлюзов повышает успешность с 61,2% до 71,6% (+10,4 п.п.; P=0,020; n=5, без репликации). Это говорит о том, что даже самые современные модели не застрахованы от тихих нарушений, и шлюзы могут быть полезны и для них. Будущие исследования могут расширить применение шлюзов на другие типы агентов, такие как мультиагентные системы или агенты с памятью, а также исследовать возможность автоматического создания шлюзов на основе описания политики.

Заключение

Детерминированные шлюзы представляют собой простой, но мощный метод предотвращения тихих нарушений политики в ИИ-агентах. Их эффективность подтверждена экспериментами на бенчмарке τ²-bench, где они значительно повысили успешность выполнения задач. Этот подход может стать важным инструментом для повышения безопасности и надежности ИИ-систем в критических областях.