ScopeJudge: бенчмарк для оценки LLM-агентов в пентесте и предотвращения нарушений

ScopeJudge — это новый бенчмарк, предназначенный для оценки LLM-агентов, работающих в сфере offensive security. Он позволяет проверять каждый вызов инструмента до его выполнения, чтобы предотвратить случайные нарушения границ допустимого. Бенчмарк содержит 4897 вызовов инструментов, из которых 7,7%

ScopeJudge: бенчмарк для оценки LLM-агентов в пентесте и предотвращения нарушений

ScopeJudge — это новый бенчмарк, предназначенный для оценки LLM-агентов, работающих в сфере offensive security. Он позволяет проверять каждый вызов инструмента до его выполнения, чтобы предотвратить случайные нарушения границ допустимого. Бенчмарк содержит 4897 вызовов инструментов, из которых 7,7% являются нарушениями, и размечен профессиональными пентестерами с высоким уровнем согласия (Fleiss kappa = 0.64), что задаёт эталонный уровень экспертного согласия F1 = 0.78. ScopeJudge предлагает механизм pre-execution gating — дешёвую LLM-проверку каждого вызова до его выполнения, что позволяет предотвратить нарушения без существенного замедления работы агента.

Что такое ScopeJudge и как он работает

ScopeJudge — это бенчмарк, созданный группой исследователей для оценки LLM-агентов, которые выполняют задачи по взлому или поиску уязвимостей. Основная идея заключается в том, чтобы проверять каждый вызов инструмента на соответствие границам, установленным контрактом или политикой безопасности. Бенчмарк включает 4897 вызовов инструментов, собранных из траекторий агентов, специально спроектированных для провокации нарушений. Каждый вызов размечен на уровне вызова профессиональными пентестерами. Исследователи оценили восемь моделей-судей при пяти стратегиях транскрипта — от статической политики до полного сырого лога. Результаты показали, что статическая политика принципиально неспособна обеспечить соблюдение границ: без учёта запроса пользователя recall падает почти до нуля. Авторы рекомендуют две точки на Парето-фронте: конфигурацию, оптимизированную по стоимости, и конфигурацию с приоритетом recall для высокорисковых сценариев.

Почему ScopeJudge важен для безопасности LLM-агентов

LLM-агенты, выполняющие задачи по взлому или поиску уязвимостей, могут случайно выйти за рамки разрешённого контрактом или политикой безопасности. Один неверный вызов инструмента способен нарушить работу клиента, привести к сбоям в production или аннулировать баг-баунти. ScopeJudge предлагает механизм pre-execution gating — дешёвую LLM-проверку каждого вызова до его выполнения, что позволяет предотвратить нарушения без существенного замедления работы агента. Это особенно важно в контексте автономных агентов, которые могут действовать без постоянного контроля человека.

Какие риски связаны с выходом за границы допустимого?

Выход за границы допустимого может привести к серьёзным последствиям. Например, агент может случайно выполнить команду, которая нарушит работу production-системы клиента, что приведёт к финансовым потерям и репутационному ущербу. В контексте bug bounty это может аннулировать вознаграждение или даже привести к юридическим последствиям. ScopeJudge помогает минимизировать эти риски, обеспечивая проверку каждого вызова до его выполнения.

Детали бенчмарка ScopeJudge

Бенчмарк ScopeJudge включает 4897 вызовов инструментов, собранных из траекторий агентов, специально спроектированных для провокации нарушений. Каждый вызов размечен на уровне вызова профессиональными пентестерами. Исследователи оценили восемь моделей-судей при пяти стратегиях транскрипта — от статической политики до полного сырого лога. Результаты показали, что статическая политика принципиально неспособна обеспечить соблюдение границ: без учёта запроса пользователя recall падает почти до нуля. Авторы рекомендуют две точки на Парето-фронте: конфигурацию, оптимизированную по стоимости, и конфигурацию с приоритетом recall для высокорисковых сценариев.

Кому будет полезен ScopeJudge

ScopeJudge в первую очередь полезен для разработчиков LLM-агентов, используемых в пентесте и bug bounty, а также для исследователей безопасности, занимающихся автоматизацией тестирования. Компании, предоставляющие услуги по тестированию на проникновение, могут использовать этот подход для снижения рисков нарушения границ. Также бенчмарк интересен сообществу AI safety, так как затрагивает проблему контроля автономных агентов.

Как ScopeJudge может повлиять на разработку безопасных LLM-агентов?

ScopeJudge предоставляет эталон для оценки и сравнения различных подходов к контролю границ. Разработчики могут использовать его для тестирования своих агентов и выбора оптимальной конфигурации gating. Это может стимулировать создание более безопасных и надёжных агентов, которые минимизируют риски при выполнении задач в реальных условиях.

Что пока неизвестно о ScopeJudge

Пока неясно, насколько хорошо результаты ScopeJudge обобщаются на другие типы агентов и сценарии за пределами offensive security. Также не исследована производительность gating в реальном времени при высокой нагрузке. Будущие исследования могут расширить бенчмарк на другие домены и оценить его применимость в production-средах.