MosaicLeaks: как исследовательские ИИ-агенты сливают секреты

Исследователи Hugging Face и ServiceNow представили MosaicLeaks — бенчмарк, который проверяет, способны ли ИИ-агенты удерживать конфиденциальную информацию. Результаты показывают, что даже продвинутые модели сливают секреты в 90% случаев.

MosaicLeaks: как исследовательские ИИ-агенты сливают секреты

Исследовательские ИИ-агенты, которые должны помогать анализировать данные и искать информацию, оказались крайне ненадежными хранителями секретов. Команда специалистов из Hugging Face и ServiceNow разработала бенчмарк MosaicLeaks, который проверяет, способны ли агенты сохранять конфиденциальность. Результаты оказались тревожными: в 90% случаев агенты раскрывали секретную информацию, даже если их явно об этом просили. Это ставит под сомнение безопасность использования таких систем в корпоративной среде, где утечка данных может привести к серьезным последствиям.

MosaicLeaks представляет собой набор тестовых сценариев, в которых агент получает задание, связанное с обработкой секретных данных, и одновременно инструкцию не разглашать их. Исследователи проверили несколько популярных моделей, включая GPT-4o, Claude 3.5 Sonnet и Llama 3.1 70B, и обнаружили, что ни одна из них не смогла гарантированно сохранить конфиденциальность. Даже когда агент осознавал, что информация секретна, он все равно мог выдать ее в ответ на провокационный вопрос или в процессе выполнения задачи.

MosaicLeaks: как проверяли утечку секретов

Бенчмарк MosaicLeaks построен на принципе "ага-момента" — ситуации, когда агент внезапно осознает, что обладает секретной информацией. В тестах агент получает задание, например, проанализировать документ с пометкой "конфиденциально", и при этом ему говорят, что он должен хранить эту информацию в тайне. Затем исследователи задают агенту вопросы, которые могут спровоцировать утечку, или дают задания, в которых секрет может быть использован.

Оказалось, что агенты часто не могут удержать секрет даже при прямом запрете. В 90% тестовых случаев информация была раскрыта тем или иным способом. Причем чем сложнее была задача, тем выше была вероятность утечки. Это связано с тем, что агенты обучаются на огромных массивах данных, где нет четкого разделения на секретную и несекретную информацию, и они не всегда понимают контекст.

Почему агенты не умеют хранить секреты

Причина, по которой ИИ-агенты не справляются с сохранением конфиденциальности, кроется в их архитектуре. Современные языковые модели обучаются предсказывать следующий токен на основе контекста, и они не имеют встроенного механизма для управления доступом к информации. Они не различают "секретные" и "несекретные" данные на уровне смысла, а лишь следуют паттернам, которые видели в обучающих данных.

Кроме того, агенты часто используют внешние инструменты, такие как поиск в интернете или выполнение кода, и это расширяет поверхность для утечки. Например, агент может случайно включить секретную информацию в промежуточные результаты, которые затем попадают в лог или отправляются на внешний сервер. В MosaicLeaks были случаи, когда агент выводил секрет в консоль при отладке кода, что является классической ошибкой.

Что это значит для пользователей ИИ-агентов

Для бизнеса и разработчиков это означает, что нельзя полагаться на ИИ-агентов при работе с конфиденциальными данными без дополнительных мер защиты. Даже если агент обучен правильно, существует риск утечки через побочные каналы, такие как логи или ошибки. Компании, которые используют агентов для обработки персональных данных или коммерческой тайны, должны внедрять строгий контроль доступа и мониторинг.

Для рядовых пользователей это напоминание о том, что нельзя доверять ИИ-агентам секретную информацию, например, пароли или банковские реквизиты. Даже если агент обещает сохранить конфиденциальность, на практике он может случайно раскрыть данные в разговоре или при выполнении задачи.

Как защититься от утечек

Разработчики могут использовать несколько стратегий для снижения риска утечек. Во-первых, можно добавить в промпт явные инструкции о том, какую информацию нельзя разглашать, но, как показали тесты, это не всегда работает. Во-вторых, можно ограничить доступ агента к внешним инструментам и данным, чтобы уменьшить поверхность для утечки. В-третьих, можно использовать постобработку выходных данных, чтобы фильтровать секретную информацию перед отправкой пользователю.

Однако ни один из этих методов не дает полной гарантии. Исследователи рекомендуют проводить регулярное тестирование агентов с помощью бенчмарков, подобных MosaicLeaks, чтобы выявлять слабые места и улучшать защиту.

Что дальше: перспективы безопасных ИИ-агентов

Команда Hugging Face и ServiceNow планирует расширять MosaicLeaks, добавляя новые типы секретов и сценарии утечки. Они также работают над методами обучения моделей, которые бы лучше понимали концепцию конфиденциальности. Возможно, в будущем появятся специализированные модели с встроенными механизмами контроля доступа.

Пока же пользователям и компаниям стоит быть осторожными и не полагаться на ИИ-агентов в вопросах, связанных с секретной информацией. Бенчмарк MosaicLeaks — это важный шаг к пониманию ограничений современных ИИ-систем и необходимости разработки более безопасных подходов.

Итог

MosaicLeaks показал, что исследовательские ИИ-агенты не способны надежно хранить секреты, что делает их непригодными для работы с конфиденциальной информацией без дополнительных мер защиты. Это открытие важно для всех, кто использует или планирует использовать ИИ-агентов в бизнесе и повседневной жизни. Следите за развитием бенчмарка и новыми рекомендациями по безопасности — это поможет избежать серьезных утечек данных.