Как AI-ограничения мешают работе специалистов по наступательной кибербезопасности
Специалисты по наступательной кибербезопасности, которые ищут неизвестные уязвимости и создают инструменты для их эксплуатации, всё чаще сталкиваются с проблемами при использовании языковых моделей от OpenAI и Anthropic. Эти AI-системы, оснащённые так называемыми «ограничителями» (guardrails), блоки

Специалисты по наступательной кибербезопасности, которые ищут неизвестные уязвимости и создают инструменты для их эксплуатации, всё чаще сталкиваются с проблемами при использовании языковых моделей от OpenAI и Anthropic. Эти AI-системы, оснащённые так называемыми «ограничителями» (guardrails), блокируют запросы, связанные с созданием эксплойтов или анализом уязвимостей, даже если они подаются в рамках легитимных исследовательских проектов. В интервью TechCrunch несколько экспертов рассказали, как это влияет на их работу и почему текущие меры безопасности могут быть контрпродуктивными.
Как AI-ограничения блокируют исследования в области наступательной кибербезопасности
Исследователи, занимающиеся поиском уязвимостей и разработкой эксплойтов, сообщают, что модели GPT-4o от OpenAI и Claude от Anthropic часто отказываются отвечать на запросы, связанные с написанием кода для эксплуатации дыр в безопасности. Например, при попытке сгенерировать скрипт для тестирования SQL-инъекции модель может выдать предупреждение о недопустимости вредоносной деятельности, даже если исследователь явно указывает, что работает в рамках программы bug bounty или тестирует собственную систему. Такие отказы замедляют работу, заставляя специалистов искать обходные пути или тратить время на формулировку запросов, которые не триггерят фильтры.
Почему AI-ограничения вредят, а не помогают безопасности?
Исследователи утверждают, что блокировка их запросов контрпродуктивна, поскольку именно их работа позволяет выявлять уязвимости до того, как их найдут злоумышленники. Без доступа к мощным AI-инструментам процесс поиска и анализа уязвимостей замедляется, а качество защиты снижается. Некоторые эксперты считают, что AI-компании должны предоставлять специальные режимы для сертифицированных исследователей, аналогично тому, как это делается в программах bug bounty. Это позволило бы сохранить безопасность моделей, не препятствуя важным исследованиям.
Предыстория и контекст
OpenAI и Anthropic внедрили ограничения в свои модели, чтобы предотвратить их использование для создания вредоносного ПО, фишинговых писем или других киберугроз. Это часть более широких усилий по обеспечению безопасности AI, которые активно обсуждаются в индустрии. Однако эти меры не учитывают нюансы работы специалистов по наступательной кибербезопасности, которые действуют в рамках закона и этики. Проблема усугубляется тем, что модели не способны надёжно различать вредоносные и исследовательские намерения, что приводит к ложным срабатываниям. Ранее уже высказывались опасения, что чрезмерные ограничения могут подтолкнуть исследователей к использованию менее безопасных открытых моделей, что увеличит риски.
Какие технические и этические аспекты стоят за ограничениями?
С технической стороны, ограничения реализованы через системы фильтрации на основе машинного обучения, которые анализируют запросы и блокируют те, что содержат ключевые слова или шаблоны, связанные с атаками. Однако эти фильтры несовершенны: они могут блокировать запросы на изучение уязвимостей, но пропускать более изощрённые вредоносные запросы, замаскированные под легитимные. Этическая дилемма заключается в балансе между предотвращением злоупотреблений и поддержкой законных исследований. Некоторые исследователи предлагают ввести систему верификации для профессионалов, аналогичную той, что используется в медицинских или юридических AI-инструментах.
Кого затронет и как
Больше всего от ограничений страдают независимые исследователи и небольшие компании, которые не имеют доступа к альтернативным AI-ресурсам. Крупные организации могут использовать собственные модели или платить за доступ к API с особыми условиями, но для многих это дорого. В России и странах СНГ ситуация усугубляется тем, что доступ к API OpenAI и Anthropic может быть ограничен или нестабилен, что вынуждает исследователей полагаться на открытые модели, которые часто менее эффективны. В конечном итоге, страдает вся экосистема кибербезопасности, так как замедляется выявление уязвимостей, а злоумышленники получают преимущество.
Как AI-ограничения влияют на поиск уязвимостей в России?
В России специалисты по наступательной кибербезопасности сталкиваются с двойной проблемой: ограничения AI-моделей и нестабильный доступ к зарубежным API. Многие вынуждены использовать открытые модели, такие как Llama от Meta, которые не имеют жёстких фильтров, но требуют больше вычислительных ресурсов и могут быть менее точными. Это замедляет исследования и снижает их качество. Некоторые эксперты отмечают, что российские компании могли бы разработать собственные AI-инструменты для кибербезопасности, но это требует значительных инвестиций.
Что будет дальше
Ожидается, что OpenAI и Anthropic продолжат совершенствовать свои системы ограничений, возможно, внедряя механизмы верификации для исследователей. Однако пока официальных заявлений о таких планах нет. Некоторые эксперты прогнозируют, что давление со стороны сообщества кибербезопасности может привести к созданию отраслевого стандарта для AI-моделей, используемых в исследованиях. Альтернативой может стать рост популярности открытых моделей, таких как Llama от Meta, которые не имеют жёстких ограничений, но несут собственные риски.
Итог
Ограничения AI-моделей, призванные защитить от злоупотреблений, непреднамеренно мешают легитимным исследованиям в области наступательной кибербезопасности. Это замедляет поиск уязвимостей и ослабляет общую защиту цифровых систем. Для исправления ситуации необходимы более тонкие механизмы фильтрации, которые учитывают контекст и намерения пользователя. Следить за развитием этой темы важно всем, кто работает в сфере кибербезопасности или использует AI-инструменты в своей профессиональной деятельности.