Как киберпреступники обходят защиту ИИ, разделяя вредоносные задачи
Киберпреступники нашли новый способ обходить защитные механизмы больших языковых моделей: они разделяют вредоносные задачи на несколько отдельных сессий, чтобы не вызывать подозрений у систем безопасности. К такому выводу пришли специалисты Cisco Talos, проанализировав логи промптов, которые злоумыш

Киберпреступники нашли новый способ обходить защитные механизмы больших языковых моделей: они разделяют вредоносные задачи на несколько отдельных сессий, чтобы не вызывать подозрений у систем безопасности. К такому выводу пришли специалисты Cisco Talos, проанализировав логи промптов, которые злоумышленники отправляли чат-ботам с поддержкой ИИ. Эта техника, названная «разделением задач», позволяет атакующим обходить фильтры, которые проверяют каждый запрос изолированно, но не анализируют контекст всей сессии. В результате даже самые продвинутые защитные механизмы могут быть обмануты, если не учитывать последовательность действий пользователя.
Как работает обход защиты
Вместо того чтобы попросить ИИ написать вредоносный код или план атаки в одном запросе, злоумышленники разбивают задачу на несколько шагов. Например, они могут сначала попросить объяснить принципы работы уязвимости, затем — привести пример кода, а позже — попросить модифицировать его для конкретных целей. Каждый отдельный запрос выглядит безобидно, но в совокупности они образуют полную цепочку атаки. Такой подход особенно опасен, потому что он использует доверие системы к отдельным действиям пользователя, не учитывая их общую направленность.
Talos выявил несколько таких паттернов. В одном случае злоумышленник использовал несколько сессий, чтобы создать фишинговое письмо: сначала он просил ИИ помочь с составлением текста, затем — добавить ссылку, а потом — обойти фильтры. В другом случае атакующий пытался получить инструкции по созданию вредоносного ПО, разбивая запрос на части и выдавая свои действия за легитимные исследования. Эти примеры показывают, что злоумышленники тщательно продумывают свои действия, чтобы не вызвать подозрений у автоматических систем безопасности.
Какие техники используют злоумышленники для обхода ИИ?
Помимо разделения задач, исследователи Talos описали и другие техники. Одна из них — «присвоение права собственности» (ownership claims), когда злоумышленник утверждает, что действует от имени законной организации или исследовательской группы. Это позволяет ему обойти фильтры, которые блокируют запросы, связанные с вредоносной деятельностью, но разрешают запросы от «доверенных» источников. Другая техника — использование специальных промптов, которые маскируют вредоносные намерения под безобидные запросы. Например, злоумышленник может попросить ИИ написать код для «образовательных целей» или «тестирования безопасности», что не вызывает подозрений у фильтров.
Эти методы становятся все более изощренными, поскольку разработчики ИИ постоянно улучшают защитные механизмы. Однако злоумышленники адаптируются, находя новые способы обхода. Важно понимать, что ни одна система безопасности не является идеальной, и даже самые современные модели могут быть обмануты, если атакующий достаточно терпелив и изобретателен.
Предыстория и контекст
Проблема безопасности ИИ-систем стала особенно актуальной после того, как ChatGPT и аналогичные сервисы получили массовое распространение. Компании внедряют защитные механизмы, чтобы предотвратить злоупотребление ИИ, но злоумышленники постоянно ищут способы их обойти. Разделение задач — лишь одна из техник; ранее исследователи сообщали о так называемых «джейлбрейках» — специальных промптах, которые заставляют модель игнорировать правила. Эти джейлбрейки часто используют психологические уловки, чтобы обмануть модель, например, представляя вредоносный запрос как часть ролевой игры или гипотетического сценария.
Эксперты отмечают, что проблема усугубляется тем, что сами модели становятся все более мощными и способными выполнять сложные задачи. Это делает их привлекательной целью для киберпреступников, которые могут использовать ИИ для автоматизации атак, создания фишинговых писем или разработки вредоносного кода. Кроме того, с ростом популярности ИИ-ассистентов в корпоративной среде, злоумышленники получают новые возможности для атак на организации через эти системы.
Как защититься от таких атак?
Для организаций, использующих ИИ-решения, важно внедрять комплексные меры безопасности. Это включает мониторинг не только отдельных запросов, но и целых сессий, а также анализ контекста. Системы безопасности должны уметь выявлять подозрительные паттерны, когда несколько безобидных запросов в совокупности образуют вредоносную цепочку. Например, если пользователь сначала спрашивает о принципах работы уязвимости, затем просит пример кода, а потом просит модифицировать его для обхода защиты, это должно вызвать тревогу.
Кроме того, Talos рекомендует использовать поведенческий анализ и машинное обучение для обнаружения аномалий. Важно также обучать сотрудников и пользователей ИИ-систем распознавать попытки манипуляции и сообщать о подозрительной активности. Обучение персонала — это ключевой элемент защиты, поскольку даже самые совершенные технические меры могут быть бесполезны, если сотрудники не понимают рисков и не соблюдают правила безопасности.
Технические детали
Исследователи Talos опубликовали подробный отчет, в котором описали несколько техник, используемых злоумышленниками. Одна из них — «разделение задач» (task splitting), когда вредоносная задача разбивается на несколько меньших, каждая из которых выполняется в отдельной сессии. Другая техника — «присвоение права собственности» (ownership claims), когда злоумышленник утверждает, что действует от имени законной организации или исследовательской группы. В отчете также упоминается, что злоумышленники используют специальные промпты, которые маскируют вредоносные намерения под безобидные запросы. Например, они могут попросить ИИ написать код для «образовательных целей» или «тестирования безопасности», что не вызывает подозрений у фильтров.
Эти техники могут комбинироваться, создавая еще более сложные сценарии атак. Например, злоумышленник может начать с «присвоения права собственности», чтобы установить доверие, а затем использовать «разделение задач» для постепенного получения вредоносной информации. Такие многоступенчатые атаки требуют от систем безопасности более глубокого анализа поведения пользователя, а не просто проверки отдельных запросов.
Кого затронет и как
Проблема касается всех, кто использует большие языковые модели: от разработчиков и компаний, внедряющих ИИ в свои продукты, до обычных пользователей. Для бизнеса это означает необходимость усиления контроля за использованием ИИ-инструментов, особенно если они интегрированы в корпоративные системы. Злоумышленники могут использовать ИИ для создания более убедительных фишинговых писем или для автоматизации атак, что повышает риски для организаций. Например, с помощью ИИ можно автоматически генерировать персонализированные фишинговые письма, которые выглядят так, будто они написаны конкретным человеком, что значительно увеличивает шансы на успех атаки.
В России и странах СНГ также наблюдается рост интереса к ИИ, и компании активно внедряют чат-ботов и другие решения на основе языковых моделей. Это делает их потенциальными целями для атак, описанных в отчете Talos. Важно, чтобы локальные компании учитывали эти угрозы при разработке своих систем безопасности. Особенно это касается финансового сектора, государственных учреждений и крупных корпораций, которые хранят большие объемы конфиденциальных данных.
Что будет дальше
Специалисты Talos ожидают, что злоумышленники продолжат совершенствовать свои методы обхода защиты ИИ. Вероятно, появятся новые техники, которые будут использовать уязвимости в архитектуре моделей или в их интеграции с другими системами. Например, атаки через цепочки вызовов API или использование функций, которые позволяют модели обращаться к внешним инструментам, могут стать новым вектором атак. Также возможно, что защитные механизмы будут развиваться, становясь более контекстно-зависимыми и способными выявлять сложные многосессионные атаки.
Компаниям, разрабатывающим ИИ-решения, следует активно сотрудничать с исследователями безопасности и внедрять обратную связь от сообщества для улучшения защиты. Пользователям же стоит быть осторожными и не доверять ИИ-системам полностью, особенно при обработке конфиденциальной информации. Важно помнить, что ИИ — это инструмент, который может быть использован как во благо, так и во вред, и ответственность за его использование лежит на человеке.
Итог
Разделение вредоносных задач — это серьезная угроза, которая показывает, что защитные механизмы ИИ все еще несовершенны. Однако понимание этих техник позволяет разрабатывать более эффективные меры противодействия. Следите за обновлениями от Talos и других исследователей безопасности, чтобы быть в курсе последних угроз и способов защиты. Внедрение комплексных мер безопасности, включая мониторинг сессий и поведенческий анализ, поможет снизить риски и защитить ваши системы от атак, основанных на разделении задач.