HARC: новый метод защиты LLM от джейлбрейков без потери производительности
Группа исследователей разработала метод HARC (Harmfulness-And-Refusal Coupling), который повышает устойчивость больших языковых моделей к джейлбрейк-атакам. В отличие от традиционных подходов, HARC анализирует внутренние представления модели и связывает направления вредоносности и отказа как на этап

Группа исследователей разработала метод HARC (Harmfulness-And-Refusal Coupling), который повышает устойчивость больших языковых моделей к джейлбрейк-атакам. В отличие от традиционных подходов, HARC анализирует внутренние представления модели и связывает направления вредоносности и отказа как на этапе промпта, так и на этапе генерации ответа. Это позволяет модели распознавать вредоносный контент даже при обходе стандартных защит, не снижая общую производительность.
Как работает HARC
В основе HARC лежит наблюдение, что в выровненных (aligned) LLM направления вредоносности и отказа линейно разделимы в остаточном потоке на позициях токенов промпта. Джейлбрейк-атаки подавляют одно из этих направлений, и разные классы атак занимают различные области на плоскости «вредоносность–отказ». Анализ на этапе генерации ответа показал, что модель может распознавать вредоносный контент даже в процессе его генерации, даже если на этапе промпта она этого не сделала. HARC — метод тонкой настройки, который связывает оба направления на обеих стадиях. Вмешательство ограничено подпространством вредоносности и отказа, не затрагивая остальной остаточный поток, что позволяет сохранить общую производительность и не увеличивать ложные отказы.
Почему это важно для безопасности ИИ
Современные LLM уязвимы к джейлбрейк-атакам, которые заставляют модель игнорировать правила безопасности. HARC предлагает новый подход к alignment, который не требует сложных архитектурных изменений и не снижает общую производительность модели. Это может стать важным шагом в создании более надёжных и безопасных AI-систем. В экспериментах HARC показал лучший баланс между робастностью, производительностью и удобством использования среди шести базовых методов, включая основные методы безопасности на этапе обучения и инференса. Направления вредоносности и отказа переносятся между пятью семействами моделей и двумя масштабами без дополнительной настройки.
Какие результаты показал HARC в тестах
Исследователи провели серию экспериментов, сравнивая HARC с шестью базовыми методами безопасности, включая как методы на этапе обучения, так и на этапе инференса. HARC продемонстрировал наилучший баланс между устойчивостью к атакам, сохранением производительности на стандартных задачах и низким уровнем ложных отказов. Важно, что метод не требует значительных вычислительных ресурсов и может быть интегрирован в существующие модели без полного переобучения. Кроме того, обнаруженные направления вредоносности и отказа оказались переносимыми между разными семействами моделей (например, Llama, Mistral) и масштабами (7B и 13B), что указывает на универсальность подхода.
Кого затронет внедрение HARC
Разработчиков LLM, исследователей в области AI-безопасности, компании, внедряющие языковые модели в продукты, а также конечных пользователей, заинтересованных в надёжных и безопасных AI-системах. HARC может быть особенно полезен для организаций, которые стремятся минимизировать риски злоупотребления моделями без ущерба для их функциональности.
Что пока неизвестно о методе
Пока неясно, насколько метод эффективен против неизвестных или адаптивных атак, а также как он масштабируется на модели большего размера и другие архитектуры. Также требуется дополнительное тестирование на реальных сценариях эксплуатации. Исследователи планируют дальнейшие работы по изучению обобщаемости HARC на более широкий спектр угроз и архитектур.