Исследование безопасности T2I-моделей: открытые риски и новая метрика Advanced ASR

Модели генерации изображений по текстовому описанию (T2I), доступные в открытых репозиториях, представляют значительные риски для безопасности, но существующие методы оценки этих рисков несовершенны. Группа исследователей провела масштабное эмпирическое исследование, охватившее более 200 моделей с H

Исследование безопасности T2I-моделей: открытые риски и новая метрика Advanced ASR

Модели генерации изображений по текстовому описанию (T2I), доступные в открытых репозиториях, представляют значительные риски для безопасности, но существующие методы оценки этих рисков несовершенны. Группа исследователей провела масштабное эмпирическое исследование, охватившее более 200 моделей с Hugging Face, и выявила, что традиционные метрики на основе детекторов переоценивают реальную угрозу. В ответ на это они предложили новую метрику Advanced ASR (Advanced Attack Success Rate), которая точнее оценивает способность модели генерировать небезопасный контент при целенаправленных атаках.

Почему безопасность открытых T2I-моделей стала критической проблемой

С ростом популярности генеративных моделей, особенно в открытом доступе, увеличивается вероятность их злонамеренного использования. Ранее исследования безопасности проводились в основном на ограниченном наборе канонических моделей в лабораторных условиях, что не отражало реальную картину. Теперь же, когда любой разработчик может загрузить и использовать модель с Hugging Face, возникает острая необходимость систематической оценки рисков. Данная работа впервые предоставляет всесторонний анализ экосистемы открытых T2I-моделей, что важно для разработчиков, платформ-хостингов и регуляторов, стремящихся к созданию безопасных стандартов ИИ.

Как проводилось исследование: методология и атаки

Исследователи отобрали более 200 моделей из Hugging Face, включая как популярные, так и малоизвестные. Для оценки безопасности они применили три типовые jailbreak-атаки, направленные на обход встроенных фильтров. Атаки включали манипуляции с текстовыми запросами, такие как использование эвфемизмов, перефразирование и комбинирование безопасных и небезопасных элементов. Каждая модель тестировалась на способность генерировать изображения, которые детекторы NSFW (Not Safe For Work) классифицировали бы как небезопасные. Однако именно здесь и проявилась проблема: детекторы часто ошибались.

Почему детекторы переоценивают риски: семантический дрейф и артефакты

Традиционные метрики, основанные на детекторах, дают завышенные оценки из-за двух основных факторов: семантического дрейфа и артефактов генерации. Семантический дрейф возникает, когда модель неправильно интерпретирует запрос и генерирует изображение, которое детектор ошибочно считает небезопасным. Например, запрос "красное платье" может привести к генерации изображения с откровенными элементами, если модель ассоциирует красный цвет с определенным контекстом. Артефакты — это дефекты изображения, такие как искажения или шум, которые детектор может принять за признаки небезопасного контента. В результате метрики показывают высокий уровень успешных атак, хотя на самом деле сгенерированные изображения не являются реально опасными.

Новая метрика Advanced ASR: что она учитывает

Для решения этой проблемы исследователи разработали метрику Advanced ASR, которая оценивает не просто факт срабатывания детектора, а семантическую валидность и визуальную правдоподобность небезопасного изображения. Семантическая валидность означает, что изображение действительно соответствует небезопасному запросу, а не является случайным артефактом. Визуальная правдоподобность оценивает, насколько реалистично выглядит изображение, чтобы его можно было использовать для реального вреда. Таким образом, Advanced ASR отсеивает ложные срабатывания и дает более точную картину реальных рисков.

Результаты: какие модели оказались опасными

Применение Advanced ASR показало, что многие модели сохраняют определенный уровень безопасности даже без явных защитных механизмов. Однако были выявлены две категории высокорисковых моделей. Первая — это явно NSFW-ориентированные модели, которые создавались специально для генерации небезопасного контента. Вторая — внешне безобидные модели, чья небезопасность проявляется только при систематическом тестировании с jailbreak-атаками. Например, некоторые модели, предназначенные для генерации пейзажей, при определенных запросах могли создавать изображения насилия. Это подчеркивает необходимость всестороннего тестирования даже для моделей, которые кажутся безопасными.

Какие факторы влияют на уязвимость моделей?

Исследователи также попытались выяснить, почему одни модели более уязвимы, чем другие. Предварительные данные указывают на то, что размер модели, количество параметров и объем обучающих данных могут играть роль. Модели с большим числом параметров, как правило, лучше понимают контекст, но при этом могут быть более подвержены jailbreak-атакам, если в обучающих данных присутствовал небезопасный контент. Кроме того, важную роль играет архитектура модели и используемые методы фильтрации. Однако точные механизмы, приводящие к деградации безопасности, требуют дальнейшего изучения.

Кого затронут результаты исследования

Результаты этого исследования имеют прямое значение для нескольких групп. Разработчики и исследователи T2I-моделей, использующие открытые репозитории, должны учитывать, что даже модели без явных защитных механизмов могут быть небезопасными при определенных условиях. Платформы для хостинга моделей, такие как Hugging Face, могут усилить модерацию и внедрить более точные метрики оценки, подобные Advanced ASR, для выявления рискованных моделей. Пользователи, применяющие открытые T2I-модели в коммерческих или публичных проектах, должны быть осторожны и проводить собственное тестирование. Наконец, регуляторы, работающие над стандартами безопасности ИИ, могут использовать эти выводы для разработки более эффективных требований к моделям.

Что пока остается неизвестным?

Несмотря на масштабность исследования, некоторые вопросы остаются открытыми. Неясно, насколько широко высокорисковые модели используются в реальных приложениях. Возможно, многие из них просто скачиваются для ознакомления, но не применяются на практике. Также требуют дальнейшего изучения факторы, приводящие к деградации безопасности в одних моделях и ее сохранению в других. Например, почему некоторые модели с большим числом параметров остаются безопасными, а другие — нет? Ответы на эти вопросы помогут создать более надежные защитные механизмы.

Выводы и перспективы

Исследование показало, что безопасность открытых T2I-моделей — сложная проблема, требующая более точных методов оценки. Предложенная метрика Advanced ASR является шагом вперед, но не панацеей. Для обеспечения безопасности необходимо сочетание улучшенных детекторов, более качественных обучающих данных и строгой модерации на платформах. Разработчикам следует внедрять механизмы защиты на этапе обучения, а не полагаться только на пост-фильтрацию. В конечном итоге, только совместные усилия исследователей, платформ и регуляторов позволят минимизировать риски, связанные с открытыми T2I-моделями.