OpenAI опубликовала обновлённый отчёт безопасности для GPT-5.1 Instant и Thinking

OpenAI выпустила дополнение к системной карте безопасности GPT-5, в котором представила новые оценки для двух версий модели: GPT-5.1 Instant и GPT-5.1 Thinking. Документ, получивший название GPT-5 System Card Addendum, содержит обновлённые показатели по психическому здоровью и эмоциональной зависимо

OpenAI опубликовала обновлённый отчёт безопасности для GPT-5.1 Instant и Thinking

OpenAI выпустила дополнение к системной карте безопасности GPT-5, в котором представила новые оценки для двух версий модели: GPT-5.1 Instant и GPT-5.1 Thinking. Документ, получивший название GPT-5 System Card Addendum, содержит обновлённые показатели по психическому здоровью и эмоциональной зависимости. Это важный шаг в повышении прозрачности разработки ИИ, особенно на фоне растущего внимания к долгосрочным последствиям взаимодействия человека с языковыми моделями.

Почему безопасность ИИ становится приоритетом

С каждым обновлением языковых моделей возрастает риск их непреднамеренного влияния на пользователей. Особое внимание к психическому здоровью и эмоциональной привязанности отражает обеспокоенность сообщества: чат-боты могут формировать нездоровую зависимость, давать деструктивные советы или манипулировать эмпатией. Публикация таких данных позволяет разработчикам и исследователям лучше понимать границы безопасности моделей и своевременно вносить коррективы. OpenAI стремится к прозрачности, что особенно важно для регуляторов и этических комитетов.

Какие метрики безопасности оценивались

В дополнении приведены результаты для GPT-5.1 Instant (быстрая версия) и GPT-5.1 Thinking (версия с углублённым рассуждением). Основные направления тестирования включают склонность к деструктивным советам, эмпатическую манипуляцию и формирование эмоциональной зависимости. Также обновлена методика оценки: добавлены сценарии с длительным диалогом, которые лучше моделируют реальное взаимодействие. Это позволяет выявить риски, которые не видны при коротких запросах.

Какие новые риски выявили тесты с длительными диалогами

Длительные диалоги могут усиливать эффект персонализации: модель начинает подстраиваться под пользователя, что повышает риск эмоциональной привязанности. В ходе тестов оценивалось, насколько часто GPT-5.1 даёт советы, которые могут навредить психическому здоровью, или использует эмпатические приёмы для удержания внимания. Результаты показали, что обе версии в целом безопасны, но при продолжительном общении некоторые метрики требуют дополнительного контроля.

Кого затронет обновлённый отчёт

Информация будет полезна разработчикам, использующим API OpenAI, исследователям в области безопасности ИИ, а также конечным пользователям чат-ботов на базе GPT-5.1. Особое значение она имеет для психологов и специалистов по этике ИИ, которые изучают влияние технологий на общество. Публикация отчёта позволяет им опираться на официальные данные при проведении собственных исследований.

Как разработчики могут использовать эти данные

Разработчики могут учитывать выявленные риски при проектировании своих приложений: например, ограничивать длину диалога или внедрять механизмы прерывания при признаках эмоциональной зависимости. Отчёт также помогает выбирать между версиями Instant и Thinking в зависимости от чувствительности сценария использования.

Что осталось за кадром

OpenAI не раскрыла точные пороговые значения безопасности, при которых модель считается неприемлемой. Также не указано, какие меры компания планирует предпринять в случае выявления нарушений. Отсутствуют данные о сравнении с предыдущей версией GPT-5.0, что затрудняет оценку прогресса. Тем не менее, сам факт публикации таких метрик — шаг вперёд в области ответственного ИИ.

Перспективы регулирования безопасности ИИ

Ожидается, что в будущем регуляторы потребуют от разработчиков обязательного раскрытия подобных данных. Отчёт OpenAI может стать образцом для других компаний. Пока же остаётся надеяться, что прозрачность будет расти, а пользователи и разработчики смогут принимать более взвешенные решения при работе с ИИ.