Исследование выявило два типа отказов LLM: неправильные ответы и неотвечаемые вопросы
Когда большая языковая модель отказывается отвечать, причина может быть разной: либо она не уверена в правильности ответа, либо сам вопрос не должен быть отвечен — например, из-за ложной предпосылки. Новое исследование, опубликованное на arXiv, впервые систематически разграничивает эти два типа отка

Когда большая языковая модель отказывается отвечать, причина может быть разной: либо она не уверена в правильности ответа, либо сам вопрос не должен быть отвечен — например, из-за ложной предпосылки. Новое исследование, опубликованное на arXiv, впервые систематически разграничивает эти два типа отказов и показывает, что традиционные методы оценки уверенности не способны их различить. Это открытие может кардинально изменить подход к настройке поведения LLM, сделав их одновременно более точными и безопасными.
Два типа отказов: в чём разница
До сих пор разработчики LLM в основном полагались на единый порог уверенности: если модель оценивает свою уверенность в ответе ниже определённого уровня, она отказывается отвечать. Однако такой подход не учитывает, что отказ может быть вызван не только сомнением в правильности, но и принципиальной невозможностью дать корректный ответ. Например, на вопрос «Какого цвета был плащ Наполеона на самом деле?» модель может дать неверный ответ, если не осознаёт, что вопрос содержит ложную предпосылку (цвет плаща Наполеона не задокументирован). В таких случаях правильный отказ должен основываться на обнаружении ложной предпосылки, а не на низкой уверенности в ответе.
Исследователи из arXiv провели эксперименты с пятью инструктивно-настроенными моделями из трёх семейств — от 2 до 14 миллиардов параметров. Они обнаружили, что существуют две независимые оси: уверенность в ответе (answer-confidence) хорошо предсказывает, будет ли ответ правильным, но почти не реагирует на то, отвечаем ли вопрос в принципе. В то же время линейный зонд, обученный на скрытых состояниях модели, отлично определяет отвечаемость вопроса, но не связан с уверенностью в ответе. Это означает, что модель может быть очень уверена в неверном ответе на неотвечаемый вопрос — и наоборот, сомневаться в правильном ответе на отвечаемый вопрос.
Почему это важно для безопасности и достоверности
Разграничение двух типов отказов критически важно для внедрения LLM в чувствительные области, такие как медицина, юриспруденция или образование. Если модель отказывается отвечать только на основе низкой уверенности, она будет часто давать неверные ответы на вопросы с ложной предпосылкой, поскольку уверенность в таких случаях может быть высокой. С другой стороны, она может необоснованно отказываться отвечать на сложные, но корректные вопросы, если её уверенность низка. Новый подход позволяет точнее настраивать поведение: для каждого типа отказа можно установить отдельные пороги и механизмы.
В ходе экспериментов на естественных вопросах с ложной предпосылкой (набор данных CREPE) стандартные метрики уверенности — такие как вероятность ответа, P(IK), P(True) и даже прямой вопрос модели о ложности предпосылки — показывали результаты на уровне случайности. То есть модель не могла определить, что вопрос содержит ложную предпосылку, используя свои обычные механизмы оценки. Однако зонд на скрытых состояниях достигал показателей AUROC от 0.69 до 0.77, что значительно выше случайного уровня. Это указывает на то, что информация об отвечаемости вопроса уже присутствует во внутренних представлениях модели, но не используется при формировании ответа.
Как это повлияет на разработку LLM
Для разработчиков LLM это открытие означает, что можно улучшить модели без увеличения их размера. Слепая зона в отношении отвечаемости не уменьшается с ростом числа параметров — даже модели с 14 миллиардами параметров не справляются с этой задачей лучше, чем модели с 2 миллиардами. Значит, проблема не в масштабе, а в архитектуре или обучении. Исследователи предлагают использовать дополнительный зонд или модифицировать процесс генерации, чтобы модель могла различать два типа отказов. Это может быть реализовано как пост-обработка или как часть обучения с учителем.
Какие вопросы считаются неотвечаемыми?
Неотвечаемые вопросы — это не только вопросы с ложной предпосылкой. К ним также относятся вопросы, нарушающие политику безопасности (например, инструкции по созданию оружия), вопросы, требующие информации, которой нет в обучающих данных, или вопросы, сформулированные так, что на них невозможно дать однозначный ответ. В исследовании основное внимание уделено ложным предпосылкам, но авторы отмечают, что метод потенциально применим и к другим типам неотвечаемых вопросов. Однако для этого требуется дополнительная проверка.
Кого затронет это открытие
В первую очередь — разработчиков LLM и исследователей безопасности ИИ. Компании, внедряющие чат-ботов и ассистентов на основе языковых моделей, смогут снизить количество неверных ответов и необоснованных отказов, что повысит доверие пользователей. Например, в медицинских консультациях модель должна чётко понимать, когда вопрос содержит ложную предпосылку (например, «Какое лекарство лучше всего лечит болезнь X, если пациент уже принимает Y?» — где Y может быть несовместим), и отказываться от ответа, а не давать опасный совет. В образовательных приложениях модель должна отличать сложный, но корректный вопрос от вопроса с ошибкой.
Что пока остаётся неизвестным
Несмотря на многообещающие результаты, исследование имеет ограничения. Пока неясно, как метод масштабируется на модели большего размера — например, с сотнями миллиардов параметров. Также требуется проверка на других типах неотвечаемых вопросов, таких как вопросы, нарушающие политику, или вопросы, требующие актуальных данных. Кроме того, эксперименты проводились на английском языке; насколько результаты применимы к другим языкам, пока не изучено. Наконец, необходимо протестировать подход в реальных сценариях использования, где модели работают в диалоговом режиме и могут получать уточняющие вопросы.
Тем не менее, это исследование открывает новый путь к созданию более надёжных и безопасных языковых моделей. Разделение отказов на два типа позволяет точнее контролировать поведение ИИ, делая его одновременно более полезным и менее рискованным. В ближайшие годы можно ожидать появления новых методов обучения и настройки, которые будут учитывать эту двойственность.