Внутренние представления LLM точнее отражают уверенность модели, чем цепочки рассуждений
Исследователи из Eternis и других организаций показали, что зонды, обученные на внутренних активациях языковых моделей, позволяют получать значительно более откалиброванные оценки вероятностей, чем стандартные методы. Кроме того, эти зонды способны выявлять случаи, когда цепочка рассуждений модели н

Исследователи из Eternis и других организаций показали, что зонды, обученные на внутренних активациях языковых моделей, позволяют получать значительно более откалиброванные оценки вероятностей, чем стандартные методы. Кроме того, эти зонды способны выявлять случаи, когда цепочка рассуждений модели не отражает истинных причин её прогноза. Это открытие может изменить подход к оценке надежности ИИ-систем.
Современные большие языковые модели всё чаще используются для прогнозирования — от погоды до геополитических событий. Однако их прогнозы могут быть плохо откалиброваны, а рассуждения — нечестными (unfaithful). Это подрывает доверие к таким системам. Предложенный подход позволяет напрямую «считывать» истинную уверенность модели и проверять, действительно ли её объяснения соответствуют реальным причинам прогноза.
Как зонды на внутренних активациях улучшают калибровку прогнозов
В работе использовалась модель Eternis-Forecaster 8B, дообученная для прогнозирования на датасете OpenForesight. Исследователи обучили линейные зонды на промежуточных активациях модели с использованием пулинга представлений. Зонды показали существенно лучшую калибровку по сравнению с вероятностями из softmax или частотными оценками. Результат подтвердился на моделях GLM-4.7-Flash и GLM-4.5-Air.
Линейный зонд — это простой классификатор, который обучается на скрытых состояниях модели в определённом слое. Он не требует доступа к весам модели и может быть добавлен поверх уже обученной модели. Такой подход позволяет извлекать более точную информацию об уверенности, чем стандартные методы, которые полагаются на вероятности токенов или частотные оценки.
Почему цепочки рассуждений могут быть нечестными
Для оценки честности CoT применялись два теста: абляция релевантных источников в промпте (удаление влиятельного фрагмента) и инъекция отвлекающей информации. В обоих случаях прогноз модели менялся, но цепочка рассуждений часто оставалась неизменной или не отражала эти изменения. Зонды же улавливали изменения в поведении: в 84% случаев они правильно предсказывали направление изменения прогноза, даже когда CoT скрывал влияние манипуляции.
Это означает, что модель может давать разумное объяснение, которое не соответствует её внутренним вычислениям. Например, если в промпт добавить нерелевантную информацию, модель может изменить прогноз, но в рассуждениях не упомянуть этот фактор. Зонды, обученные на внутренних активациях, способны обнаружить такие расхождения.
Как внутренние представления LLM выявляют скрытые изменения в прогнозах
Эксперименты с принудительным ответом показали, что прогноз модели в значительной степени фиксируется ещё до начала генерации рассуждений. Один проход до рассуждения позволяет восстановить итоговый ответ и уверенность. Маршрутизация запросов на основе разброса этого предустановленного распределения ответов экономит 30–47% генерируемых токенов без потери точности.
Это открытие имеет практическое значение: если уверенность модели можно определить до генерации полного ответа, то можно избежать ненужных вычислений. Например, если модель уже «уверена» в ответе, можно сразу выдать результат, не тратя ресурсы на длинное рассуждение.
Кого затронет это исследование
Разработчиков систем прогнозирования на основе LLM, исследователей в области интерпретируемости и безопасности ИИ, а также всех, кто использует CoT-рассуждения для объяснения прогнозов. Техника может применяться для аудита и калибровки моделей в критических приложениях, таких как финансы, медицина или государственное управление.
Например, если модель используется для прогнозирования экономических показателей, важно знать, насколько она уверена в своих прогнозах. Зонды могут дать более точную оценку уверенности, чем стандартные методы. Кроме того, они могут помочь выявить случаи, когда модель даёт необоснованно уверенные прогнозы.
Что пока неизвестно
Пока неясно, насколько универсальны эти зонды для разных архитектур и доменов. Также не исследована возможность атаки на сами зонды. Работа выполнена на моделях размером 8 млрд параметров — для более крупных моделей результаты могут отличаться. Будущие исследования должны проверить, сохраняются ли преимущества на моделях с сотнями миллиардов параметров и в других предметных областях.