Согласие LLM не гарантирует правильность: исследование ставит под сомнение метод LLM-as-judge

Может ли согласованность ответов языковых моделей служить надежным индикатором их правильности? Согласно новому масштабному исследованию, нет — даже когда несколько моделей или одна модель многократно дают одинаковый ответ, это вовсе не означает, что ответ верен. Ученые провели эксперимент с участие

Согласие LLM не гарантирует правильность: исследование ставит под сомнение метод LLM-as-judge

Может ли согласованность ответов языковых моделей служить надежным индикатором их правильности? Согласно новому масштабному исследованию, нет — даже когда несколько моделей или одна модель многократно дают одинаковый ответ, это вовсе не означает, что ответ верен. Ученые провели эксперимент с участием 53 различных конфигураций моделей, каждая из которых сгенерировала по 50 ответов на задачи из бенчмарков GPQA Diamond (естественные науки) и AIME (математика), собрав в общей сложности 265 000 сэмплов. Результаты ставят под сомнение широко используемый метод LLM-as-judge, где одна языковая модель оценивает другую, особенно в корпоративных пайплайнах и ансамблях.

Почему согласие не равно правильности

Исследователи применили иерархический бутстреп с кластеризацией по раннерам, чтобы оценить корреляцию между согласием (внутри одной модели и между разными) и фактической правильностью ответов. Коэффициент корреляции Спирмена (rho) варьировался от 0,20 до 0,59 — положительная, но слабая связь. Это означает, что согласие может быть полезно лишь в ограниченных сценариях, но не как универсальный прокси для истинности. Особенно тревожный вывод: самые согласованные модели, так называемые frontier-модели, часто демонстрируют высокую уверенность в ошибочных ответах. Например, одна из топовых моделей показала согласие не менее 0,8 на 77% записей GPQA, но 48% из этих согласованных ответов оказались неверными.

Как работает метод LLM-as-judge и почему он уязвим

Метод LLM-as-judge предполагает, что одну языковую модель можно использовать для оценки ответов другой модели или даже для самопроверки. На практике это часто реализуется через ансамбли или «миксы экспертов», где несколько моделей голосуют за ответ, и большинство считается правильным. Исследование показывает, что ключевое допущение такого подхода — согласие означает правильность — ненадежно. Frontier-модели склонны к чрезмерной уверенности: они повторяют одни и те же ошибки с высокой согласованностью, причем эта закономерность наблюдается у разных провайдеров. Дополнительная проверка на трех уровнях Claude (cross-family check) подтвердила, что уверенные ошибки систематичны и не зависят от конкретной модели.

Когда согласие все же может быть полезно

Несмотря на общий скепсис, исследование выявило, что согласие как прокси имеет определенную ценность в некоторых режимах. Лучше всего оно работает для моделей среднего уровня, где корреляция между согласием и правильностью выше. Также согласие может быть полезно для оптимизации вычислительных затрат: если модель быстро приходит к консенсусу, это может сэкономить ресурсы, хотя и не гарантирует точность. Однако для самых сильных моделей, которые часто используются в продакшене, полагаться на согласие опасно.

Кого затронут результаты исследования

Разработчики AI-систем, использующие LLM-as-judge для автоматической оценки качества ответов, должны пересмотреть свои пайплайны. Инженеры, внедряющие ансамбли LLM в продукты, не могут больше слепо доверять голосованию большинства. Исследователи, изучающие методы калибровки и оценки достоверности LLM, получают важный эмпирический аргумент против упрощенных метрик. Результаты также актуальны для всех, кто работает с RAG-системами или агентами, где согласие часто используется как сигнал достоверности.

Какие вопросы остаются открытыми

Исследование фокусировалось на задачах с объективно правильными ответами (естественные науки и математика). Неясно, как результаты обобщаются на творческие или субъективные задачи, где правильность менее определена. Также пока не исследованы методы коррекции смещений, которые могли бы сделать согласие более надежным прокси. Возможно, комбинирование согласия с другими метриками, такими как калибровка уверенности или анализ цепочек рассуждений, даст лучшие результаты.

Что делать вместо LLM-as-judge

Исследователи не предлагают готовой замены, но их работа подчеркивает необходимость более надежных методов оценки. Вместо того чтобы полагаться только на согласие, можно использовать краудсорсинг с участием людей, перекрестную проверку на разных типах моделей или внедрять процедуры калибровки, которые корректируют излишнюю уверенность. Также важно учитывать, что согласие может быть индикатором не правильности, а скорее распространенности определенных ошибок в обучающих данных.

Заключение

Согласие языковых моделей — не гарантия правильности, и метод LLM-as-judge требует осторожного применения. Исследование с 265 000 сэмплов наглядно демонстрирует, что даже высокая согласованность ответов не защищает от систематических ошибок, особенно у самых мощных моделей. Разработчикам и исследователям стоит искать более надежные способы оценки, а не полагаться на простые прокси.