Почему MMLU больше не надежен: объяснение команды Open LLM Leaderboard

Бенчмарк MMLU (Massive Multitask Language Understanding) долгое время считался золотым стандартом для оценки больших языковых моделей, но теперь его надежность поставлена под сомнение. Команда Hugging Face, поддерживающая Open LLM Leaderboard, официально заявила, что MMLU больше не является объектив

Почему MMLU больше не надежен: объяснение команды Open LLM Leaderboard

Бенчмарк MMLU (Massive Multitask Language Understanding) долгое время считался золотым стандартом для оценки больших языковых моделей, но теперь его надежность поставлена под сомнение. Команда Hugging Face, поддерживающая Open LLM Leaderboard, официально заявила, что MMLU больше не является объективным инструментом из-за проблемы contamination — утечки тестовых данных в обучающие выборки современных моделей. Это означает, что многие результаты, полученные с помощью MMLU, могут быть завышены, а сравнения моделей — некорректны. В этой статье мы разберем, что произошло, почему это важно и какие альтернативы предлагаются.

Проблема contamination в MMLU

Contamination — это ситуация, когда данные, используемые для тестирования модели, случайно или намеренно попадают в ее обучающий набор. В случае MMLU, который содержит тысячи вопросов по разным дисциплинам, многие современные модели, включая Llama 3 и GPT-4, могли быть обучены на этих же вопросах. Команда Open LLM Leaderboard отмечает, что contamination стала критической после выхода этих моделей: их высокая производительность на MMLU может объясняться не столько реальными способностями к рассуждению, сколько запоминанием ответов. Это подрывает доверие к бенчмарку как к объективному инструменту.

Почему это важно для сообщества AI

MMLU был не просто популярным тестом — он использовался в научных статьях, блогах и маркетинговых материалах для демонстрации превосходства одной модели над другой. Если результаты MMLU больше не заслуживают доверия, то многие заявления о лидерстве оказываются необоснованными. Это особенно критично для компаний, которые полагаются на рейтинги при выборе модели для внедрения, и для исследователей, которые строят свои работы на сравнениях. Сообществу срочно нужны новые, нескомпрометированные бенчмарки, которые позволят объективно оценивать прогресс в области AI.

Какие альтернативы MMLU существуют?

Команда Hugging Face рекомендует несколько альтернатив. Во-первых, MMLU-Pro — обновленная версия с более сложными вопросами и меньшей вероятностью утечки, так как она включает новые задачи, которых нет в открытом доступе. Во-вторых, GPQA (Google-Proof QA) — бенчмарк, требующий глубоких рассуждений и устойчивый к contamination, поскольку его вопросы созданы экспертами и не публикуются в интернете. Также рассматриваются другие тесты, такие как HumanEval для кода и GSM8K для математики. Эти бенчмарки ориентированы на конкретные навыки и менее подвержены утечкам.

Как изменится Open LLM Leaderboard

В ответ на проблему команда Open LLM Leaderboard планирует обновить свою платформу, добавив новые тесты и метрики. Вместо простого усреднения результатов по MMLU, они будут использовать комбинацию бенчмарков, включая MMLU-Pro, GPQA и другие. Также планируется внедрить динамические тесты, которые автоматически генерируют новые вопросы, чтобы избежать contamination. Это должно сделать рейтинг более объективным и полезным для сообщества. Однако точные сроки обновления пока не объявлены.

Кого затронет это изменение?

Изменение коснется всех, кто использует MMLU для оценки моделей: исследователей, разработчиков, компаний и даже конечных пользователей. Если вы выбираете модель на основе рейтинга Open LLM Leaderboard, стоит учитывать, что старые показатели могут быть ненадежными. Разработчикам придется пересмотреть свои методы оценки, а компаниям — адаптировать маркетинговые материалы. Пользователям, которые просто хотят выбрать лучшую модель для своих задач, стоит обращать внимание на новые бенчмарки и читать независимые обзоры.

Что пока неизвестно?

Несмотря на заявления, остается много неопределенности. Пока неясно, когда именно будет обновлен Open LLM Leaderboard и какие бенчмарки станут основными. Также неизвестно, как быстро сообщество адаптируется к новым тестам и будут ли они столь же широко приняты, как MMLU. Возможно, потребуется время, чтобы новые бенчмарки набрали популярность и стали стандартом. Кроме того, не исключено, что и новые тесты со временем столкнутся с проблемой contamination, поэтому процесс разработки надежных бенчмарков должен быть непрерывным.

Выводы

Отказ от MMLU как надежного бенчмарка — важный шаг для сообщества AI. Это признание того, что старые методы оценки больше не работают в условиях быстрого роста моделей и утечек данных. Команда Open LLM Leaderboard предлагает двигаться вперед, используя более устойчивые тесты, такие как MMLU-Pro и GPQA. Однако переход потребует времени и усилий от всех участников. Пользователям и разработчикам стоит быть внимательными и не полагаться только на один показатель. В конечном итоге, цель — создать систему оценки, которая действительно отражает способности моделей, а не их способность запоминать ответы.