MIRA-Math: бенчмарк для оценки способности ИИ запрашивать недостающую информацию в математике
Новый бенчмарк MIRA-Math проверяет, может ли языковая модель самостоятельно обнаружить, что в математической задаче не хватает одного факта, задать правильный вопрос и использовать полученный ответ для решения. Это принципиально иной подход к оценке ИИ, приближенный к реальным сценариям, где информа

Новый бенчмарк MIRA-Math проверяет, может ли языковая модель самостоятельно обнаружить, что в математической задаче не хватает одного факта, задать правильный вопрос и использовать полученный ответ для решения. Это принципиально иной подход к оценке ИИ, приближенный к реальным сценариям, где информация часто неполна. В отличие от традиционных тестов, где все данные даны заранее, MIRA-Math изолирует критическую способность — умение распознавать пробел в знаниях и активно его заполнять.
Что такое MIRA-Math и как он устроен
MIRA-Math — это бенчмарк, состоящий из 2310 математических задач, каждая из которых намеренно лишена ровно одного атомарного факта. Задачи охватывают 22 тематических семейства: от алгебры и теории вероятностей до линейных систем, дискретных структур, обработки сигналов, цепей Маркова, схем, интерполяции и численных граничных задач. Уникальность бенчмарка в том, что полное латентное состояние задачи всегда имеет единственный правильный ответ, но в формулировке, которую видит модель, отсутствует ключевая деталь. Модель должна на естественном языке запросить недостающий факт у фиксированного LLM-посредника (отвечающего). Если запрос корректен, посредник предоставляет точный требуемый факт; если нет — отказывает. После получения ответа модель вычисляет финальный результат. Валидация запросов и проверка ответов полностью детерминированы, что обеспечивает объективность оценки.
Почему MIRA-Math важен для развития ИИ
Существующие математические бенчмарки, такие как GSM8K или MATH, предоставляют все необходимые данные в условии. Интерактивные бенчмарки, напротив, смешивают рассуждение с использованием инструментов и длинными диалогами. MIRA-Math занимает промежуточное положение: он изолирует и измеряет отдельную диагностическую способность — умение модели понять, какой именно факт отсутствует, правильно его запросить и затем применить. Это приближает оценку к реальным сценариям, где информация неполна, и позволяет выявить слабые места моделей, которые не проявляются в стандартных тестах.
Какие модели уже протестированы и каковы результаты
Эксперименты с передовыми и малыми моделями показали, что успешность запроса и точность финального ответа разделимы. Модели могут попросить правильный факт, но ошибиться в вычислениях, или не получить подсказку из-за некорректного запроса. Это указывает на то, что способность задавать правильные вопросы и способность решать задачи — разные навыки, и MIRA-Math позволяет их оценивать по отдельности. Например, модель может правильно сформулировать вопрос, но затем допустить арифметическую ошибку, или наоборот — не суметь запросить нужную информацию, хотя в остальном решает задачу верно.
Кому будет полезен MIRA-Math
Разработчикам языковых моделей и систем ИИ, исследователям в области математического рассуждения и интерактивного обучения. Бенчмарк может быть полезен для оценки моделей в сценариях с неполной информацией, а также для тренировки навыков активного уточнения данных. MIRA-Math особенно актуален для тех, кто работает над системами, которые должны взаимодействовать с пользователем или внешними источниками для получения недостающих сведений.
Какие ограничения есть у MIRA-Math
На данный момент неизвестно, насколько хорошо бенчмарк коррелирует с реальными задачами, выходящими за рамки математики. Также неясно, как результаты зависят от выбора модели-посредника. Возможно, что разные посредники по-разному интерпретируют запросы, что может влиять на итоговую оценку. Кроме того, бенчмарк покрывает только математические домены, и его применимость к другим областям, таким как программирование или юридические задачи, требует дополнительных исследований.
Как MIRA-Math может повлиять на будущее тестирования ИИ
MIRA-Math открывает новое направление в оценке языковых моделей — активное запрашивание информации. В будущем подобные бенчмарки могут стать стандартом для проверки способности ИИ работать в условиях неопределенности. Это особенно важно для приложений, где модель должна самостоятельно выявлять пробелы в данных и инициировать диалог для их заполнения, например, в медицинской диагностике, юридическом консультировании или технической поддержке.
Заключение
MIRA-Math — это инновационный бенчмарк, который фокусируется на умении ИИ запрашивать недостающую информацию, а не только решать задачи с полными данными. Он позволяет раздельно оценить способность формулировать вопросы и способность вычислять, что дает более глубокое понимание сильных и слабых сторон моделей. Несмотря на ограничения, MIRA-Math представляет собой важный шаг к более реалистичной и диагностической оценке искусственного интеллекта.