OpenAI представила GDPval: новый тест производительности ИИ на реальных задачах из 44 профессий
OpenAI представила GDPval — новый метод оценки производительности своих моделей, основанный на реальных задачах из 44 профессий, вносящих вклад в ВВП. Бенчмарк измеряет, насколько эффективно модели справляются с экономически ценными действиями, такими как написание кода, анализ данных или юридическо

OpenAI представила GDPval — новый метод оценки производительности своих моделей, основанный на реальных задачах из 44 профессий, вносящих вклад в ВВП. Бенчмарк измеряет, насколько эффективно модели справляются с экономически ценными действиями, такими как написание кода, анализ данных или юридическое консультирование. Это первый тест, который напрямую связывает возможности искусственного интеллекта с экономической ценностью, а не с абстрактными академическими показателями.
Почему GDPval отличается от традиционных бенчмарков
Традиционные тесты, такие как MMLU или HumanEval, проверяют знания и навыки в изоляции. MMLU оценивает способность модели отвечать на вопросы из разных областей знаний, а HumanEval — писать код по описанию. Однако эти тесты не учитывают, насколько полезны эти навыки в реальной работе. Например, модель может блестяще решать задачи по математике, но не справляться с анализом финансовой отчётности, который требует понимания контекста и нюансов. GDPval впервые связывает производительность ИИ с экономической ценностью, что позволяет бизнесу и исследователям понять, где модели действительно полезны, а где — нет. Это может повлиять на приоритеты в разработке ИИ и его внедрение в экономику.
Как устроен GDPval
GDPval охватывает 44 профессии, включая разработчиков ПО, бухгалтеров, врачей и юристов. Для каждой профессии отобраны типичные задачи, оцениваемые по шкале от 0 до 100. Например, для разработчика это может быть написание функции или рефакторинг кода, для юриста — составление договора. OpenAI протестировала свои модели (GPT-4o, GPT-4, o1) и показала, что лучшие из них достигают около 50% от среднего уровня человека. Бенчмарк использует данные о распределении зарплат и времени выполнения задач для взвешивания результатов. Это значит, что задачи, которые занимают больше времени или оплачиваются выше, имеют больший вес в итоговой оценке. Таким образом, GDPval отражает не просто точность, а реальную экономическую ценность.
Какие профессии вошли в GDPval и почему это важно для бизнеса
В список вошли как высокотехнологичные специальности (разработчики, аналитики данных), так и традиционные (бухгалтеры, врачи, юристы). Такой широкий охват позволяет оценить, в каких сферах ИИ уже сейчас может быть полезен, а где его возможности ограничены. Для бизнеса это означает возможность понять, какие процессы можно автоматизировать с помощью ИИ, а где требуется человеческий контроль. Например, если модель показывает высокие результаты в задачах бухгалтера, компания может рассмотреть внедрение ИИ для обработки счетов. Если же результаты низкие в медицинской диагностике, то доверять ИИ такие задачи пока рано.
Кого затронет внедрение GDPval
Разработчики ИИ получат новый инструмент для сравнения моделей. Теперь они могут оценивать не только то, насколько модель умна в теории, но и насколько она полезна на практике. Бизнес сможет оценить, какие процессы можно автоматизировать, а какие требуют человеческого участия. Инвесторы и аналитики получат более объективную метрику для оценки прогресса в области ИИ. Вместо того чтобы полагаться на субъективные впечатления или оторванные от жизни тесты, они смогут опираться на данные о реальной производительности. Это может изменить подход к финансированию стартапов и выбору технологий.
Что пока неизвестно о GDPval
OpenAI не раскрыла полный список задач и методику сбора данных для GDPval. Также неясно, как часто будет обновляться бенчмарк и будет ли он открыт для сторонних моделей. Пока что это внутренний инструмент OpenAI, но компания намекнула, что может поделиться им с сообществом. Если GDPval станет открытым, это может стать стандартом для оценки ИИ, аналогично тому, как MMLU стал стандартом для оценки знаний. Однако без прозрачности методики доверие к результатам может быть ограничено.
Как GDPval может изменить развитие ИИ
Если GDPval получит широкое признание, разработчики начнут оптимизировать модели именно под экономически значимые задачи. Это может привести к появлению более специализированных ИИ, которые отлично справляются с конкретными профессиями, но не обязательно универсальны. С другой стороны, это может замедлить прогресс в областях, которые не приносят прямой экономической выгоды, но важны для науки или общества. В любом случае, появление такого бенчмарка — важный шаг к тому, чтобы ИИ стал более практичным и полезным инструментом.
Заключение
GDPval — это не просто очередной тест, а попытка измерить реальную ценность ИИ для экономики. Он показывает, что даже лучшие модели пока далеки от человеческого уровня в большинстве профессий, но уже способны выполнять многие задачи на уровне, близком к среднему работнику. Для бизнеса это сигнал, что ИИ можно внедрять, но с осторожностью. Для разработчиков — ориентир для улучшения. А для всех нас — напоминание, что прогресс в ИИ измеряется не только баллами на тестах, но и реальной пользой.