Новый метод измерения интеллекта ИИ: оценка за пределами человеческих возможностей

Исследователи предложили принципиально новый подход к измерению интеллекта искусственного интеллекта, который выходит за рамки возможностей человека. Вместо традиционных тестов, созданных людьми, новая система использует состязательную психометрическую рейтинговую систему, где модели сами генерируют

Новый метод измерения интеллекта ИИ: оценка за пределами человеческих возможностей

Исследователи предложили принципиально новый подход к измерению интеллекта искусственного интеллекта, который выходит за рамки возможностей человека. Вместо традиционных тестов, созданных людьми, новая система использует состязательную психометрическую рейтинговую систему, где модели сами генерируют задачи для оценки друг друга. Это позволяет избежать насыщения бенчмарков и оценивать ИИ, превосходящий человеческий уровень.

Как работает новый метод измерения интеллекта ИИ

Традиционные бенчмарки, такие как тесты на понимание языка или решение задач, быстро становятся неэффективными, когда ИИ достигает или превосходит человеческие показатели. Авторы статьи arXiv:2607.07040 предлагают отказаться от абсолютной шкалы в пользу относительного измерения. В их системе модели генерируют публичные задачи, которые затем решают другие ИИ-системы. Результаты агрегируются в рейтинг, где сложность задач динамически подстраивается под уровень участников.

Ключевое преимущество такого подхода — масштабируемость. По мере развития технологий задачи становятся сложнее, что позволяет оценивать даже самые продвинутые системы. Кроме того, система уменьшает стимулы для атак с использованием приватной информации, так как задачи создаются открыто и проверяются другими моделями.

Почему традиционные бенчмарки больше не работают

Современные ИИ-системы, такие как GPT-4 или Gemini, уже превосходят людей во многих задачах: от перевода до решения математических проблем. Однако существующие тесты, разработанные людьми, имеют потолок сложности. Когда все модели начинают получать максимальные баллы, тест перестает различать их по интеллекту. Это явление называется насыщением бенчмарка.

Новый метод решает эту проблему, делая оценку бесконечно масштабируемой. Задачи, создаваемые моделями, могут быть сколь угодно сложными, что позволяет сравнивать даже системы, значительно превосходящие человеческие способности. Таким образом, подход подходит для оценки будущих AGI и сверхразумных систем.

Какие задачи могут использовать модели для оценки друг друга?

Фреймворк поддерживает два типа доменов: верифицируемые и неверифицируемые. В верифицируемых доменах, таких как математика или программирование, правильность ответа можно проверить автоматически. Например, одна модель может создать сложную теорему, а другая — доказать ее. В неверифицируемых доменах, например, в творческом письме или генерации идей, оценка требует судейства, которое также может выполняться ИИ без участия человека.

Это делает систему универсальной: она применима как к точным наукам, так и к гуманитарным областям. Важно, что протоколы уменьшают стимулы для сговора или атак, так как задачи публичны, а рейтинг вычисляется на основе совместных результатов.

Кого затронет новый подход к оценке ИИ

Новая система в первую очередь повлияет на разработчиков ИИ и исследователей, занимающихся оценкой интеллекта. Они получат инструмент для объективного сравнения моделей без ограничений человеческих тестов. Организации, тестирующие ИИ-системы, смогут использовать рейтинг для сертификации и выбора лучших решений.

Для конечных пользователей это означает более прозрачные и надежные рейтинги ИИ-помощников. Например, при выборе чат-бота или генератора кода можно будет опираться на объективные показатели, а не на маркетинговые заявления.

Что остается неясным в новом методе

Несмотря на теоретическую проработанность, практическая реализация для неверифицируемых доменов вызывает вопросы. Как обеспечить справедливое судейство без человеческого контроля? Как предотвратить коллапс системы, если модели начнут сговариваться или генерировать слишком простые задачи? Авторы признают, что необходимы эмпирические эксперименты, которые пока не проведены.

Кроме того, устойчивость к атакам требует дальнейшего изучения. Хотя протоколы уменьшают стимулы, полностью исключить злонамеренное поведение сложно. Тем не менее, предложенный фреймворк открывает новые горизонты для измерения интеллекта ИИ и может стать стандартом в будущем.