Claude Fable 5 против GPT-5.6 Sol: почему разрыв в кодинге втрое и что это значит

Бенчмарк MirrorCode от Epoch AI показал неожиданный результат: Claude Fable 5 от Anthropic решил 64% задач, тогда как GPT-5.6 Sol от OpenAI справился лишь с 20%. Это втрое больше, что выглядит аномалией на фоне других тестов, где модели идут почти вровень. Разберемся, почему так произошло и какие вы

Claude Fable 5 против GPT-5.6 Sol: почему разрыв в кодинге втрое и что это значит

Бенчмарк MirrorCode от Epoch AI показал неожиданный результат: Claude Fable 5 от Anthropic решил 64% задач, тогда как GPT-5.6 Sol от OpenAI справился лишь с 20%. Это втрое больше, что выглядит аномалией на фоне других тестов, где модели идут почти вровень. Разберемся, почему так произошло и какие выводы стоит сделать разработчикам и бизнесу.

MirrorCode — это тест, который оценивает способность языковых моделей генерировать код с нуля по текстовому описанию. В отличие от HumanEval или SWE-bench, где модели могут опираться на частичный код или контекст, здесь требуется чистый синтез программы. Это сложнее и ближе к реальным задачам разработки, где программист часто пишет функции и модули с чистого листа.

Почему Claude Fable 5 так сильно опередил GPT-5.6 Sol

Ключевая причина, скорее всего, кроется в архитектуре и подходе к обучению. Anthropic в последних версиях Claude сделала акцент на улучшении навыков программирования, используя синтетические данные и reinforcement learning с обратной связью от кода. Это позволило модели лучше справляться с задачами, требующими точной генерации полного кода, где важны синтаксис и логика.

GPT-5.6 Sol, в свою очередь, может быть оптимизирован для других задач, таких как работа с большими контекстами или мультимодальными входами. OpenAI, возможно, пожертвовала чистым синтезом кода в пользу более широкой функциональности, что и привело к разрыву на MirrorCode. Однако это лишь гипотеза, так как ни OpenAI, ни Epoch AI не предоставили детальных объяснений.

Какие именно задачи провалил GPT-5.6 Sol на MirrorCode?

Анализ лидерборда показывает, что GPT-5.6 Sol особенно слаб в задачах, требующих генерации сложных алгоритмов с нуля, например, при реализации сортировок, обходов графов или работе с динамическим программированием. В то же время в простых задачах, вроде написания базовых функций, модель показывает приемлемые результаты. Это говорит о том, что OpenAI, возможно, сфокусировалась на других аспектах, таких как рассуждение и работа с текстом, а не на глубоком программировании.

Предыстория и контекст

Бенчмарк MirrorCode был представлен Epoch AI в начале 2025 года как ответ на критику существующих тестов, которые часто были засорены данными из обучающих выборок моделей. Разработчики создали набор задач, которые не встречались в открытых репозиториях кода, чтобы исключить возможность «заучивания» ответов. Это сделало бенчмарк более надежным индикатором реальных способностей моделей к программированию.

С момента появления MirrorCode на лидерборде наблюдалась интересная динамика. Первые версии GPT-4 и Claude 3 показывали примерно одинаковые результаты, но с выходом новых моделей разрыв начал увеличиваться. Anthropic явно сделала ставку на улучшение кодовых навыков, что видно по росту результатов Claude Fable 5. OpenAI, в свою очередь, сконцентрировалась на других аспектах, таких как рассуждение и работа с текстом, что могло сказаться на результатах MirrorCode.

Как устроен бенчмарк MirrorCode

MirrorCode состоит из набора задач, каждая из которых представляет собой описание программы на естественном языке. Модель должна сгенерировать код на Python, который затем проверяется на наборе юнит-тестов. Важно, что задачи подобраны так, чтобы они были реалистичными и отражали типичные сценарии разработки: от простых функций до сложных алгоритмов обработки данных.

Уникальность MirrorCode в том, что он оценивает не только способность модели генерировать синтаксически корректный код, но и ее умение правильно интерпретировать требования, выбирать подходящие алгоритмы и структуры данных. Это делает его более сложным, чем HumanEval, где задачи часто тривиальны, и более релевантным для реальных задач разработки.

Что это значит для пользователей и разработчиков

Для разработчиков, которые используют языковые модели для автоматизации написания кода, результаты MirrorCode имеют прямое практическое значение. Если вы часто просите модель написать функцию или модуль с нуля, Claude Fable 5 может оказаться более надежным выбором, чем GPT-5.6 Sol. Однако не стоит забывать, что в задачах, где требуется работа с существующим кодом или интеграция с внешними библиотеками, GPT-5.6 Sol может быть не хуже или даже лучше.

Для бизнеса, который внедряет ИИ в процессы разработки, важно понимать, что выбор модели должен зависеть от конкретных задач. Универсальных лидеров не существует, и каждый бенчмарк отражает лишь определенный срез возможностей. Поэтому перед принятием решения стоит провести собственные тесты на реальных задачах команды.

Кого затронет и как

Результаты MirrorCode могут повлиять на выбор инструментов в стартапах и крупных компаниях. Например, команды, которые активно используют AI-ассистентов для написания кода с нуля, могут пересмотреть свои предпочтения в пользу Claude Fable 5. В то же время OpenAI может ответить улучшением GPT-5.6 Sol в следующем обновлении, что усилит конкуренцию на рынке.

В России и СНГ также наблюдается рост интереса к языковым моделям для разработки. Многие компании используют как зарубежные API, так и локальные решения. Результаты MirrorCode могут помочь им сделать более обоснованный выбор, особенно если они ориентируются на задачи генерации кода.

Что будет дальше

Epoch AI, вероятно, продолжит обновлять лидерборд по мере выхода новых моделей. Уже анонсированы следующие версии от OpenAI и Anthropic, и можно ожидать, что борьба за первое место в MirrorCode станет еще более острой. Также возможно, что OpenAI пересмотрит подход к обучению GPT-5.6 Sol, чтобы улучшить его показатели на этом бенчмарке.

Эксперты предполагают, что в ближайшие месяцы мы увидим обновления обеих моделей, направленные на устранение слабых мест. Возможно, появятся специализированные версии моделей, оптимизированные для генерации кода, что сделает инструменты еще более мощными.

Итог

Результаты MirrorCode показывают, что даже флагманские модели могут сильно различаться в конкретных задачах. Claude Fable 5 демонстрирует превосходство в переписывании программ с нуля, что может стать решающим фактором для разработчиков. Однако окончательные выводы делать рано — конкуренция на рынке ИИ усиливается, и мы, вероятно, увидим новые изменения в ближайшее время. Следите за обновлениями лидерборда, чтобы быть в курсе последних тенденций.