OpenAI представила SWE-bench Verified: новый стандарт оценки ИИ в разработке ПО

OpenAI анонсировала SWE-bench Verified — вручную проверенный поднабор оригинального бенчмарка SWE-bench, который призван более надёжно оценивать способность AI-моделей решать реальные задачи из области разработки программного обеспечения. Этот шаг стал ответом на давнюю проблему: оригинальный SWE-be

OpenAI представила SWE-bench Verified: новый стандарт оценки ИИ в разработке ПО

OpenAI анонсировала SWE-bench Verified — вручную проверенный поднабор оригинального бенчмарка SWE-bench, который призван более надёжно оценивать способность AI-моделей решать реальные задачи из области разработки программного обеспечения. Этот шаг стал ответом на давнюю проблему: оригинальный SWE-bench содержал множество задач с некорректными или неоднозначными метками, что снижало достоверность оценки. Теперь, благодаря человеческой валидации, исследователи и разработчики смогут точнее сравнивать модели и отслеживать прогресс в автоматизации программирования.

Почему оригинальный SWE-bench нуждался в улучшении Оригинальный SWE-bench, выпущенный в 2023 году, быстро стал популярным инструментом для оценки AI-моделей в решении задач программирования. Однако в процессе использования сообщество выявило серьёзные недостатки: многие задачи имели некорректные тесты, неоднозначные описания или вовсе не имели однозначного решения. Это приводило к тому, что модели могли получать высокие баллы, не решая задачи по существу, или, наоборот, недополучать заслуженные очки. SWE-bench Verified решает эту проблему: все задачи прошли ручную проверку экспертами-разработчиками, которые убедились в корректности тестов и ясности описаний. Такой подход позволяет получить более объективную картину реальных возможностей AI-моделей.

Как создавался SWE-bench Verified Процесс создания SWE-bench Verified включал несколько этапов. Сначала из оригинального набора были отобраны задачи, основанные на реальных issue из GitHub-репозиториев популярных Python-проектов. Затем эксперты-люди проверили каждую задачу: они убедились, что тесты корректны, описание однозначно, а решение существует и может быть проверено. В итоге в поднабор вошли только те задачи, которые прошли эту строгую валидацию. OpenAI планирует использовать SWE-bench Verified для оценки своих будущих моделей, что должно повысить доверие к результатам бенчмарка.

Какие задачи включает SWE-bench Verified Все задачи в SWE-bench Verified основаны на реальных проблемах из разработки ПО — это баги, запросы на добавление функций, улучшения документации и другие типовые задачи. Каждая задача сопровождается набором тестов, которые позволяют однозначно определить, решена ли она. Важно, что задачи взяты из популярных open-source проектов на Python, таких как Django, Flask, SymPy и другие. Это гарантирует, что оценка отражает способность модели работать с реальным кодом, а не с искусственно созданными примерами.

Кому будет полезен SWE-bench Verified Новый бенчмарк в первую очередь предназначен для исследователей и разработчиков AI-моделей, работающих в области автоматического программирования. Он позволит им точнее оценивать свои модели и сравнивать их с конкурентами. Кроме того, SWE-bench Verified будет полезен компаниям, которые внедряют AI-ассистентов для разработки — они смогут объективно оценить, насколько хорошо модель справляется с реальными задачами. Наконец, сам бенчмарк может стать стандартом для индустрии, подобно тому, как GLUE и SuperGLUE стали стандартами для оценки NLP-моделей.

Какие ограничения есть у SWE-bench Verified Несмотря на все преимущества, SWE-bench Verified имеет и ограничения. Во-первых, он охватывает только задачи на Python, что не отражает весь спектр языков программирования. Во-вторых, задачи взяты из open-source проектов, которые могут не полностью соответствовать задачам в коммерческой разработке. В-третьих, сам процесс валидации трудоёмок и может быть сложно масштабируем. Тем не менее, SWE-bench Verified представляет собой значительный шаг вперёд по сравнению с оригинальным бенчмарком.

Что пока неизвестно о SWE-bench Verified OpenAI пока не раскрыла точный размер поднабора — сколько именно задач вошло в SWE-bench Verified. Также не опубликована детальная методология валидации: например, сколько экспертов проверяли каждую задачу и как достигалось согласие между ними. Кроме того, неизвестно, планирует ли OpenAI сделать SWE-bench Verified общедоступным или он останется внутренним инструментом компании. Эти детали важны для сообщества, так как от них зависит, сможет ли бенчмарк стать действительно открытым стандартом.

Перспективы развития SWE-bench Verified В будущем SWE-bench Verified может стать основой для более масштабных и разнообразных бенчмарков. Например, можно добавить задачи на других языках программирования, включить задачи из коммерческих проектов или расширить типы задач (например, рефакторинг, оптимизация). OpenAI также может интегрировать SWE-bench Verified в свои инструменты для разработчиков, такие как GitHub Copilot, чтобы оценивать их эффективность в реальных условиях. В любом случае, появление этого бенчмарка — важный шаг к более надёжной оценке AI в программировании.