Как решить 67% задач ARC-AGI-1 за $0.62: агенты на DeepSeek V3.2 без дообучения

Две новые архитектуры агентов на основе открытой модели DeepSeek V3.2 (режим non-thinking) позволяют решить 67.25% задач ARC-AGI-1 при стоимости всего $0.62 за задачу — без какого-либо дообучения на этих данных. Этот прорыв демонстрирует, что грамотное построение пайплайна может заменить дорогостоящ

Как решить 67% задач ARC-AGI-1 за $0.62: агенты на DeepSeek V3.2 без дообучения

Две новые архитектуры агентов на основе открытой модели DeepSeek V3.2 (режим non-thinking) позволяют решить 67.25% задач ARC-AGI-1 при стоимости всего $0.62 за задачу — без какого-либо дообучения на этих данных. Этот прорыв демонстрирует, что грамотное построение пайплайна может заменить дорогостоящую тонкую настройку и открывает путь к доступным решениям для задач абстрактного мышления.

Что произошло

Команда исследователей представила две архитектуры агентов, построенных на открытой модели DeepSeek V3.2 в режиме non-thinking. Первая архитектура — Explorer-Definer Pipeline — показала результат 57.50% pass@2 при затратах $0.25 за задачу. Вторая — Reflective Orchestrator — улучшила показатель до 67.25% pass@2, но стоимость выросла до $0.62 за задачу. Для сравнения: базовый one-shot показатель составляет всего 15.50%, то есть прирост составил около 52 процентных пункта. Обе архитектуры не используют дообучение на ARC-AGI-1, что делает их особенно привлекательными для исследователей с ограниченными ресурсами.

Почему это важно

До сих пор успехи на ARC-AGI-1 достигались либо за счет огромных вычислительных ресурсов на этапе тестирования (эволюционный поиск, перебор, длинные цепочки рассуждений), либо путем тонкой настройки моделей на данных ARC. Предложенный подход использует дешевую открытую модель без специализированного обучения, что делает его доступным для широкого круга исследователей и демонстрирует, что архитектура агента может компенсировать отсутствие дообучения. Это особенно важно для задач абстрактного мышления, где требуется обобщение, а не запоминание.

Как работают эти агенты и почему они эффективны?

Explorer-Definer Pipeline разделяет процесс на два этапа: обнаружение паттернов и синтез исполняемых трансформаций. Сначала агент анализирует обучающие пары вход-выход, выявляя закономерности. Затем он генерирует гипотезы о трансформациях и проверяет их на обучающих данных. Reflective Orchestrator расширяет этот пайплайн, добавляя автономное исследование новых трансформаций, если предыдущие гипотезы не подтверждаются на обучающих парах. Это позволяет агенту адаптироваться к более сложным задачам без вмешательства человека.

Анализ unbiased pass@k показал, что пайплайн ограничен генерацией, а не отбором: отбор по точности на обучающих парах захватывает примерно 95% потолка кандидатов. Это означает, что основное узкое место — способность модели генерировать правильные гипотезы, а не отсеивать неверные. Абляция выявила, что инструмент "think" является значимым компонентом: его удаление снижает pass@2 на 5.75 пункта. Инструмент "think" позволяет агенту делать паузу и обдумывать сложные случаи, что критически для задач, требующих многошаговых рассуждений.

Кого затронет этот подход

Разработчики ИИ-агентов получат готовые архитектуры, которые можно адаптировать под свои задачи без затрат на дообучение. Исследователи в области абстрактного мышления и обобщения смогут использовать эти пайплайны как бейзлайн для сравнения новых методов. Компании, стремящиеся к экономичным решениям для сложных задач рассуждения, найдут в этом подходе способ снизить вычислительные затраты без потери качества. Кроме того, открытость модели DeepSeek V3.2 позволяет воспроизвести результаты и модифицировать архитектуру под конкретные нужды.

Что пока неизвестно

Неясно, насколько эти архитектуры масштабируются на более сложные версии ARC (например, ARC-AGI-2) и как они поведут себя на других бенчмарках, требующих абстрактного мышления. Также не раскрыты детали реализации инструмента "think" — возможно, это ключевой компонент, который сложно воспроизвести без точных спецификаций. Остается открытым вопрос о стабильности результатов при изменении гиперпараметров или seed случайности. Будущие исследования должны пролить свет на эти аспекты, но уже сейчас ясно, что предложенный подход задает новый стандарт доступности в области абстрактного мышления.