Terminus-4B: как маленькая языковая модель обошла гигантов в агентных задачах

Небольшая языковая модель Terminus-4B, созданная на базе Qwen3-4B, доказала, что может успешно заменять фронтирные LLM в агентных задачах выполнения команд. Исследователи обучили её с помощью supervised fine-tuning и reinforcement learning, используя rubric-based LLM-as-judge reward. Результаты пока

Terminus-4B: как маленькая языковая модель обошла гигантов в агентных задачах

Небольшая языковая модель Terminus-4B, созданная на базе Qwen3-4B, доказала, что может успешно заменять фронтирные LLM в агентных задачах выполнения команд. Исследователи обучили её с помощью supervised fine-tuning и reinforcement learning, используя rubric-based LLM-as-judge reward. Результаты показали, что Terminus-4B не только сравнима с крупными моделями вроде Claude Sonnet/Opus и GPT-5.3-Codex, но и превосходит их по ряду метрик, одновременно сокращая потребление токенов основным агентом примерно на 30%. Это открытие меняет представление о том, что для сложных агентных задач обязательно нужны гигантские модели.

Что такое Terminus-4B и как он работает

Terminus-4B — это специализированная языковая модель, предназначенная для выполнения терминальных команд в составе агентных систем. Она построена на основе открытой модели Qwen3-4B, которая была дообучена в два этапа. Сначала модель прошла supervised fine-tuning (SFT) на собранных данных, включающих примеры выполнения команд и анализа вывода. Затем последовал этап reinforcement learning (RL), где в качестве награды использовался LLM-судья, оценивающий качество выполнения по заранее заданным рубрикам. Такой подход позволил модели научиться не только правильно выполнять команды, но и интерпретировать результаты, что критически важно для агентных систем.

Почему маленькая модель может быть эффективнее больших

Современные кодинг-агенты часто делегируют специализированные подзадачи субагентам — меньшим, сфокусированным циклам, которые берут на себя узкие обязанности, такие как поиск, отладка или выполнение команд в терминале. Обычно для таких субагентов используются фронтирные модели, что дорого и неэффективно. Terminus-4B демонстрирует, что хорошо обученная маленькая модель может заменить гигантские LLM в этих задачах, снижая затраты и нагрузку на контекстное окно основного агента. Более того, специализированная маленькая модель часто лучше справляется с конкретной задачей, так как её обучение было целенаправленным.

Каких результатов удалось достичь

Оценка проводилась на бенчмарках SWE-Bench Pro и внутреннем SWE-Bench C, которые содержат много задач с многословными выводами — логи сборки, результаты тестов. Terminus-4B сокращает использование токенов основным агентом на ~30% по сравнению с конфигурацией без субагента. Модель улучшает ключевые метрики: основной агент чаще полагается на выводы субагента и реже сам выполняет терминальные задачи. Terminus-4B превосходит vanilla Qwen3-4B и закрывает разрыв с фронтирными моделями, часто превосходя их.

Какие преимущества получают разработчики агентных систем

Для разработчиков это означает снижение стоимости и сложности инфраструктуры. Вместо того чтобы платить за вызовы дорогих API или разворачивать огромные модели, можно использовать компактную Terminus-4B, которая работает быстрее и дешевле. Кроме того, уменьшение потребления токенов основным агентом позволяет обрабатывать больше контекста или выполнять больше задач за те же деньги. Исследователи в области сжатия и дообучения моделей также получают новый ориентир: маленькая модель может быть не хуже, а иногда и лучше большой, если её правильно обучить.

Какие ограничения и неизвестные факторы остаются

Несмотря на впечатляющие результаты, детали архитектуры и гиперпараметры обучения пока не раскрыты. Конкретные данные для SFT и рубрики для RL также остаются неизвестными. Неясно, можно ли применить этот подход к другим типам субагентов, например, к поиску или отладке. Производительность на других бенчмарках и в реальных сценариях ещё предстоит проверить. Однако уже сейчас ясно, что Terminus-4B открывает путь к более эффективным и экономичным агентным системам.

Что это значит для будущего AI-агентов

Успех Terminus-4B подчёркивает важность специализации моделей. Вместо того чтобы использовать одну гигантскую модель для всего, можно создать набор маленьких, узконаправленных моделей, которые работают вместе. Это снижает затраты, повышает скорость и улучшает качество результатов. Возможно, в будущем мы увидим целые экосистемы таких субагентов, каждый из которых отвечает за свою задачу. Команды, использующие LLM в CI/CD и автоматизации разработки, уже сейчас могут начать экспериментировать с подобными подходами.

Как это повлияет на индустрию разработки ПО

Внедрение Terminus-4B и подобных моделей может кардинально изменить подход к автоматизации разработки. Вместо дорогих вызовов внешних API можно развернуть собственную маленькую модель, которая будет выполнять терминальные задачи быстрее и дешевле. Это особенно актуально для компаний, которые обрабатывают большие объёмы данных или работают в условиях ограниченных ресурсов. Кроме того, снижение нагрузки на основного агента позволяет ему сосредоточиться на более сложных задачах, что повышает общую эффективность системы.

Заключение

Terminus-4B — это яркий пример того, что размер не всегда имеет значение. Правильно обученная маленькая модель может не только заменить, но и превзойти гигантов в узких задачах. Это открытие стимулирует дальнейшие исследования в области специализированных моделей и обещает сделать агентные системы более доступными и эффективными. Разработчикам стоит обратить внимание на этот подход и рассмотреть возможность его применения в своих проектах.