Оркестрация агентов ИИ снижает затраты на выполнение задач на 41%
Оркестрация агентов искусственного интеллекта может сократить расходы на выполнение задач на 41%, при этом время выполнения уменьшается на 44%, а количество используемых токенов — на 38%. Эти результаты получены в ходе исследования компании Writer, разработчика платформы для агентного ИИ, которое по

Оркестрация агентов искусственного интеллекта может сократить расходы на выполнение задач на 41%, при этом время выполнения уменьшается на 44%, а количество используемых токенов — на 38%. Эти результаты получены в ходе исследования компании Writer, разработчика платформы для агентного ИИ, которое показало, что ключевым фактором экономии является не выбор модели, а архитектура оркестрационного слоя. В условиях, когда компании стремятся внедрять ИИ-агентов в production, оптимизация оркестрации становится более эффективным рычагом, чем смена модели.
Что произошло
Исследователи из Writer опубликовали препринт на arXiv, в котором продемонстрировали, что оркестровочный слой (harness) — компонент, управляющий контекстом, инструментами, последовательностью шагов и делегированием задач — оказывает решающее влияние на токен-экономику корпоративных агентов. В серии из 22 зафиксированных задач при смене оркестрации (стандартный production loop против Writer Agent Harness) средняя стоимость задачи снизилась с $0.21 до $0.12, то есть на 41%. Медианное время выполнения сократилось с 48 до 27 секунд (на 44%), а количество токенов на задачу уменьшилось с 14.2k до 8.8k (на 38%). При этом качество выполнения задач осталось на сопоставимом уровне: 0.78 против 0.81.
Почему это важно
Современная разработка агентов ИИ страдает от «токен-максинга» — стремления покупать возможности за счёт увеличения потребления токенов, что выражается в длинных цепочках рассуждений, большем количестве шагов и расширенных контекстах. Падение цены за токен маскирует рост общих затрат, и компании могут не замечать, как расходы на ИИ-агентов выходят из-под контроля. Исследование показывает, что ключевой рычаг против этого — не выбор модели, а архитектура оркестрации. Авторы утверждают, что на данном наборе задач оркестрация изменила стоимость задачи сильнее, чем полный разброс стоимости между шестью разными моделями.
Как оркестрация влияет на производительность ИИ-агентов?
Оркестрация определяет, как агент взаимодействует с инструментами, управляет контекстом и принимает решения о следующих шагах. В стандартном production loop агент часто выполняет избыточные действия, тратя токены на повторные вызовы или обработку ненужной информации. Writer Agent Harness оптимизирует эти процессы, например, за счёт более эффективного кэширования промптов и управления неудачами. В результате снижается не только стоимость, но и время выполнения, что критично для real-time приложений.
Детали эксперимента
В эксперименте использовались шесть моделей: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 и Palmyra X6. Единственной переменной был оркестровочный слой: замороженный conventional production loop против Writer Agent Harness. Эффект снижения затрат оказался инвариантным к модели — каждая модель подешевела на 33–61%. При этом прирост качества зависел от базовых способностей модели: корреляция между силой модели и выигрышем от оркестрации составила r=0.99 (n=6) — явление, названное «harness leverage». Качество на доллар выросло на 82%, а количество выполненных задач на миллион токенов увеличилось с 54.9 до 92.0. Авторы также формализовали токен-экономику на уровне оркестрации, включая эффективную входную цену с учётом кэширования промптов, и описали шесть семейств механизмов: от дисциплины формы кэша до управления затратами на неудачи.
Кого затронет
Результаты исследования в первую очередь важны для разработчиков и архитекторов корпоративных агентных систем, инженеров по оптимизации затрат на LLM, а также компаний, внедряющих агентный ИИ в production. Они показывают, что инвестиции в оркестрацию могут дать больший экономический эффект, чем смена модели. Если ваша команда тратит значительные средства на API вызовы, возможно, стоит пересмотреть архитектуру оркестрации, прежде чем переходить на более дорогую модель.
Что пока неизвестно
Исследование проведено на синтетическом наборе из 22 задач; на реальных корпоративных рабочих нагрузках результаты могут отличаться. Конкретные детали реализации Writer Agent Harness не раскрыты, что затрудняет воспроизведение. Эффект долгосрочного использования и влияния на стоимость инфраструктуры (например, GPU) не оценивался. Тем не менее, полученные данные убедительно демонстрируют потенциал оптимизации оркестрации как инструмента снижения затрат без потери качества.