Исследование: в иерархических поисковых агентах делегирование важнее исполнения
В иерархических поисковых агентах на основе больших языковых моделей (LLM) ключевым фактором производительности оказывается не мощность модели-исполнителя, а качество делегирования — разбиения сложного запроса на подзадачи. К такому выводу пришли исследователи из нескольких университетов, опубликова

В иерархических поисковых агентах на основе больших языковых моделей (LLM) ключевым фактором производительности оказывается не мощность модели-исполнителя, а качество делегирования — разбиения сложного запроса на подзадачи. К такому выводу пришли исследователи из нескольких университетов, опубликовавшие препринт, в котором анализируют распределение вычислительных ресурсов между ролями в таких системах. Они предложили факторизацию ролей: делегирование (разделение запроса на подзапросы), исполнение (поиск и извлечение фактов) и генерация ответа (фиксирована). Эксперименты на пяти бенчмарках multi-hop QA показали, что масштабирование модели для делегирования дает прирост Exact Match (EM) примерно на 11 пунктов, а для исполнения — только на 2,6 пункта. Это означает, что разработчики могут существенно экономить ресурсы, сосредоточившись на улучшении декомпозиции задач, а не на наращивании мощности поискового компонента.
Почему делегирование оказалось важнее исполнения
Результаты исследования указывают на узкое место производительности: качество декомпозиции задачи критичнее, чем мощность модели-исполнителя. В ходе экспериментов использовались модели шести масштабов — от 1.7B до 70B параметров. Факторизация ролей превзошла единого агента на 4.5–8.6 пунктов EM. Особенно показательно, что обученный дистилляцией исполнитель с всего 1.7B параметров (на качественно отфильтрованных траекториях) достиг точности frontier-агента, потребляя на 37% меньше токенов. Это подтверждает, что узким местом является не поиск информации, а способность правильно разбить вопрос на подвопросы. Например, на запрос "Какая высота самого высокого здания в городе, где родился автор книги 'Война и мир'?" агент должен сначала определить автора (Лев Толстой), затем место рождения (Ясная Поляна), потом найти самое высокое здание в этом регионе — и только после этого выполнять поиск. Ошибка на любом этапе делегирования приводит к неверному ответу, даже если исполнитель идеально справляется с поиском.
Как распределение ролей влияет на точность и затраты
Исследователи провели серию экспериментов, варьируя размеры моделей для каждой роли. Оказалось, что увеличение модели-делегатора с 7B до 70B параметров повышает EM на 11 пунктов, в то время как аналогичное масштабирование исполнителя дает лишь 2,6 пункта. Это означает, что для достижения высокой точности достаточно использовать мощную модель только на этапе делегирования, а для исполнения можно обойтись компактной моделью. Такой подход позволяет снизить вычислительные затраты без потери качества. В частности, комбинация делегатора 70B и исполнителя 1.7B показала результаты, сопоставимые с единым агентом на 70B, но при значительно меньшем потреблении токенов. Это открывает возможности для оптимизации архитектур поисковых агентов, особенно в системах RAG (Retrieval-Augmented Generation) и мультиагентных фреймворках.
Что это значит для разработчиков и исследователей
Практическая значимость работы в первую очередь касается разработчиков поисковых агентов на LLM, исследователей в области NLP и инженеров, оптимизирующих стоимость инференса. Результаты показывают, что вместо наращивания мощности всех компонентов системы следует сосредоточиться на улучшении модуля делегирования. Это может быть достигнуто за счет использования более крупных моделей для декомпозиции, применения техник дистилляции для создания эффективных исполнителей, а также разработки специализированных методов обучения для роли делегирования. Кроме того, факторизация ролей упрощает отладку и мониторинг системы, так как ошибки на этапе делегирования можно выявлять и исправлять независимо от поискового компонента.
Какие ограничения и нерешенные вопросы остаются
Несмотря на убедительные результаты, исследование имеет ряд ограничений. Во-первых, эксперименты проводились только на задачах multi-hop QA, и неизвестно, как выводы переносятся на другие типы запросов, например, на открытые вопросы или задачи с генерацией длинных ответов. Во-вторых, роль генерации ответа была зафиксирована (использовалась одна и та же модель), поэтому влияние ее масштабирования не изучалось. В-третьих, все эксперименты выполнялись на открытых моделях (серия Llama), и неясно, справедливы ли результаты для закрытых коммерческих моделей вроде GPT-4 или Claude, которые могут иметь иные архитектурные особенности. Наконец, в работе не рассматривались вопросы безопасности и согласованности ответов при делегировании: может ли разбиение запроса на подзадачи привести к потере контекста или появлению нерелевантных промежуточных результатов.
Перспективы применения в реальных системах
Полученные результаты уже сейчас могут быть использованы для оптимизации существующих поисковых агентов. Например, в системах RAG можно заменить единую LLM на пару "делегатор-исполнитель", где делегатор — мощная модель, а исполнитель — легковесная, обученная на дистиллированных данных. Это позволит снизить задержки и стоимость инференса, сохранив точность. В мультиагентных фреймворках факторизация ролей может быть расширена: один агент отвечает за декомпозицию, другой — за поиск, третий — за синтез ответа. Код экспериментов опубликован на GitHub, что позволяет сообществу воспроизвести результаты и адаптировать подход под свои задачи. В долгосрочной перспективе можно ожидать появления специализированных моделей, оптимизированных именно для роли делегирования, что еще больше повысит эффективность иерархических поисковых агентов.