Агентный RAG на бенчмарке TRuST: как тестируют многошаговый поиск
Представьте, что вы задаете системе вопрос, на который нельзя ответить одним запросом к базе знаний. Например: «Какой город является столицей страны, где родился автор книги X?» Чтобы ответить, нужно сначала найти автора, затем страну, затем столицу. Классический RAG (Retrieval-Augmented Generation)

Представьте, что вы задаете системе вопрос, на который нельзя ответить одним запросом к базе знаний. Например: «Какой город является столицей страны, где родился автор книги X?» Чтобы ответить, нужно сначала найти автора, затем страну, затем столицу. Классический RAG (Retrieval-Augmented Generation) сделает один запрос и, скорее всего, не справится. Агентный RAG — это эволюция подхода, при которой языковая модель сама планирует несколько шагов поиска, анализирует промежуточные результаты и уточняет запросы, имитируя работу исследователя. Именно такие многошаговые сценарии тестирует бенчмарк TRuST, специально созданный для оценки сложных поисковых задач. Результаты экспериментов, описанные в статье на Хабре, показывают, что агентный RAG действительно превосходит классические методы, но только при правильной настройке архитектуры и промптов. В этом материале мы разберем, как устроен агентный RAG, почему TRuST стал важным инструментом для разработчиков, и что эти эксперименты значат для будущего поисковых систем и чат-ботов.
Эволюция агентного RAG: от простого к сложному
Развитие агентного RAG прошло несколько этапов. На начальном этапе использовалась классическая связка «ретривер + генератор», где модель делала один запрос и получала ответ. Затем появились итеративные подходы: модель делала несколько запросов, уточняя их на основе предыдущих результатов. Но настоящий прорыв произошел, когда в архитектуру добавили планировщик — отдельный компонент, который разбивает сложный вопрос на подзадачи и определяет порядок их выполнения. В эксперименте, описанном в статье, сравнивались три архитектуры: простая (один запрос), итеративная (несколько запросов без планирования) и агентная (с планировщиком и памятью). Результаты показали, что агентная архитектура значительно превосходит остальные на задачах TRuST, особенно когда требуется более трех шагов поиска. Например, точность ответов на многошаговые вопросы выросла с 45% до 78% по сравнению с классическим RAG. Однако это потребовало больше вычислительных ресурсов и времени на выполнение.
Предыстория и контекст: почему TRuST важен
Бенчмарк TRuST появился не случайно. С развитием RAG-систем стало очевидно, что стандартные метрики, такие как точность и полнота поиска, не отражают реальную сложность задач. Пользователи все чаще задают вопросы, требующие синтеза информации из нескольких источников, и простые RAG-системы с этим не справляются. TRuST был создан для оценки именно таких сценариев: он включает задачи с многошаговыми рассуждениями, противоречивыми данными и необходимостью принимать решения на основе неполной информации. Автор статьи отмечает, что TRuST стал ответом на потребность индустрии в более реалистичных тестах. Многие компании внедряют RAG в свои продукты, но сталкиваются с тем, что модели хорошо работают на простых вопросах и проваливаются на сложных. TRuST позволяет выявить эти слабые места и понять, какие архитектурные решения действительно улучшают качество.
Как работает агентный RAG и чем отличается от классического?
Агентный RAG работает следующим образом: модель получает вопрос, планирует последовательность действий, выполняет поиск, анализирует результаты, при необходимости корректирует план и повторяет до тех пор, пока не будет уверена в ответе. Ключевое отличие от классического RAG — наличие цикла обратной связи и возможность модели самой решать, когда остановиться. В классическом RAG модель делает один запрос к базе знаний, получает несколько документов и генерирует ответ на их основе. Если нужных данных в этих документах нет, ответ будет неполным или неверным. В агентном RAG модель может запросить дополнительные данные, уточнить поисковый запрос или даже изменить стратегию поиска. Например, если первый запрос вернул слишком общие результаты, модель может сузить его, добавив уточняющие ключевые слова. Это делает систему более гибкой и адаптивной к сложным вопросам.
Технические детали: модели, промпты и метрики
В статье приведены результаты сравнения нескольких моделей на бенчмарке TRuST. Лучшие результаты показали модели с открытым весом, такие как Llama 3 70B и Qwen 2.5 72B, которые достигли точности около 80% на многошаговых задачах. Проприетарные модели, такие как GPT-4o, показали схожие результаты, но автор отмечает, что разница была в пределах статистической погрешности. Однако важным фактором оказалась не только модель, но и качество промптов. Автор подчеркивает, что правильно составленные промпты могут улучшить результат на 15-20 процентных пунктов. В частности, важно четко описывать роли (например, «ты — исследователь, который ищет факты»), давать примеры промежуточных шагов и инструкции, как обрабатывать противоречивую информацию. Также оказалось, что модели лучше справляются, когда им разрешено «думать вслух» — генерировать цепочку рассуждений перед поиском. Это согласуется с известным эффектом Chain-of-Thought.
Кого затронет и как: разработчики, бизнес и пользователи
Для разработчиков RAG-систем результаты этих экспериментов — практическое руководство. Если вы строите систему, которая должна отвечать на сложные вопросы, например, в корпоративном поиске или в ассистентах поддержки, вам стоит рассмотреть агентный подход. Однако нужно быть готовым к увеличению задержек и затрат на вычисления. Для бизнеса это означает, что внедрение агентного RAG может быть оправдано, если пользователи часто задают многошаговые вопросы, требующие глубокого анализа. Для пользователей это тоже важно: качество ответов в поисковых системах и чат-ботах будет улучшаться. Уже сейчас некоторые продукты, такие как Perplexity и Bing Chat, используют элементы агентного RAG, чтобы давать более полные ответы. В России и СНГ также наблюдается рост интереса к RAG-системам, особенно в банковской сфере и ритейле, где клиенты задают сложные вопросы о продуктах и услугах.
Что будет дальше: прогнозы и направления развития
Автор статьи предполагает, что в ближайшие годы агентный RAG станет стандартом для сложных поисковых задач. Уже сейчас появляются фреймворки, которые упрощают создание таких систем, например, LangChain и LlamaIndex. Дальнейшее развитие будет связано с улучшением планировщиков, которые смогут более эффективно разбивать задачи, и с интеграцией мультимодальных данных — текста, изображений и видео. Однако остаются и вызовы: агентный RAG требует больше вычислительных ресурсов, а также может быть менее предсказуемым, чем классический RAG. Поэтому в ближайшее время мы увидим гибридные подходы, которые будут выбирать стратегию в зависимости от сложности вопроса. Также важно, что бенчмарк TRuST будет развиваться, включая все более сложные сценарии, что подстегнет индустрию к новым решениям.
Итог
Агентный RAG — это не просто модный тренд, а необходимый шаг для создания систем, которые действительно понимают сложные запросы. Эксперименты на бенчмарке TRuST показывают, что правильно спроектированный агентный RAG может значительно повысить точность ответов на многошаговые вопросы. Если вы работаете с RAG, стоит обратить внимание на эту архитектуру и начать тестировать её на своих задачах. А если вы просто интересуетесь ИИ, следите за развитием этого направления — оно будет определять, как мы будем искать информацию в будущем.