PolyUQuest: структурированный RAG для веб-страниц на основе гетерогенных графов

Представьте, что вы ищете ответ на сложный вопрос на большом корпоративном сайте. Обычные поисковые системы и RAG-решения часто возвращают разрозненные фрагменты текста, теряя контекст и связи между разделами. Исследователи из Гонконгского политехнического университета (PolyU) создали PolyUQuest — ф

PolyUQuest: структурированный RAG для веб-страниц на основе гетерогенных графов

Представьте, что вы ищете ответ на сложный вопрос на большом корпоративном сайте. Обычные поисковые системы и RAG-решения часто возвращают разрозненные фрагменты текста, теряя контекст и связи между разделами. Исследователи из Гонконгского политехнического университета (PolyU) создали PolyUQuest — фреймворк, который использует гетерогенные графы для извлечения информации из веб-страниц. Этот подход учитывает не только текст, но и структуру HTML-документов, гиперссылки и семантические связи между сущностями, что позволяет получать точные и проверяемые ответы.

Как работает PolyUQuest

Традиционные системы retrieval-augmented generation (RAG) преобразуют веб-страницы в плоский текст, теряя при этом важные структурные сигналы. PolyUQuest решает эту проблему, строя гетерогенный граф, который объединяет три типа связей: топологию гиперссылок между страницами, иерархию DOM-элементов внутри страницы и знания о сущностях — людях, местах, датах, организациях — и их взаимосвязях. Такой граф позволяет системе понимать, что, например, раздел "История" на странице университета связан с конкретными датами и событиями, а ссылка "Контакты" ведёт к странице с формой обратной связи.

Процесс начинается с парсинга HTML-страниц и извлечения DOM-дерева. Каждый значимый блок (заголовок, абзац, список, таблица) становится узлом графа. Затем добавляются рёбра между блоками внутри одной страницы (родитель-потомок, соседние блоки) и между страницами через гиперссылки. Дополнительно с помощью NLP-моделей извлекаются сущности и их отношения (например, "PolyU основан в 1937 году" создаёт связь между сущностями "PolyU" и "1937").

Почему это важно для точности ответов

Современные RAG-системы часто дают поверхностные ответы, потому что не учитывают структуру документа. Например, на вопрос "Какие факультеты есть в PolyU и кто их деканы?" обычный RAG может вернуть список факультетов из одного раздела и имена деканов из другого, не связывая их. PolyUQuest, используя граф, точно находит соответствующие блоки и устанавливает правильные пары "факультет — декан". Каждый ответ сопровождается ссылками на исходные блоки, заголовки и сущности, что повышает доверие к результатам и позволяет пользователю проверить информацию.

Система использует двухуровневый маршрутизатор, который анализирует запрос и выбирает один из трёх режимов обработки. Первый режим — прямой поиск по блокам — подходит для простых вопросов, ответ на которые содержится в одном блоке текста. Второй режим — обход графа между страницами — активируется, когда ответ требует информации с нескольких страниц, связанных гиперссылками. Третий режим — многопереходный поиск по связям сущностей — используется для сложных вопросов, требующих понимания цепочек отношений, например: "Какие исследования проводились профессором Смитом после 2020 года?"

Какие результаты показал PolyUQuest

Фреймворк протестирован на официальном сайте PolyU, который включает 4 240 страниц, 31 086 DOM-блоков, 29 119 сущностей и 37 680 связей. В экспериментах PolyUQuest превзошёл существующие RAG-решения по правильности, полноте и точности ответов. При этом система потребляла значительно меньше токенов LLM на запрос — в среднем на 40% меньше, чем традиционные методы, благодаря эффективной маршрутизации и использованию графа для отбора релевантных блоков.

Кого затронет эта технология

Разработчиков RAG-систем, исследователей в области обработки веб-данных, а также университеты и организации, создающие вопросно-ответные сервисы на основе корпоративных сайтов. PolyUQuest уже готовится к развёртыванию как сервис для студентов PolyU, помогая им быстро находить информацию о курсах, расписании, профессорах и исследованиях. В перспективе технология может быть адаптирована для любых крупных веб-сайтов с чёткой структурой.

Какие ограничения и нерешённые вопросы остаются

Пока неизвестны детали тестирования на других наборах данных — например, на сайтах с менее строгой структурой или на разных языках. Также нет информации о планах по открытию исходного кода или API. Неясно, насколько легко адаптировать систему к сайтам с динамическим контентом или сложной вёрсткой. Кроме того, построение гетерогенного графа требует значительных вычислительных ресурсов на этапе индексации, хотя при запросах система экономит токены.

Что такое гетерогенный граф в контексте RAG

Гетерогенный граф — это граф, в котором узлы и рёбра могут быть разных типов. В PolyUQuest узлы бывают трёх видов: страницы, DOM-блоки и сущности. Рёбра также разнородны: ссылки между страницами, иерархические связи внутри DOM, семантические отношения между сущностями. Такая структура позволяет моделировать сложные взаимосвязи, которые невозможно передать плоским текстом или однородным графом. Например, сущность "Лазерная физика" может быть связана и с блоком текста на странице кафедры, и со страницей исследовательской группы, и с другой сущностью "Профессор Чжан".

Как PolyUQuest сравнивается с другими RAG-системами

Большинство современных RAG-систем, таких как RAPTOR или Self-RAG, используют плоское разбиение текста на чанки или деревья. Они не учитывают ни гиперссылки, ни DOM-иерархию, ни сущности. PolyUQuest выигрывает за счёт интеграции всех этих аспектов. В тестах на сайте PolyU система показала улучшение точности на 15-20% по сравнению с лучшими аналогами, при этом сократив количество токенов на запрос. Это делает её особенно привлекательной для приложений, где важна как точность, так и стоимость вычислений.

Заключение

PolyUQuest — значительный шаг вперёд в области RAG для веб-данных. Используя гетерогенные графы, система сохраняет структурную информацию, которая критична для точных и проверяемых ответов. Несмотря на некоторые нерешённые вопросы, фреймворк демонстрирует впечатляющие результаты и открывает новые возможности для вопросно-ответных систем на основе корпоративных сайтов. Разработчикам и исследователям стоит внимательно следить за развитием этой технологии.