ИИ собирает книгу под ваш вопрос: новый подход к работе с информацией
Представьте, что вам больше не нужно искать нужную книгу — её можно собрать под собственный вопрос. Именно эту идею проверил автор технической статьи на Хабре, построив конвейер обработки информации на основе искусственного интеллекта. Вместо сотен кратких пересказов он создал систему, которая выдел

Представьте, что вам больше не нужно искать нужную книгу — её можно собрать под собственный вопрос. Именно эту идею проверил автор технической статьи на Хабре, построив конвейер обработки информации на основе искусственного интеллекта. Вместо сотен кратких пересказов он создал систему, которая выделяет ключевые сущности, схлопывает смысловые дубли, отслеживает происхождение выводов и проверяет важные утверждения. Эксперимент показал: единицей работы с информацией может становиться не источник, а наш вопрос.
Этот подход меняет саму парадигму: вместо того чтобы просматривать горы материалов, вы получаете структурированное знание, собранное специально под ваш запрос. Система не просто находит релевантные фрагменты, но и выстраивает их в связную картину, исключая повторы и подтверждая факты ссылками на первоисточники. В этой статье мы разберём, как устроен такой конвейер, чем он отличается от традиционных методов поиска и какие перспективы открывает для исследователей, аналитиков и обычных пользователей.
Как ИИ собирает книгу под конкретный вопрос
Автор использовал реальный корпус данных: 206 длинных видео общей продолжительностью 160 часов 56 минут, что соответствует 2,15 млн слов транскриптов. Вместо того чтобы генерировать сотни отдельных саммари для каждого видео, он построил конвейер, который работает на уровне всей совокупности материалов. Система выделяет сущности — имена, термины, концепции — и связывает их с фрагментами текста. Затем происходит схлопывание дублей: разные видео могут рассказывать об одном и том же разными словами, и алгоритм должен это распознать. Важно, что векторная кластеризация, популярный подход для поиска похожих текстов, не справилась с задачей смысловых дублей — она находит лексические совпадения, но не всегда улавливает семантическую эквивалентность.
Ключевая особенность конвейера — отслеживание происхождения выводов. Каждое утверждение в итоговом материале можно проследить до конкретного источника, что критически важно для проверки фактов. Система также понимает, когда оставшиеся источники уже не нужно читать подряд: если информация исчерпана, дальнейшее изучение становится избыточным. Это позволяет экономить время и силы, сосредотачиваясь только на новых данных.
Предыстория и контекст
Традиционный подход к работе с большими объемами информации — RAG (Retrieval-Augmented Generation), когда по запросу из базы извлекаются релевантные фрагменты и подаются в языковую модель для ответа. Однако RAG работает с отдельными кусками текста, не учитывая целостную картину. Новый подход, описанный автором, пытается преодолеть это ограничение, строя связную структуру знаний из всего корпуса. Вместо того чтобы каждый раз искать ответ, система заранее обрабатывает материалы, создавая базу знаний, которую можно многократно использовать.
Проблема дублей особенно актуальна в видео-лекциях и подкастах, где авторы часто повторяют одни и те же идеи в разных формулировках. Векторные базы данных, используемые в RAG, могут возвращать десятки похожих фрагментов, которые на самом деле говорят об одном и том же. Это засоряет контекст и снижает качество ответов. Конвейер решает эту проблему на уровне смысла, а не только лексики, что делает результаты более точными и полезными.
Интересно, что в ходе разработки автор заметил: длинная работа ИИ-агента неожиданно начинает напоминать разработку обычной программной системы. Появляются требования к отладке, тестированию, управлению версиями — те же проблемы, с которыми сталкиваются программисты, только в контексте обработки знаний. Это наблюдение открывает новые горизонты для инженерии ИИ-агентов.
Чем этот подход отличается от RAG?
RAG — это поиск и подстановка: вы задаете вопрос, система находит релевантные фрагменты и на их основе генерирует ответ. Новый подход — это построение модели знаний: система сначала обрабатывает весь корпус, выделяя сущности и связи, а затем отвечает на вопросы, опираясь на эту структуру. Разница в том, что RAG работает «на лету», а конвейер создает предварительную базу знаний, которую можно использовать многократно. Это похоже на разницу между поиском в библиотеке и написанием энциклопедии: первый даёт отдельные статьи, вторая — связное изложение.
Кроме того, новый подход решает проблему дублей на уровне смысла, а не только лексики. Векторная кластеризация группирует тексты по близости эмбеддингов, но если одно и то же утверждение выражено разными словами, эмбеддинги могут сильно отличаться. Автор использовал более сложные методы, включая выделение сущностей и анализ происхождения выводов, что позволяет точнее определять семантические дубли. Это особенно важно при работе с большими корпусами, где повторения неизбежны.
Как это работает на практике?
На практическом уровне конвейер включает несколько этапов. Сначала транскрипты видео обрабатываются для выделения сущностей — это могут быть имена людей, названия технологий, ключевые термины. Затем эти сущности связываются с фрагментами текста, создавая сеть связей. Дубли выявляются не по совпадению строк, а по совпадению сущностей и контекста их использования. Проверка фактов осуществляется путем сопоставления утверждений с источниками, откуда они взяты. Такой подход позволяет не только отвечать на вопросы, но и показывать, откуда взята информация, что повышает доверие к результатам.
В эксперименте автор смог собрать «книгу» по интересующей теме, где каждый раздел был подкреплен ссылками на конкретные видео, и при этом исключить повторяющиеся фрагменты. Это значит, что вместо сотен часов просмотра вы получаете компактный и структурированный материал, который можно изучать как обычную книгу. Причём каждый тезис можно проверить, перейдя к первоисточнику.
Технические подробности конвейера
Конвейер состоит из нескольких модулей. Модуль выделения сущностей использует языковую модель для извлечения именованных сущностей и терминов. Модуль кластеризации группирует фрагменты по смыслу, но вместо простых векторных эмбеддингов применяет комбинацию методов: учитываются и лексические совпадения, и семантическая близость, и общие сущности. Модуль проверки фактов сверяет утверждения с исходными текстами, используя технику, похожую на RAG, но на уровне всей структуры.
Одна из проблем, с которой столкнулся автор, — это когда 9 URL могут оказаться одним источником. Например, одно и то же видео может быть выложено на разных платформах или в разных плейлистах. Конвейер должен уметь распознавать такие дубли на уровне URL и контента, чтобы не учитывать один источник многократно. Это требует не только технических решений, но и внимательного анализа метаданных.
Векторная кластеризация не решила задачу смысловых дублей, потому что она работает с числовыми представлениями текста, которые не всегда отражают смысл. Автор применил более тонкие методы, включая использование графов сущностей и анализ контекста, что позволило добиться лучших результатов. Например, если в одном видео говорится «нейросети», а в другом — «искусственный интеллект», система должна понять, что это может быть одно и то же, в зависимости от контекста.
Почему длинная работа ИИ-агента напоминает разработку ПО?
Когда ИИ-агент работает длительное время, он сталкивается с накоплением ошибок, необходимостью отслеживать состояние, управлять ресурсами. Это похоже на разработку программной системы: нужно тестировать отдельные модули, отлаживать взаимодействие, поддерживать документацию. Автор отметил, что в процессе создания конвейера ему пришлось применять принципы инженерии ПО, такие как модульность, тестирование и контроль версий. Это наблюдение важно для будущего ИИ-агентов: по мере усложнения задач им потребуются инструменты, аналогичные тем, что используют разработчики, — системы логирования, трассировки, анализа ошибок. Без этого длительная работа агента становится неуправляемой.
Кого затронет и как
Новый подход к работе с информацией может изменить привычки исследователей, аналитиков, журналистов и всех, кто работает с большими объемами контента. Вместо чтения десятков статей или просмотра часов видео можно будет получить структурированную «книгу» по конкретному вопросу, с проверенными фактами и ссылками на источники. Это экономит время и повышает качество анализа.
Для разработчиков это означает новые возможности для создания интеллектуальных систем поиска и анализа. Для бизнеса — ускорение процессов сбора и обработки информации, что особенно актуально в конкурентной среде. Для обычных пользователей — возможность получать ответы на сложные вопросы без необходимости самостоятельно изучать горы материалов. В русскоязычном сегменте такие инструменты только начинают появляться, и есть потенциал для локальных решений, учитывающих особенности русского языка. Автор эксперимента использовал русскоязычный корпус, что делает результаты применимыми к нашему контексту.
Что будет дальше
Автор планирует развивать конвейер, улучшая методы выделения сущностей и проверки фактов. Возможно, появятся готовые продукты, которые позволят любому пользователю загрузить свои материалы и получить «книгу» под свой вопрос. В долгосрочной перспективе такие системы могут стать основой для персональных ИИ-ассистентов, которые не просто ищут информацию, а собирают её в удобные структуры. Ожидается, что развитие этой области приведет к появлению новых стандартов в обработке информации, где ключевым станет не количество источников, а качество ответа на конкретный вопрос.
Это может изменить подходы к образованию, исследованиям и даже к чтению книг — возможно, в будущем мы будем не читать, а «собирать» знания под свои нужды. Уже сейчас можно представить, как студент загружает лекции и учебники, а ИИ собирает из них персонализированный конспект. Или как аналитик получает сводку по рынку, где каждый факт подтверждён ссылкой на первоисточник. Такие сценарии становятся реальностью благодаря описанному конвейеру.
Итог
Эксперимент показал, что ИИ может радикально изменить способ работы с информацией, превращая хаос источников в упорядоченное знание. Вместо того чтобы тонуть в море данных, мы можем задать вопрос и получить книгу, написанную специально для нас. Этот подход открывает новые возможности для обучения, исследований и принятия решений, делая информацию более доступной и проверяемой.