Персональная wiki без Claude Code: собираем LLM-wiki на Ollama и GPT
Создание персональной wiki с помощью языковых моделей — это не просто модный тренд, а практичный способ превратить хаотичные заметки в структурированную базу знаний. Идея, популяризированная Андреем Карпати, бывшим директором по ИИ в Tesla, заключается в том, чтобы каждый факт из ваших документов бы

Создание персональной wiki с помощью языковых моделей — это не просто модный тренд, а практичный способ превратить хаотичные заметки в структурированную базу знаний. Идея, популяризированная Андреем Карпати, бывшим директором по ИИ в Tesla, заключается в том, чтобы каждый факт из ваших документов был связан с источником и другими фактами. Однако большинство готовых рецептов, включая те, что публиковались на Хабре, завязаны на Claude Code — инструменте от Anthropic, который требует подписки и доступен не всем. Хорошая новость: собрать такую wiki можно и без него, используя локальные модели через Ollama или API GPT. В этой статье мы разберём, как это сделать, какие подводные камни вас ждут и насколько результат будет хуже, чем с Claude Code.
Как собрать персональную wiki на Ollama или GPT-моделях
Процесс сборки персональной wiki можно разбить на несколько логических шагов. В оригинальной идее Карпати ключевую роль играет агент, который анализирует документы, извлекает факты и связывает их между собой. Без Claude Code эту работу можно поручить любой достаточно сильной языковой модели, доступной через API или локально. Первым делом нужно подготовить корпус документов — это могут быть ваши заметки, статьи, переписка или даже целые книги. Затем модель обрабатывает каждый документ, выделяя ключевые утверждения и факты. Для каждого факта модель генерирует краткое описание, связывает его с источником и добавляет в общую базу. В простейшем случае это может быть JSON-файл или SQLite-база, где каждый факт хранится вместе с метаданными.
Второй шаг — построение связей. Модель должна определить, какие факты связаны между собой, и создать гиперссылки. Это можно сделать автоматически, попросив модель сгенерировать список связанных понятий для каждого факта. В зависимости от объёма корпуса, этот этап может занять от нескольких минут до нескольких часов. Третий шаг — создание интерфейса для просмотра wiki. Здесь можно использовать готовые решения, например, Obsidian или стандартный HTML, который генерирует модель. Главное — чтобы была возможность переходить по ссылкам и видеть источники. В статье на Хабре автор предлагает конкретный алгоритм, который использует Ollama для локального запуска моделей, таких как Llama 3 или Mistral. Это позволяет полностью исключить зависимость от облачных сервисов и сохранить конфиденциальность данных. Если же хочется получить более качественный результат, можно использовать GPT-4 или другие коммерческие модели через API — они лучше справляются с извлечением сложных связей.
Предыстория и контекст
Идея LLM-wiki возникла не на пустом месте. Андрей Карпати в своих выступлениях и постах неоднократно подчёркивал, что современные языковые модели могут быть использованы не только для генерации текста, но и для организации знаний. В 2024 году он опубликовал пост, где описал свой эксперимент по созданию персональной wiki из своих заметок. Пост вызвал большой резонанс, и многие разработчики начали пробовать воспроизвести этот подход. На Хабре появилось несколько статей, где авторы делились опытом. Одна из них сравнивала LLM-wiki с традиционными RAG-системами, и выяснилось, что LLM-wiki лучше справляется с установлением связей между фактами, но требует больше вычислительных ресурсов. Другие авторы предлагали использовать различные инструменты, такие как LangChain или автономные агенты.
Однако большинство решений было завязано на Claude Code — инструменте от Anthropic, который позволяет автоматизировать работу с кодом и документами. Claude Code имеет удобный интерфейс и интеграции, но требует подписки и не всегда доступен в некоторых регионах. Это ограничивает распространение идеи. Поэтому неудивительно, что многие ищут альтернативы, которые можно развернуть на собственном оборудовании или через доступные API.
Чем отличается подход без Claude Code?
Главное отличие — в используемых инструментах и моделях. Claude Code предоставляет готовую среду для запуска агентов, которые могут выполнять сложные задачи. Без него приходится самостоятельно писать скрипты и использовать API моделей. Это требует больше программирования, но даёт гибкость. Например, с помощью Ollama можно запустить модель локально и обрабатывать документы без интернета. Это особенно важно для тех, кто работает с конфиденциальными данными. С другой стороны, GPT-4 и другие коммерческие модели обычно дают более качественные результаты при извлечении фактов, но стоят денег и требуют передачи данных на серверы.
Качество получаемой wiki зависит от выбранной модели. Локальные модели, такие как Llama 3, пока уступают GPT-4 в понимании сложных контекстов, но для большинства задач их достаточно. Автор статьи на Хабре провёл сравнение и обнаружил, что разница в качестве невелика, если правильно настроить промпты и постобработку. Например, можно использовать итеративный подход: сначала модель извлекает факты, затем вы вручную корректируете спорные моменты, а потом запускаете повторную обработку для уточнения связей.
Технические детали: как устроен процесс извлечения фактов
Основная техническая сложность — заставить модель извлекать факты в структурированном виде. Для этого используются специальные промпты, которые требуют от модели выдавать JSON с полями: fact, source, tags, relatedterms. Например, промпт может выглядеть так: «Извлеки все утверждения из следующего текста. Для каждого утверждения укажи его суть, источник и связанные термины». Модель возвращает массив JSON, который потом сохраняется в базу. Важно дать модели чёткие инструкции и примеры, чтобы она понимала, что считать фактом, а что — мнением или оценочным суждением.
Для связывания фактов используется подход, основанный на векторном поиске. Каждый факт превращается в эмбеддинг, и затем находятся ближайшие по смыслу факты. Это позволяет автоматически создавать перекрёстные ссылки. В качестве векторной базы можно использовать Chroma или FAISS. При использовании Ollama можно также применять встроенные эмбеддинги моделей. Один из ключевых моментов — дедупликация. Модель может извлечь один и тот же факт из разных документов в разной формулировке. Чтобы избежать дубликатов, нужно сравнивать семантическую близость и объединять похожие записи. Это можно сделать с помощью порога косинусной близости.
Также важно учитывать, что модели могут галлюцинировать, то есть выдумывать факты, которых нет в источнике. Чтобы минимизировать это, нужно строго контролировать, чтобы каждый факт был подтверждён цитатой из текста. Если модель не может найти подтверждение, лучше отбрасывать такой факт. Для этого можно добавить в промпт требование обязательно цитировать исходный фрагмент, а затем проверять, что цитата действительно присутствует в документе.
Кого затронет и как
Эта тема интересна в первую очередь разработчикам, исследователям и всем, кто работает с большим объёмом текстов. Журналисты, аналитики, студенты — все они могут использовать персональную wiki для систематизации знаний. Особенно актуально это для тех, кто ведёт личные заметки в Markdown и хочет превратить их в связанный гипертекст. В России и СНГ доступ к Claude Code может быть ограничен, поэтому использование Ollama или GPT-моделей через API — хорошая альтернатива. Локальные модели позволяют работать без интернета и не зависеть от санкционных ограничений. Это делает технологию доступной для широкого круга пользователей.
Для бизнеса персональная wiki может стать основой для корпоративной базы знаний, где каждый сотрудник может создавать свои заметки и связывать их с общими документами. Это улучшает обмен знаниями и ускоряет поиск информации. Например, отдел поддержки может вести базу типовых решений, а разработчики — документировать архитектурные решения. Всё это можно автоматизировать с помощью LLM, снижая ручной труд.
Что будет дальше
Скорее всего, идея LLM-wiki будет развиваться. Уже сейчас появляются инструменты, которые упрощают создание таких систем, например, Obsidian с плагинами на основе ИИ. В будущем можно ожидать появления готовых решений, которые будут работать из коробки. Что касается моделей, то локальные модели будут улучшаться, и разрыв с коммерческими будет сокращаться. Возможно, появятся специализированные модели, обученные именно на задаче извлечения фактов и построения графов знаний.
Пока же, если у вас есть хотя бы базовые навыки программирования, вы можете собрать свою персональную wiki за несколько часов. Это отличный способ попробовать новые технологии и организовать свои знания. Не бойтесь экспериментировать: начните с небольшого корпуса документов, настройте промпты, и вы увидите, как ваши заметки превращаются в живой гипертекст.
Итог
Персональная wiki без Claude Code — это вполне реально. Используя Ollama или GPT-модели, можно создать полноценную систему управления знаниями, которая не уступает оригинальной идее Карпати. Главное — правильно настроить процесс извлечения фактов и связей. Попробуйте, и вы увидите, как ваши заметки превратятся в структурированную базу знаний, где каждый факт имеет источник и связан с другими. Это не только удобно, но и увлекательно — вы словно строите собственный мозг, который помнит всё.