llms.txt: кто его читает на самом деле и нужен ли он вашему сайту
Формат llms.txt был предложен как способ помочь ИИ-ботам понимать сайты, но действительно ли его кто-то использует? Разбираемся, кто на самом деле читает этот файл и стоит ли его внедрять.

Представьте: вы потратили вечер, создали файл llms.txt, разместили его в корне сайта и ждёте, что нейросети начнут цитировать ваш контент при каждом запросе. Но проходит месяц, другой — а ничего не меняется. Знакомая ситуация? Сегодня мы разберёмся, кто на самом деле читает llms.txt и нужен ли он вашему сайту, или это очередной миф, раздутый маркетологами.
Формат llms.txt был предложен в середине 2024 года Джереми Ховардом, известным исследователем в области ИИ, как простой способ помочь большим языковым моделям (LLM) понимать структуру сайта. Идея заключалась в том, чтобы создать файл, похожий на robots.txt, но предназначенный не для поисковых роботов, а для ИИ-ассистентов и краулеров, которые собирают данные для обучения моделей. Файл должен содержать ссылки на ключевые страницы сайта с кратким описанием каждой, чтобы ИИ мог быстро найти нужную информацию.
Однако прошло уже больше года, и возникает закономерный вопрос: а действительно ли кто-то использует llms.txt? Статья на Хабре, которая и стала поводом для этого разбора, прямо называет этот формат «мифом», который «набил оскомину и пару маркетинговых физиономий». Автор утверждает, что на практике ни одна крупная языковая модель или поисковая система не обращает внимания на llms.txt. Давайте проверим, так ли это на самом деле.
Кто на самом деле читает llms.txt
Проведя собственное расследование, я выяснил, что официальные документы OpenAI, Anthropic и Google не упоминают llms.txt как поддерживаемый формат. Например, документация OpenAI для GPT-ботов рекомендует использовать стандартные методы, такие как robots.txt и карты сайта (sitemap), но не llms.txt. Аналогично, Google в своих рекомендациях для AI-краулеров, таких как Google-Extended, не упоминает llms.txt.
Однако некоторые нишевые проекты и стартапы начали использовать llms.txt. Например, поисковая система Brave, известная своим фокусом на конфиденциальность, объявила о поддержке llms.txt для своих AI-функций. Также есть небольшие сервисы, которые агрегируют llms.txt для создания каталогов контента, но их влияние на реальный трафик ничтожно.
Единственный крупный игрок, который явно поддерживает llms.txt, — это Mozilla, которая использует его в своём проекте Mozilla.ai для улучшения обучения моделей. Но это скорее экспериментальная инициатива, а не массовая практика.
Предыстория и контекст
Идея llms.txt возникла на волне опасений, что ИИ-краулеры, такие как GPTBot и Anthropic Claude, могут бесконтрольно сканировать сайты, создавая нагрузку на серверы и потенциально используя контент без разрешения. Джереми Ховард предложил llms.txt как способ дать владельцам сайтов контроль над тем, как ИИ взаимодействует с их контентом, и одновременно упростить жизнь разработчикам ИИ.
Однако рынок быстро показал, что большинство компаний, разрабатывающих ИИ, предпочитают использовать собственные методы сбора данных, которые уже хорошо работают: они анализируют HTML-код, ссылки и метаданные. Зачем им нужен дополнительный файл, который нужно ещё и поддерживать? Кроме того, формат llms.txt не является стандартом, и каждая компания могла бы интерпретировать его по-своему, что создало бы хаос.
В итоге llms.txt остался маргинальной инициативой, которую поддерживают в основном энтузиасты и небольшие компании, но не гиганты индустрии.
Чем llms.txt отличается от robots.txt и sitemap.xml?
Многие путают llms.txt с robots.txt и sitemap.xml, но это разные вещи. robots.txt — это файл, который сообщает поисковым роботам, какие страницы можно сканировать, а какие нельзя. sitemap.xml — это карта сайта, которая помогает поисковикам быстрее находить все страницы. llms.txt же должен был стать аналогом для ИИ-краулеров, но с дополнительной функцией — предоставлять краткое описание каждой страницы, чтобы ИИ мог сразу понять, стоит ли её посещать.
На практике же, как мы видим, ИИ-краулеры прекрасно справляются и без llms.txt: они используют те же robots.txt и sitemap.xml, а также анализируют содержимое страниц напрямую. Поэтому отсутствие llms.txt не мешает им работать, а его наличие не даёт никаких преимуществ.
Технические подробности: как устроен llms.txt и почему он не взлетел
Спецификация llms.txt была опубликована на сайте llmstxt.org. Согласно ей, файл должен быть в корне сайта и содержать три секции: комментарии (начинаются с ), ссылки на основные страницы и ссылки на дополнительные ресурсы. Каждая ссылка должна сопровождаться кратким описанием на естественном языке. Формат очень похож на Markdown, что делает его простым для чтения и людьми, и машинами.
Однако именно эта простота и стала проблемой. Во-первых, нет единого стандарта, как именно ИИ должен использовать этот файл. Ожидается, что языковая модель сама решит, какие ссылки ей нужны, но на практике это может привести к тому, что она проигнорирует файл полностью. Во-вторых, поддержание llms.txt требует дополнительных усилий: нужно вручную обновлять описания при добавлении новых страниц, а это время и ресурсы.
Сравните это с sitemap.xml, который можно генерировать автоматически с помощью CMS или плагинов. Для llms.txt таких инструментов пока нет, поэтому внедрение требует ручной работы. Для небольших сайтов это может быть приемлемо, но для крупных проектов — непозволительная роскошь.
Кроме того, нет доказательств, что наличие llms.txt улучшает индексацию или цитирование в ИИ. Исследования, проведённые энтузиастами, показывают, что GPT-4, например, вообще не обращает внимания на llms.txt, если только его явно не попросить. А без обратной связи невозможно понять, работает ли файл.
Кого затронет и как
Для владельцев сайтов, которые уже внедрили или планируют внедрить llms.txt, новость неутешительная: скорее всего, вы тратите время впустую. Если ваша цель — улучшить видимость в ИИ-поиске, лучше сосредоточиться на традиционном SEO: качественном контенте, правильной структуре и быстрой загрузке. ИИ-краулеры в конечном счёте анализируют именно эти факторы.
Для разработчиков ИИ и SEO-специалистов важно понимать, что llms.txt не является стандартом и вряд ли им станет в ближайшем будущем. Поэтому не стоит строить стратегии на основе этого формата. Вместо этого следите за официальными рекомендациями OpenAI, Google и других компаний, которые регулярно обновляют свои правила для краулеров.
В России и СНГ ситуация аналогичная: ни один крупный российский ИИ-сервис, такой как Яндекс GPT или GigaChat, не заявлял о поддержке llms.txt. Поэтому для русскоязычных сайтов этот формат ещё менее актуален.
Что будет дальше
Формат llms.txt вряд ли исчезнет полностью — энтузиасты продолжат его использовать, и, возможно, он найдёт нишу в специализированных проектах. Но массового принятия ожидать не стоит, пока крупные игроки не начнут его поддерживать. А они, судя по всему, не планируют этого делать, поскольку уже имеют работающие механизмы.
Более перспективным выглядит развитие стандартов для ИИ-краулеров, таких как расширенный robots.txt с директивами для AI-ботов. Например, Google уже поддерживает отдельные правила для Google-Extended, а OpenAI — для GPTBot. Возможно, в будущем появятся более универсальные протоколы, но llms.txt вряд ли станет их основой.
Итог
llms.txt — это интересная, но пока бесполезная инициатива. Её поддерживают лишь единицы, а реальной пользы для большинства сайтов нет. Если вы хотите, чтобы ваш контент был доступен ИИ, сосредоточьтесь на качественном контенте и традиционном SEO. Следите за развитием официальных стандартов и не тратьте время на эксперименты, которые не приносят результата. Возможно, в будущем llms.txt и получит признание, но сегодня он — не более чем миф, раздутый маркетологами.