Как в Яндексе описали 15 000 таблиц с помощью LLM вместо ручной документации
Документирование данных — головная боль любой крупной компании, работающей с большими объёмами информации. В Яндексе, где число таблиц исчисляется десятками миллионов, а общий объём данных достигает экзабайтов, ручное описание каждой таблицы стало непосильной задачей. Без качественной документации а

Документирование данных — головная боль любой крупной компании, работающей с большими объёмами информации. В Яндексе, где число таблиц исчисляется десятками миллионов, а общий объём данных достигает экзабайтов, ручное описание каждой таблицы стало непосильной задачей. Без качественной документации аналитики тратят часы на поиск нужных данных, не понимают, что содержится в таблице, и часто дублируют работу коллег. Проблема усугубляется тем, что ИИ-агенты, которые всё активнее используются для аналитики, на неописанных данных работают хуже. В этой статье мы расскажем, как команда Яндекса решила проблему с помощью языковых моделей и за полгода описала 15 тысяч таблиц, сэкономив около пяти лет рабочего времени.
Как LLM помогла преодолеть кризис ручного документирования
Год в Яндексе уговаривали людей описывать таблицы вручную — и собрали описания всего на 500 таблиц из 40 тысяч. Если бы процесс продолжался в том же темпе, с учётом появления новых таблиц, он мог бы растянуться на десятилетия. Технический менеджер Роман Гриднев рассказал, как команда решила подключить к задаче LLM: вместо того чтобы заставлять людей писать с нуля, модель генерирует черновик описания, а человек лишь проверяет и правит его. Такой подход снял психологический барьер «чистого листа» и резко ускорил процесс. За полгода удалось описать 15 тысяч таблиц, а качество черновиков от LLM со временем достигло уровня, почти неотличимого от ручных описаний.
Предыстория и контекст
Проблема документирования данных знакома многим компаниям, работающим с большими объёмами информации. В Яндексе исторически сложилась культура, где аналитики и инженеры тратили значительное время на поиск и понимание данных. Ручное описание таблиц было узким местом: даже при наличии мотивации люди не успевали документировать всё, а новые таблицы появлялись быстрее, чем описывались старые. Попытки автоматизировать процесс с помощью правил и шаблонов не давали нужного качества, так как контекст каждой таблицы уникален. Появление мощных языковых моделей, таких как YandexGPT, открыло новый подход: генерировать черновики описаний автоматически, а человека оставить только для проверки и правки.
Какие метаданные использует LLM для генерации описания?
Система использует LLM для анализа метаданных таблицы: названия столбцов, типов данных, статистик (например, количество уникальных значений, доля NULL), а также связанных объектов и кода, который эти таблицы создаёт. Модель генерирует черновик описания на русском языке, включая назначение таблицы, описание полей, возможные ограничения и рекомендации по использованию. Человек-аналитик проверяет черновик, вносит правки и утверждает. Такой подход снижает порог входа: вместо пустого листа перед специалистом уже структурированный текст, который нужно лишь отредактировать. В результате время на описание одной таблицы сократилось с нескольких часов до 10–15 минут, а качество черновиков со временем достигло уровня, когда правки минимальны.
Технические подробности: как обучали и настраивали LLM
Команда Яндекса использовала дообученную версию YandexGPT на корпусе из нескольких тысяч качественных ручных описаний. Важным этапом была очистка данных: из обучающей выборки удаляли описания, содержащие ошибки или субъективные оценки. Модель училась не просто перечислять столбцы, а давать осмысленный контекст: для чего таблица нужна, какие данные в ней хранятся, как часто обновляется, какие ключевые поля. Для оценки качества внедрили метрику, сравнивающую сгенерированные описания с эталонными — как автоматически (по семантическому сходству), так и с помощью краудсорсинга. Система также учитывает обратную связь: если аналитик часто правит определённые части описания, модель адаптируется. В результате за полгода описали 15 тысяч таблиц, а экономия времени составила около пяти лет совокупного труда аналитиков.
Кого затронет и как
Решение Яндекса в первую очередь повлияет на внутренних аналитиков и инженеров данных: теперь они быстрее находят нужные таблицы, меньше тратят времени на изучение структуры и реже дублируют работу. Для бизнеса это означает ускорение аналитических отчётов и дашбордов. В более широком смысле, подход может быть адаптирован другими компаниями, работающими с большими данными — от банков до ритейла. В России и СНГ многие организации сталкиваются с той же проблемой, и опыт Яндекса может стать кейсом для внедрения LLM в документирование. Кроме того, качественные описания улучшают работу ИИ-агентов, которые используют эти данные для принятия решений — например, в автоматизированных системах отчётности.
Что будет дальше
Яндекс планирует масштабировать решение на все 40 тысяч востребованных таблиц, а также внедрить автоматическое обновление описаний при изменении схемы данных. В перспективе — интеграция с поисковыми системами внутри компании, чтобы аналитики могли задавать вопросы на естественном языке и получать ответы сразу с указанием таблиц. Возможно, подход будет распространён и на другие типы артефактов: дашборды, отчёты, модели машинного обучения. Учитывая быстрый прогресс языковых моделей, можно ожидать, что через год-два ручное документирование данных станет исключением, а не правилом.
Итог
Яндекс показал, что LLM могут решать рутинную задачу документирования данных эффективнее людей, экономя годы труда. Главный вывод: не нужно заставлять людей писать документацию вручную — лучше дать им инструмент, который сделает черновик, а человек только проверит. Этот кейс — ещё одно доказательство того, что генеративный ИИ меняет не только творческие профессии, но и инженерные практики.