Как Яндекс с помощью LLM описал 15 000 таблиц за полгода вместо 500 вручную
Годы идут, но кое-что остаётся неизменным: писать документацию никто не любит, но все ругают тех, кто её не пишет. В Яндексе одних только таблиц с данными — десятки миллионов, общим объёмом в экзабайты. Даже если оставить только самое востребованное, остаются десятки тысяч таблиц, которые нужно опис

Годы идут, но кое-что остаётся неизменным: писать документацию никто не любит, но все ругают тех, кто её не пишет. В Яндексе одних только таблиц с данными — десятки миллионов, общим объёмом в экзабайты. Даже если оставить только самое востребованное, остаются десятки тысяч таблиц, которые нужно описать: что внутри, откуда взялось, можно ли доверять. Без описаний аналитик не находит данные через поиск, не понимает, что лежит в таблице, и заново собирает то, что уже собрал коллега. Страдает не только человек: ИИ-агенты, которые всё чаще решают аналитические задачи, на неописанных данных теряют в качестве — чем меньше известно о таблице, тем хуже результат.
Как LLM помогла Яндексу описать 15 000 таблиц за полгода
Роман Гриднев, технический менеджер в Яндексе, рассказал, как компания решила проблему. Год они уговаривали людей описывать таблицы вручную — и собрали описания всего на 500 таблиц из 40 тысяч. Если бы описывали все данные с такой скоростью (учитывая, что постоянно появляются новые), процесс мог бы растянуться на десятки лет. Тогда команда подключила к задаче LLM (большую языковую модель) и дала людям вместо чистого листа черновик: пусть с ошибками, но не пустую страницу, которая пугает. За полгода так описали 15 тысяч таблиц и сэкономили около пяти лет рабочего времени аналитиков. Со временем качество черновиков от LLM доросло до почти полного соответствия описаниям, сделанным людьми.
Почему ручное описание таблиц — это проблема
Проблема документации данных не нова. В крупных компаниях с огромными хранилищами данных (data lakes) таблицы часто остаются неописанными, что приводит к дублированию работы и снижению эффективности аналитиков. В Яндексе, где таблиц миллионы, ручное описание — непозволительная роскошь. Раньше пытались мотивировать команды писать документацию, но безуспешно: люди не любят эту работу, она кажется рутинной и отвлекает от основных задач. Использование LLM для автоматизации — логичный шаг, который уже применяется в других областях, например, для генерации кода или описания API. Однако для таблиц с данными такой подход требует осторожности: модель может ошибаться, а ошибки в описании данных критичны.
Как LLM генерирует описания таблиц?
Система использует LLM для создания черновика описания на основе метаданных таблицы: названия колонок, типов данных, статистик (например, количество уникальных значений, доля NULL). Модель также может анализировать образцы данных и историю запросов к таблице. Черновик затем проверяет человек — владелец или аналитик, который знаком с данными. Он может исправить неточности и добавить контекст. Такой подход снижает порог входа: вместо того чтобы писать с нуля, человек редактирует готовый текст, что занимает в разы меньше времени. По словам Гриднева, качество черновиков быстро улучшалось: модель училась на исправлениях и со временем стала выдавать описания, почти неотличимые от ручных.
Технические подробности: обучение и оценка качества
Для генерации описаний использовалась внутренняя LLM Яндекса — YandexGPT, адаптированная под задачу. Модель дообучали на исторических данных: парах «таблица — ручное описание», накопленных за год (те самые 500 таблиц). Также применяли few-shot промптинг и RAG (retrieval-augmented generation), чтобы модель могла обращаться к справочной информации. Качество оценивали с помощью метрик BLEU и ROUGE, а также через A/B-тесты: аналитики сравнивали описания от LLM и от людей, не зная источника. В 85% случаев описания от LLM признавались не хуже человеческих. Оставшиеся 15% требовали доработки, но черновик всё равно экономил время.
Кому это выгодно и как внедрить
Решение Яндекса в первую очередь влияет на аналитиков данных: теперь они тратят меньше времени на поиск и понимание таблиц, а также на написание документации. Вместо часов на описание — минуты на правку черновика. Это ускоряет аналитические процессы и снижает количество ошибок из-за неверной интерпретации данных. Для бизнеса это означает более быстрые инсайты и сокращение дублирования работы. В российском контексте особенно важно, что решение построено на отечественной LLM (YandexGPT), что снижает зависимость от зарубежных моделей. Другие компании с большими данными — банки, ритейлеры, телеком-операторы — могут взять подход на вооружение.
Планы на будущее: масштабирование и автоматизация
Яндекс планирует масштабировать решение на все таблицы в хранилище данных. По оценкам, для полного покрытия потребуется ещё около года. Также команда работает над автоматической верификацией описаний: чтобы LLM могла проверять свои же черновики, сверяясь с данными. В перспективе — интеграция с поиском по данным, чтобы аналитики и ИИ-агенты могли сразу видеть качественные описания. Возможно, подход распространят на другие виды документации, например, на описание API или бизнес-процессов.
Итог
Яндекс показал, что LLM может не только писать код и тексты, но и эффективно описывать данные, экономя тысячи часов рабочего времени. Ключевой вывод: не нужно заставлять людей делать то, что они не любят, — лучше дать им инструмент, который превращает рутину в правку черновика. Следить за этой темой стоит всем, кто работает с большими данными: возможно, скоро ручное описание таблиц уйдёт в прошлое.