Как VK Дзен интегрировал LLM в А/Б-тесты: от сломанного BI до ИИ-аналитика
А/Б-тестирование остается одним из главных инструментов для принятия решений в цифровых продуктах. Однако по мере роста числа экспериментов и метрик анализ результатов становится все более сложным. Команда технической аналитики VK Дзен столкнулась с тем, что стандартные BI-решения перестали справлят

А/Б-тестирование остается одним из главных инструментов для принятия решений в цифровых продуктах. Однако по мере роста числа экспериментов и метрик анализ результатов становится все более сложным. Команда технической аналитики VK Дзен столкнулась с тем, что стандартные BI-решения перестали справляться с нагрузкой, и создала собственный инструмент, который не только автоматизирует расчеты, но и подключает LLM для генерации выводов на естественном языке. Это позволило сократить время на интерпретацию данных и повысить скорость принятия решений.
Как LLM помогла решить проблему сломанного BI
В VK Дзен ежедневно запускается множество А/Б-тестов, каждый из которых генерирует десятки метрик. Стандартные BI-системы, такие как Tableau или Power BI, не были рассчитаны на такой объем и частоту обновлений. Они начинали тормозить, а аналитикам приходилось ждать минуты, а то и часы, чтобы получить актуальные данные. Это замедляло принятие решений и снижало эффективность экспериментов.
Команда Михаила Рязанского, руководителя группы технической аналитики, и Марка Хабарова, лида команды ML-аналитики, решила пойти другим путем. Они разработали собственный инструмент на основе ClickHouse и Python, который агрегирует данные в реальном времени. Но главной особенностью стала интеграция LLM — большой языковой модели, которая анализирует результаты и формирует текстовые отчеты.
Почему традиционные BI-системы не справляются с нагрузкой?
Проблема с BI-системами не нова. Многие компании сталкиваются с тем, что традиционные дашборды не успевают за ростом данных. В Дзене эта проблема усугублялась спецификой платформы: огромное количество пользовательских сессий, множество метрик и постоянные эксперименты с алгоритмами рекомендаций. Ранее аналитики тратили до 40% времени на ручную интерпретацию результатов тестов. Им приходилось смотреть на графики, сравнивать p-value и самостоятельно формулировать выводы. LLM позволила автоматизировать этот процесс: модель анализирует статистические показатели и выдает готовые заключения, например, «метрика X значимо выросла на Y% с вероятностью Z%».
Как работает интеграция LLM в А/Б-тесты?
Система построена следующим образом: данные из ClickHouse поступают в Python-скрипт, который рассчитывает стандартные метрики А/Б-тестов — p-value, доверительные интервалы, lift. Затем эти числовые данные передаются в LLM (используется модель от VK, но авторы не уточняют какая именно), которая преобразует их в связный текст. Промпт для модели содержит не только цифры, но и контекст: название эксперимента, цель, проверяемая гипотеза. LLM генерирует отчет, в котором объясняет, какие метрики изменились, насколько и стоит ли принимать решение на основе этих данных. Важно, что модель не принимает решения сама — она только помогает аналитику быстрее увидеть картину.
Какие технические решения лежат в основе системы?
Система использует ClickHouse для хранения и агрегации данных — это позволяет обрабатывать миллионы событий в секунду. Python служит связующим звеном: он запрашивает данные, выполняет статистические тесты и отправляет результаты в LLM. Для визуализации используется HTML-отчет, который генерируется автоматически и включает как графики (через Plotly), так и текстовый блок от LLM. Одна из сложностей, с которой столкнулась команда, — это стабильность генерации. LLM может выдавать разные формулировки даже на одинаковых данных, что недопустимо для отчетов. Поэтому были добавлены правила постобработки: модель должна строго следовать шаблону, а все числовые значения проверяются на корректность перед выводом.
Кого затронет и как
Разработка в первую очередь полезна самим аналитикам Дзена — они теперь тратят меньше времени на рутину. Но косвенно выигрывают и все пользователи платформы: быстрее принимаются решения о внедрении улучшений, что влияет на качество рекомендаций. Для российского рынка это важный кейс: он показывает, что даже без западных BI-инструментов можно построить эффективную аналитику. Другие компании, особенно в сфере медиа и e-commerce, могут взять этот опыт на заметку.
Что будет дальше
Команда планирует расширять функциональность: добавлять поддержку мультиварных тестов, интегрировать более сложные статистические методы и улучшать качество генерации отчетов. Также рассматривается возможность открыть часть инструмента как open-source — это может привлечь сообщество и ускорить развитие. В долгосрочной перспективе LLM может не только описывать результаты, но и предлагать следующие шаги: например, рекомендовать, какой эксперимент запустить следующим или какие метрики стоит проверить дополнительно.
Итог
Интеграция LLM в анализ А/Б-тестов — это не просто хайп, а реальный инструмент, повышающий эффективность работы с данными. VK Дзен показал, как можно решить проблему «сломанного BI» с помощью собственных разработок и языковых моделей. Этот кейс — пример того, что даже в сложной инфраструктуре можно найти простое и элегантное решение, если подойти к задаче творчески.