VK Research научил рекомендации оптимизировать удовлетворённость за всю сессию

Команда AI VK Research представила на KDD 2026 метод оптимизации рекомендательных систем, который учитывает не отдельный клик, а всю пользовательскую сессию. Разбираем, как работает алгоритм на основе REINFORCE и почему это меняет подход к ранжированию.

VK Research научил рекомендации оптимизировать удовлетворённость за всю сессию

Как заставить рекомендательную систему думать не о следующем клике, а о том, останется ли пользователь доволен через час? Команда AI VK Research из VK предложила решение, которое учитывает долгосрочную удовлетворённость пользователя в рамках всей сессии. Работа была принята на воркшоп End-to-End Customer Journey Optimization конференции KDD 2026 — одной из самых престижных площадок в области машинного обучения.

Статья под названием Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction описывает метод, который позволяет модели рекомендаций оптимизировать не мгновенную реакцию, а суммарную пользу для пользователя за всю сессию взаимодействия. Это важный шаг от классического подхода, где каждый клик рассматривается как отдельная цель.

Как работает новый метод

Традиционные рекомендательные системы обучаются предсказывать вероятность клика или другого немедленного действия. Однако такой подход не учитывает, что пользователь может кликнуть на много материалов, но в итоге уйти разочарованным, если качество рекомендаций в целом было низким. VK Research предлагает использовать обучение с подкреплением: модель учится максимизировать суммарную награду за сессию, где награда — это совокупная удовлетворённость, измеряемая через такие сигналы, как время чтения, возвраты, лайки.

Ключевая проблема — обучение на исторических данных, которые собраны при старой политике рекомендаций. Это называется off-policy обучением. Если просто переобучать модель на таких данных, она будет наследовать ошибки старой системы. VK Research применяет метод REINFORCE с многошаговой коррекцией off-policy. Это позволяет корректно оценивать, какое действие привело к какой награде, даже если данные собраны не идеальной политикой.

Особенность метода — он масштабируется на крупные системы с миллионами пользователей и товаров. Авторы утверждают, что их подход работает в условиях реального продакшена, где число кандидатов для рекомендации огромно.

Предыстория и контекст

Интерес к долгосрочной оптимизации в рекомендательных системах растёт последние несколько лет. Крупные платформы, такие как YouTube, Netflix, Spotify, уже исследуют методы обучения с подкреплением для улучшения удержания пользователей. Однако большинство подходов ограничивается либо короткими горизонтами, либо сложными вычислениями, которые трудно внедрить в реальном времени.

Работа VK Research отличается тем, что она предлагает практичный метод, который можно применить к уже существующим системам поиска и рекомендаций. Это важно для индустрии, где даже небольшое улучшение метрик удовлетворённости приводит к значительному росту вовлечённости и доходов.

KDD — это аббревиатура от Knowledge Discovery and Data Mining, конференция уровня A, где публикуются передовые исследования в области ИИ. Воркшоп End-to-End Customer Journey Optimization фокусируется именно на оптимизации всего пути пользователя, от первого контакта до целевого действия.

Чем отличается от предыдущих подходов

Вопрос, который часто задают: чем этот метод лучше классического REINFORCE или других алгоритмов обучения с подкреплением? Основное отличие — в многошаговой off-policy коррекции. Стандартный REINFORCE часто страдает от высокой дисперсии оценок, особенно при длинных сессиях. VK Research использует технику, которая снижает дисперсию и делает обучение более стабильным.

Также важно, что метод работает на уровне всей сессии, а не отдельного шага. Это позволяет модели понимать, что, например, показать пользователю подборку из пяти однотипных новостей — плохо, даже если каждая из них по отдельности получит клик. Модель учится балансировать разнообразие и релевантность.

Технические детали и архитектура

Хотя полный текст статьи пока не опубликован, авторы раскрывают ключевые компоненты. Используется нейросетевая архитектура, которая эмбеддинги пользователя и товара преобразует в оценку ценности действия. Функция награды — это взвешенная сумма сигналов: время на странице, глубина прокрутки, лайки, репосты. Веса подбираются эмпирически.

Обучение происходит в две стадии: сначала модель учится предсказывать награды на основе исторических данных, затем с помощью REINFORCE оптимизируется политика рекомендаций. Многошаговая коррекция учитывает, что действия, совершённые несколько шагов назад, влияют на текущую награду.

Масштабируемость достигается за счёт использования приближённых методов вычисления градиентов и эффективной выборки из большого пространства действий. Это позволяет применять метод в системах, где число возможных рекомендаций исчисляется миллионами.

Кого затронет и как

Разработчики рекомендательных систем в интернет-компаниях, особенно в e-commerce, медиа, соцсетях, получат инструмент для улучшения пользовательского опыта. Вместо того чтобы погоня за кликами приводила к кликбейту и перегруженности, системы смогут учитывать долгосрочные интересы.

Для бизнеса это означает рост удержания пользователей и LTV (lifetime value). Пользователи, которые получают релевантные рекомендации в течение длительного времени, с большей вероятностью останутся на платформе и будут совершать целевые действия.

В России и СНГ эта работа особенно значима, так как VK — одна из крупнейших технологических компаний региона. Внедрение таких методов в VK-экосистему (ВКонтакте, Одноклассники, Дзен) может повысить качество рекомендаций для миллионов пользователей.

Что будет дальше

VK Research планирует представить полную версию статьи на воркшопе в августе 2026 года. Скорее всего, после этого последуют публикации с более детальными экспериментами и, возможно, открытый код или API. Индустрия будет внимательно следить за результатами, так как подобные методы редко публикуются с достаточной детализацией для воспроизведения.

Можно ожидать, что другие компании начнут внедрять аналогичные подходы, особенно если VK покажет значительные улучшения метрик. Возможно, мы увидим гибридные методы, сочетающие обучение с подкреплением и генеративные модели.

Итог

VK Research сделала шаг к тому, чтобы рекомендательные системы думали о пользователе в долгосрочной перспективе, а не только о ближайшем клике. Метод на основе REINFORCE с многошаговой коррекцией может стать стандартом для крупномасштабных систем. Следите за развитием темы — это может изменить то, как мы взаимодействуем с цифровыми платформами.