Новый алгоритм RL без TD-обучения: масштабирование на длинные горизонты

Исследователи из лаборатории BAIR (Berkeley Artificial Intelligence Research) представили новый алгоритм обучения с подкреплением (RL), который отказывается от традиционного temporal difference (TD) обучения. Вместо этого метод использует парадигму «разделяй и властвуй» (divide and conquer), что поз

Новый алгоритм RL без TD-обучения: масштабирование на длинные горизонты

Исследователи из лаборатории BAIR (Berkeley Artificial Intelligence Research) представили новый алгоритм обучения с подкреплением (RL), который отказывается от традиционного temporal difference (TD) обучения. Вместо этого метод использует парадигму «разделяй и властвуй» (divide and conquer), что позволяет эффективно решать задачи с длинными горизонтами. Этот подход может стать прорывом для off-policy RL, где данные часто устаревшие или разнородные, а ошибки при бутстрэппинге накапливаются.

Почему TD-обучение перестало справляться

TD-обучение лежит в основе многих классических алгоритмов, таких как Q-learning и его современных вариантов. Однако оно сталкивается с фундаментальной проблемой: при бутстрэппинге ошибка в оценке ценности следующего состояния переносится на текущую оценку, что приводит к накоплению погрешностей. В задачах с длинными горизонтами, где количество шагов велико, эти ошибки становятся критическими. Особенно остро это проявляется в off-policy RL, где данные могут быть собраны разными политиками, включая устаревшие или неоптимальные. Новый алгоритм обходит это ограничение, заменяя бутстрэппинг на декомпозицию задачи на подзадачи.

Как работает новый алгоритм

Вместо того чтобы оценивать ценность состояний через рекуррентные уравнения Беллмана, авторы предлагают разбивать исходную задачу на несколько более коротких подзадач. Каждая подзадача решается независимо, а затем результаты объединяются. Это предотвращает накопление ошибок, так как оценка ценности не зависит от последующих состояний. Такой подход особенно эффективен для off-policy RL, где данные могут быть собраны разными политиками. Алгоритм способен использовать любые доступные данные — старый опыт, демонстрации человека или даже данные из интернета. В отличие от on-policy методов (например, PPO или GRPO), которые требуют сбора данных с текущей политики, off-policy RL более гибок, но традиционно сложнее в реализации. К 2025 году on-policy подходы хорошо масштабируются, а off-policy — нет. Новая работа предлагает альтернативу, которая может изменить эту ситуацию.

Какие задачи решает новый подход

Как off-policy RL используется в робототехнике?

В робототехнике сбор новых данных часто дорог и опасен. Off-policy RL позволяет использовать ранее собранные данные, включая неудачные попытки или демонстрации человека. Новый алгоритм может обучаться на таких разнородных данных без риска накопления ошибок, что ускоряет обучение и повышает безопасность. Например, робот может учиться манипулировать объектами, используя данные из предыдущих экспериментов, не требуя повторного сбора.

Как это применимо в диалоговых системах?

В диалоговых системах, таких как чат-боты, данные поступают от разных пользователей и политик. Off-policy RL позволяет обучать модель на исторических диалогах, не требуя взаимодействия с пользователями в реальном времени. Новый алгоритм может эффективно обрабатывать такие данные, улучшая качество ответов и адаптацию к новым сценариям без накопления ошибок.

Что это значит для здравоохранения?

В медицинской аналитике данные о лечении пациентов собираются годами и часто являются off-policy. Новый алгоритм может использоваться для оптимизации стратегий лечения, например, в задачах персонализированной медицины. Он позволяет обучаться на исторических данных, не требуя проведения новых клинических испытаний, что снижает затраты и риски.

Кого затронет новая разработка

Разработчиков алгоритмов RL, инженеров в робототехнике, специалистов по диалоговым системам и медицинской аналитике. Все, кто сталкивается с необходимостью обучения на разнородных данных с длинными горизонтами, могут получить выгоду от этого подхода. Особенно это актуально для off-policy RL, где сбор новых данных дорог или невозможен.

Что пока неизвестно

Конкретные детали реализации алгоритма пока не раскрыты. Неизвестна его производительность на стандартных бенчмарках, таких как Atari или MuJoCo, и сравнение с существующими off-policy методами, например CQL или IQL. Также неясно, насколько хорошо он масштабируется на реальные задачи с большими пространствами состояний и действий. Потребуются дополнительные исследования, чтобы подтвердить его эффективность в промышленных сценариях. Однако сама идея отказа от TD-обучения в пользу декомпозиции задач выглядит многообещающей и может стимулировать новые разработки в области RL.