Direct-OPD: новый метод переноса RL-обучения с малых моделей на большие
Обучение с подкреплением (RL) — мощный инструмент для улучшения рассуждений языковых моделей, но его применение к большим моделям требует огромных вычислительных ресурсов. Новый метод Direct On-Policy Distillation (Direct-OPD) предлагает элегантное решение: переносить результаты RL с малой модели на

Обучение с подкреплением (RL) — мощный инструмент для улучшения рассуждений языковых моделей, но его применение к большим моделям требует огромных вычислительных ресурсов. Новый метод Direct On-Policy Distillation (Direct-OPD) предлагает элегантное решение: переносить результаты RL с малой модели на большую, экономя время и деньги. Вместо того чтобы запускать RL на сильной модели с нуля, Direct-OPD использует разницу в логитах между версиями слабой модели до и после RL как скрытую награду для сильной модели. Этот подход позволяет повторно использовать результаты обучения малой модели, делая пост-тренинг крупных языковых моделей значительно эффективнее.
Как работает Direct-OPD
Direct-OPD основан на идее дистилляции политики, но с ключевым отличием: он передает не просто финальную политику, а сдвиг, вызванный RL. Сначала исследователи обучают малую модель с помощью RL с верифицируемыми наградами (RLVR), получая улучшенную версию. Затем они сравнивают логиты (вероятности) этой улучшенной модели с её исходной версией. Логарифм отношения вероятностей используется как плотная скрытая награда для большой модели-студента. Это позволяет студенту учиться на том, как изменилась политика учителя, а не просто копировать его ответы.
Почему это эффективнее прямой дистилляции?
Прямая дистилляция, когда студент просто имитирует ответы учителя, часто не дает такого же прироста, как RL на самой модели. Direct-OPD решает эту проблему, передавая именно градиент улучшения. В экспериментах метод показал, что студент достигает результатов, сопоставимых с прямым RL, но с гораздо меньшими затратами. Например, Qwen3-1.7B после обучения с Direct-OPD показал точность 58.3% на AIME 2024, тогда как прямой RL с тем же числом шагов дал лишь 48.3%.
Какие результаты получены
Исследователи провели эксперименты на математических задачах, используя AIME 2024 как бенчмарк. Базовая модель Qwen3-1.7B без дополнительного обучения показывала точность около 48.3%. После применения Direct-OPD с малой моделью в качестве учителя точность выросла до 58.3% всего за 4 часа обучения на 8 GPU A100. Для сравнения, прямой RL на той же большой модели с тем же количеством шагов не дал улучшения, а в некоторых случаях даже снизил точность. Это подтверждает, что Direct-OPD не только экономит ресурсы, но и превосходит прямой RL по эффективности.
Какие метрики использовались?
Оценка проводилась по точности на тестовых задачах AIME 2024, которые требуют многошаговых математических рассуждений. Дополнительно измерялась вычислительная стоимость в GPU-часах. Direct-OPD потребовал всего 32 GPU-часа (4 часа на 8 GPU), тогда как прямой RL на большой модели занял бы значительно больше времени для достижения аналогичного результата.
Кому будет полезен Direct-OPD
Метод ориентирован на разработчиков и исследователей, работающих с большими языковыми моделями, особенно в задачах рассуждения и математики. Direct-OPD может снизить затраты на пост-тренинг и ускорить итерации, позволяя быстро улучшать модели без необходимости запускать дорогостоящий RL на больших моделях. Компании, которые используют LLM для логических выводов, математических расчетов или программирования, смогут быстрее внедрять улучшения.
Как это повлияет на индустрию?
Снижение стоимости пост-тренинга сделает RL более доступным для средних и малых компаний. Кроме того, метод может ускорить исследовательский цикл, позволяя быстро тестировать новые подходы к RL на малых моделях, а затем переносить результаты на большие. Это особенно важно в условиях, когда обучение больших моделей становится все более затратным.
Ограничения и нерешенные вопросы
Пока неизвестно, насколько Direct-OPD масштабируется на модели большего размера, например, с десятками миллиардов параметров. Также неясна эффективность метода для задач, не связанных с математическими рассуждениями, таких как генерация текста или диалоги. Исследователи планируют проверить метод на других доменах и с разными архитектурами.
Какие альтернативы существуют?
Существующие методы, такие как RLHF (обучение с подкреплением на основе обратной связи человека) и Rejection Sampling, также позволяют улучшать модели, но они требуют либо человеческой оценки, либо большого количества генераций. Direct-OPD предлагает более автоматизированный и дешевый подход, но его применимость к задачам с субъективными критериями пока под вопросом.
Перспективы развития
Direct-OPD открывает путь к более эффективному использованию вычислительных ресурсов в обучении языковых моделей. В будущем метод может быть комбинирован с другими техниками, такими как мультизадачное обучение или трансферное обучение. Если масштабируемость подтвердится, Direct-OPD может стать стандартным инструментом для пост-тренинга LLM.
Что дальше?
Исследователи планируют протестировать метод на моделях размером 7B и 13B, а также на задачах из других областей, таких как программирование и научные рассуждения. Кроме того, они изучают возможность применения Direct-OPD для непрерывного обучения, когда модель обновляется по мере поступления новых данных.
Direct-OPD — это не просто очередной метод дистилляции, а принципиально новый подход к переносу RL-обучения. Он позволяет эффективно использовать результаты обучения малых моделей для улучшения больших, экономя ресурсы и время. Если метод подтвердит свою эффективность на более широком спектре задач, он может стать важным инструментом для всех, кто работает с большими языковыми моделями.