AdaPrefix-GRPO: как новый метод обучения ИИ решает сложные математические задачи

AdaPrefix-GRPO — это модификация алгоритма Group Relative Policy Optimization (GRPO), которая решает проблему «застревания» модели на самых сложных примерах. В стандартном GRPO, если ни один из сгенерированных вариантов ответа в группе не оказывается верным, градиент обнуляется, и пример не даёт пол

AdaPrefix-GRPO: как новый метод обучения ИИ решает сложные математические задачи

AdaPrefix-GRPO — это модификация алгоритма Group Relative Policy Optimization (GRPO), которая решает проблему «застревания» модели на самых сложных примерах. В стандартном GRPO, если ни один из сгенерированных вариантов ответа в группе не оказывается верным, градиент обнуляется, и пример не даёт пользы для обучения. AdaPrefix-GRPO добавляет перед генерацией правильный префикс (начало решения), длина которого динамически регулируется: система удерживает успешность решения каждого примера на уровне около 50%, где сигнал градиента максимален. По мере обучения длина префикса уменьшается до нуля, и модель учится решать задачи полностью самостоятельно. Этот подход особенно актуален для задач, где модели часто ошибаются, и позволяет извлечь пользу из самых трудных примеров.

Почему сложные задачи так важны для обучения

Сложные задачи, на которых модель чаще всего ошибается, являются наиболее ценными для обучения, но в стандартном GRPO они не дают никакого сигнала. Когда все сгенерированные ответы неверны, градиент обнуляется, и пример становится бесполезным. AdaPrefix-GRPO превращает такие «безнадёжные» примеры в источник полезного градиента, что значительно повышает эффективность обучения без дополнительных вычислительных затрат. Метод особенно эффективен для небольших моделей, где прирост точности максимален. Это позволяет использовать вычислительные ресурсы более рационально, фокусируясь на примерах, которые действительно улучшают модель.

Как работает AdaPrefix-GRPO

Алгоритм AdaPrefix-GRPO вводит динамический префикс — правильное начало решения задачи. На ранних этапах обучения префикс длиннее, чтобы модель могла успешно завершить решение. По мере улучшения навыков модели длина префикса уменьшается. Система отслеживает успешность решения каждого примера и подстраивает длину префикса так, чтобы точность держалась около 50%. Это точка, где градиент максимален, и обучение происходит наиболее эффективно. В итоге префикс исчезает полностью, и модель решает задачи самостоятельно. Метод реализуется на этапе подготовки данных и с помощью маски потерь на токенах префикса; сам тренировочный процесс не требует модификаций.

Какие результаты показал новый метод

На наборе сложных математических задач для модели 0.6B точность на отложенных примерах из распределения обучения выросла в 2.1 раза (2.1x) по сравнению с обычным GRPO при одинаковых затратах FLOPs. Для Qwen3-1.7B прирост составил 1.6x, на наборе AIME — 1.7x. Длина генерируемой последовательности (trace length) сократилась примерно вдвое, что означает более короткие и эффективные рассуждения. Чем меньше модель, тем больше выигрыш от AdaPrefix-GRPO. Эти результаты показывают, что метод позволяет значительно улучшить качество рассуждений без увеличения вычислительных затрат.

Какие модели выигрывают больше всего от AdaPrefix-GRPO?

AdaPrefix-GRPO особенно эффективен для небольших моделей. Например, для модели 0.6B прирост точности составил 2.1x, а для Qwen3-1.7B — 1.6x. Это объясняется тем, что маленькие модели чаще ошибаются на сложных задачах, и стандартный GRPO не даёт им сигнала. AdaPrefix-GRPO исправляет это, предоставляя полезный градиент. Для более крупных моделей выигрыш меньше, но всё ещё значителен. Таким образом, метод идеально подходит для стартапов и исследователей, работающих с ограниченными вычислительными ресурсами.

Кому будет полезен AdaPrefix-GRPO

Разработчиков и исследователей, занимающихся обучением больших языковых моделей с подкреплением (RLHF/RL), особенно в области математических рассуждений и других сложных задач. Метод может быть полезен для компаний и стартапов, стремящихся повысить качество моделей без увеличения бюджета на обучение. AdaPrefix-GRPO легко интегрируется в существующие пайплайны, так как требует лишь модификации данных и маски потерь, а сам тренировочный процесс остаётся неизменным.

Что пока остаётся неизвестным

Не уточняется, как метод ведёт себя на других типах задач (например, на логических или кодовых), а также насколько хорошо он масштабируется на модели большего размера (например, 7B+). Не приведены результаты на стандартных бенчмарках вроде GSM8K или MATH. Также неясно, как выбор начальной длины префикса и скорость его снижения влияют на итоговое качество. Будущие исследования могут пролить свет на эти аспекты и расширить область применения AdaPrefix-GRPO.