Синтетические задачи заменяют человеческую курацию в RLVR с эффективностью до 11,6 раз
Новое исследование, опубликованное на arXiv (ID: 2606.03800), демонстрирует, что синтетические задачи могут заменить человеческую курацию в обучении с подкреплением на основе верифицируемых наград (RLVR) с эффективностью до 11,6 раз. Ученые предложили метод автоматической генерации задач через предо

Что произошло
Новое исследование, опубликованное на arXiv (ID: 2606.03800), демонстрирует, что синтетические задачи могут заменить человеческую курацию в обучении с подкреплением на основе верифицируемых наград (RLVR) с эффективностью до 11,6 раз. Ученые предложили метод автоматической генерации задач через предопределенные аугментации небольшого набора базовых примеров, созданных человеком. Это позволяет масштабировать обучение агентных языковых моделей без ручного труда.
Почему это важно
Создание качественных задач для RLVR является узким местом в развитии агентных AI-систем. Каждая задача требует ручной разработки промпта, настройки окружения и функции награды, что дорого и не масштабируется. Если синтетическая аугментация может эффективно заменить ручную курацию, это значительно снизит затраты и ускорит прогресс. Особенно это актуально для стартапов и лабораторий с ограниченными ресурсами.
Детали метода
Исследователи формализовали показатель экономической эффективности замены ρcost, который представляет собой отношение затрат на человеческую курацию к затратам на аугментацию. В контролируемом эксперименте с варьированием доли аугментированных задач в тренировочном корпусе они измерили ρcost в диапазоне от 1,4× до 11,6× в зависимости от соотношения стоимости человеческого труда и автоматической генерации. Тестирование проводилось на наборе из десяти бенчмарков, охватывающих код, следование инструкциям, рассуждения и многошаговые агентные вызовы функций. Результаты показали, что замена человеческих задач на синтетические не ухудшает обобщение на удержанных тестах.
Как синтетические задачи генерируются?
Метод использует предопределенные аугментации, такие как перефразирование, изменение параметров или добавление шума, к небольшому набору базовых задач, созданных человеком. Затем эти аугментированные варианты фильтруются по качеству с помощью автоматических проверок, например, на выполнимость или соответствие формату. Это позволяет получить большое количество разнообразных задач без ручного труда.
Кого затронет
Результаты актуальны для исследователей и разработчиков, работающих с RLVR и агентными языковыми моделями, а также для компаний, стремящихся снизить затраты на создание обучающих данных. Метод может быть особенно полезен стартапам и лабораториям с ограниченными ресурсами, так как позволяет масштабировать обучение без найма большого числа кураторов.
Что пока неизвестно
Пока неясно, как метод поведёт себя на более сложных или узкоспециализированных задачах, а также какова оптимальная стратегия фильтрации аугментаций. Требуются дальнейшие исследования для оценки долгосрочного влияния синтетических данных на поведение моделей, включая возможные перекосы или катастрофическое забывание. Также не изучено, как метод работает в условиях ограниченного количества базовых задач.
Выводы
Исследование показывает, что синтетическая аугментация может эффективно заменить человеческую курацию в RLVR, снижая затраты в 1,4–11,6 раз без потери качества. Это открывает путь к более быстрому и дешевому масштабированию агентных AI-систем. Однако необходимы дополнительные исследования для оценки применимости метода в различных сценариях.