TACO: новый метод RL для LLM решает проблему «загрязнения» положительного кредита

Исследователи представили метод Tail-Aware Credit Calibration (TACO), который решает проблему Positive-Credit Contamination в обучении с подкреплением больших языковых моделей. Этот подход позволяет дифференцировать токены по степени риска, предотвращая усиление ошибочных рассуждений и повышая стаби

TACO: новый метод RL для LLM решает проблему «загрязнения» положительного кредита

Исследователи представили метод Tail-Aware Credit Calibration (TACO), который решает проблему Positive-Credit Contamination в обучении с подкреплением больших языковых моделей. Этот подход позволяет дифференцировать токены по степени риска, предотвращая усиление ошибочных рассуждений и повышая стабильность обучения.

Проблема Positive-Credit Contamination

При обучении LLM с помощью методов RL, таких как GRPO, все токены в сгенерированной траектории получают одинаковый положительный кредит, если итоговый ответ верен. Однако в длинных цепочках рассуждений некоторые токены могут быть ошибочными, но всё равно получают подкрепление. Это явление называется «загрязнением» положительного кредита. В результате модель начинает закреплять неверные шаги, что ухудшает качество рассуждений.

Как работает TACO

TACO вычисляет для каждого токена tail-risk score — показатель, который оценивает, насколько токен является неожиданным с учётом локального контекста. Этот скор основан на вероятности генерации: если токен имеет низкую вероятность, но при этом не является исследовательским, он считается рискованным. Затем рискованные токены получают ослабленное подкрепление, в то время как полезные редкие паттерны, повторяющиеся в разных траекториях, могут накапливать положительный кредит. Таким образом, TACO не просто удаляет градиенты для всех низковероятных токенов, а дифференцирует их.

Почему это лучше, чем просто фильтрация?

Простое удаление градиентов для низковероятных токенов могло бы подавить полезные редкие генерации, которые важны для исследования. TACO же использует tail-risk score, чтобы отличить случайную ошибку от ценного открытия. Это позволяет сохранить исследовательский потенциал, одновременно уменьшая влияние ошибочных шагов.

Экспериментальные результаты

Авторы протестировали TACO на трёх различных LLM и восьми бенчмарках, включая задачи на рассуждение и математику. Результаты показали, что TACO превосходит базовые методы GRPO по стабильности обучения и финальной производительности. Особенно заметно улучшение в длинных сценариях, где цепочки рассуждений содержат много шагов. Модели, обученные с TACO, реже зацикливались на ошибочных путях и демонстрировали более высокую точность.

Какие бенчмарки использовались?

В исследовании применялись такие бенчмарки, как GSM8K, MATH, ARC, и другие. На каждом из них TACO показал прирост от 2% до 5% по сравнению с GRPO. При этом метод не требовал значительного увеличения вычислительных ресурсов.

Кому будет полезен TACO?

Разработчики и исследователи, работающие над улучшением рассуждений в LLM с помощью RL, найдут TACO полезным инструментом. Особенно актуален метод для задач, где важна длинная цепочка рассуждений, например, в математике, программировании или логических выводах. TACO может быть интегрирован в существующие пайплайны обучения без серьёзных изменений.

Как внедрить TACO в свой проект?

Исходный код метода доступен на GitHub по адресу https://github.com/xiuyilou/TACO. Для использования достаточно заменить стандартный расчёт преимущества в RL-алгоритме на TACO. В репозитории приведены примеры конфигураций и инструкции по запуску.

Ограничения и неизвестные аспекты

На данный момент не сообщается о производительности TACO на моделях с разными архитектурами, например, на трансформерах с разрежённым вниманием или на моделях меньшего размера. Также не исследовано поведение метода в задачах, где редкие токены действительно являются ключевыми для правильного ответа. Возможно, в таких случаях TACO может чрезмерно подавлять полезные генерации. Авторы планируют дальнейшие исследования в этих направлениях.

Заключение

TACO представляет собой значительный шаг вперёд в RL для LLM, решая давнюю проблему загрязнения положительного кредита. Метод позволяет моделям учиться более эффективно, избегая закрепления ошибок. Благодаря открытому исходному коду, любой исследователь может протестировать и адаптировать TACO под свои задачи. Ожидается, что этот подход найдёт широкое применение в улучшении рассуждений и стабильности больших языковых моделей.