ReCoLoRA: метод непрерывного дообучения LLM без катастрофического забывания

Как дообучать большие языковые модели на новые задачи, не теряя уже полученные знания? Этот вопрос давно мучает исследователей и инженеров. Катастрофическое забывание — когда модель, осваивая новую задачу, утрачивает навыки, приобретённые ранее, — остаётся главным камнем преткновения в последователь

ReCoLoRA: метод непрерывного дообучения LLM без катастрофического забывания

Как дообучать большие языковые модели на новые задачи, не теряя уже полученные знания? Этот вопрос давно мучает исследователей и инженеров. Катастрофическое забывание — когда модель, осваивая новую задачу, утрачивает навыки, приобретённые ранее, — остаётся главным камнем преткновения в последовательном обучении. Недавно появился метод ReCoLoRA (Recursive Consolidation of Low-Rank Adapters), который предлагает элегантное решение. Вместо того чтобы просто накапливать адаптеры, ReCoLoRA рекурсивно консолидирует знания, разлагая веса на замороженный остаток, медленно обновляемую главную компоненту и новый адаптер. Это позволяет модели начинать каждую новую задачу, уже владея предыдущим опытом.

Как работает ReCoLoRA ReCoLoRA опирается на идею низкоранговой адаптации, знакомую по LoRA. Однако вместо того чтобы добавлять новые адаптеры поверх старых, метод рекурсивно перестраивает пространство параметров. Перед каждой новой задачей текущие эффективные веса разлагаются с помощью рандомизированного SVD. Полученные компоненты делятся на три части: замороженный остаток, который сохраняет общие знания; медленно обновляемую главную компоненту, которая адаптируется под новые данные; и новый адаптер, который захватывает специфику задачи. Такая структура позволяет избежать накопления избыточных параметров и минимизирует забывание.

Почему ReCoLoRA решает проблему забывания Ключевое преимущество ReCoLoRA — рекурсивная консолидация. В стандартных подходах, таких как LoRA, каждый новый адаптер добавляется к замороженным весам, что со временем приводит к конфликтам между задачами. ReCoLoRA же перед каждой новой задачей пересматривает всю структуру, выделяя главные направления изменения весов. Это напоминает человеческое обучение: мы не просто накапливаем факты, а интегрируем их в общую картину. В результате модель сохраняет производительность на старых задачах, одновременно осваивая новые.

Экспериментальные результаты Исследователи проверили ReCoLoRA на последовательности из шести задач GLUE, используя четыре модели размером 7–8 миллиардов параметров. Метод показал лучший средний финальный балл на трёх из четырёх моделей, превзойдя LoRA, PiSSA, AdaLoRA и DoRA. При этом ReCoLoRA обучал меньше параметров, чем конкуренты. Вариант с оракульной маршрутизацией по задачам служил верхней границей — он полностью изолирует задачи, но требует знания идентификатора задачи при инференсе, что не всегда возможно.

Какие задачи решает ReCoLoRA Метод особенно полезен в сценариях, где модель нужно постоянно адаптировать под новые требования без потери старых навыков. Например, чат-бот, который должен поддерживать актуальные знания о продуктах компании, или ассистент, обучающийся новым командам от пользователя. ReCoLoRA не требует хранить отдельные адаптеры для каждой задачи, что экономит память и упрощает развёртывание.

Что ещё предстоит выяснить Несмотря на впечатляющие результаты, остаются открытые вопросы. Как поведёт себя ReCoLoRA на более длинных последовательностях задач — например, из десяти или двадцати шагов? Пока тесты ограничены шестью задачами GLUE. Также не изучалось влияние на модели размером более 10 миллиардов параметров. Кроме того, метод не проверялся на задачах, выходящих за рамки GLUE, таких как генерация кода или мультимодальные сценарии. Ответы на эти вопросы помогут понять границы применимости ReCoLoRA.

Кому стоит обратить внимание на ReCoLoRA Разработчикам, которые дообучают LLM в динамических средах, где задачи постоянно меняются. Исследователям, изучающим непрерывное обучение и эффективную адаптацию. Инженерам, работающим над снижением затрат на дообучение. ReCoLoRA предлагает практичный способ балансировать между сохранением старых знаний и освоением новых, не требуя огромных вычислительных ресурсов.

Заключение ReCoLoRA — это шаг вперёд в решении катастрофического забывания при последовательном дообучении больших языковых моделей. Рекурсивная консолидация низкоранговых адаптеров позволяет модели эффективно учиться новым задачам, не теряя старые навыки. Метод уже показал превосходство над популярными подходами на задачах GLUE, и его потенциал для реальных приложений огромен. Осталось дождаться дальнейших исследований, которые раскроют все возможности ReCoLoRA.