PEFT: что может заменить LoRA — обзор новых методов тонкой настройки
Эффективная тонкая настройка больших языковых моделей (LLM) — одна из ключевых задач современного машинного обучения. LoRA (Low-Rank Adaptation) долгое время оставался стандартом де-факто благодаря низким требованиям к памяти и высокой скорости обучения. Однако у этого метода есть ограничения: неопт

Эффективная тонкая настройка больших языковых моделей (LLM) — одна из ключевых задач современного машинного обучения. LoRA (Low-Rank Adaptation) долгое время оставался стандартом де-факто благодаря низким требованиям к памяти и высокой скорости обучения. Однако у этого метода есть ограничения: неоптимальное использование ранга, чувствительность к гиперпараметрам и сложность настройки. В недавней статье Hugging Face представили альтернативы LoRA, которые могут предложить лучшую производительность при схожих затратах ресурсов. Давайте разберёмся, какие методы появились и чем они отличаются.
Почему LoRA нуждается в замене
LoRA работает путём введения низкоранговых матриц в слои модели, что позволяет дообучать лишь небольшую часть параметров. Однако исследования показывают, что стандартный подход не всегда оптимален. Например, ранг адаптера часто выбирается произвольно, а скорость обучения для матриц A и B одинакова, хотя их роли в обучении различны. Кроме того, LoRA может терять информацию исходной модели, если не учитывать её структуру. Эти недостатки стимулировали разработку новых методов PEFT (Parameter-Efficient Fine-Tuning).
Обзор новых методов PEFT
DoRA: разложение на направление и магнитуду
DoRA (Directional Low-Rank Adaptation) предлагает разлагать обновления весов на две компоненты: направление и магнитуду. Это позволяет более точно контролировать процесс обучения, улучшая сходимость. В экспериментах DoRA показал прирост точности на 1-3% по сравнению с LoRA при одинаковом количестве обучаемых параметров. Метод особенно эффективен для задач классификации и понимания естественного языка.
LoRA+: разные скорости обучения для матриц
LoRA+ использует разные скорости обучения для низкоранговых матриц A и B. В оригинальном LoRA обе матрицы обновляются с одинаковой скоростью, что может замедлять обучение. LoRA+ ускоряет сходимость, позволяя каждой матрице адаптироваться со своей скоростью. Это особенно полезно при работе с большими моделями, где время обучения критично.
LoRA-FA: заморозка одной матрицы
LoRA-FA (LoRA with Frozen Adaptation) замораживает одну из низкоранговых матриц, снижая количество обучаемых параметров вдвое. При этом производительность остаётся на уровне стандартного LoRA или даже выше. Метод идеален для сценариев с ограниченными вычислительными ресурсами, когда каждый параметр на счету.
rsLoRA: масштабирование ранга
rsLoRA (Rank-Stabilized LoRA) вводит коэффициент масштабирования для ранга, что улучшает стабильность обучения при использовании высоких рангов. В обычном LoRA увеличение ранга часто приводит к нестабильности и переобучению. rsLoRA решает эту проблему, делая метод более надёжным для сложных задач.
PiSSA: инициализация через сингулярное разложение
PiSSA (Principal Singular values and Singular vectors Adaptation) инициализирует адаптеры на основе сингулярного разложения (SVD) исходных весов. Это позволяет сохранить больше информации из предобученной модели, что улучшает качество дообучения. PiSSA особенно эффективен для задач, где важно не забыть исходные знания, например, при адаптации под специфический домен.
Какой метод выбрать для вашей задачи?
Выбор метода зависит от конкретной задачи и доступных ресурсов. Если вам нужно максимальное качество при умеренных вычислительных затратах, DoRA — хороший кандидат. Для ускорения обучения подойдёт LoRA+. Если ресурсы сильно ограничены, LoRA-FA позволит сэкономить параметры. Для работы с высокими рангами выбирайте rsLoRA, а для сохранения исходных знаний — PiSSA. Важно помнить, что результаты могут варьироваться в зависимости от модели и датасета, поэтому рекомендуется проводить собственные эксперименты.
Кого затронут новые методы?
Разработчики, дообучающие LLM, исследователи в области NLP, а также компании, использующие кастомные модели на базе открытых архитектур, получат новые инструменты для повышения эффективности. Методы PEFT позволяют быстрее экспериментировать и внедрять модели в продакшн, снижая затраты на инфраструктуру.
Что пока остаётся неизвестным?
Статья Hugging Face не даёт однозначного ответа, какой метод универсально лучший. Результаты сильно зависят от задачи и модели. Кроме того, нет данных о производительности для сверхбольших моделей (например, 70B+ параметров). Будущие исследования должны прояснить эти вопросы, а также изучить комбинации методов.
Какие альтернативы LoRA существуют для тонкой настройки LLM?
Помимо описанных методов, существуют и другие подходы, такие как AdaLoRA (адаптивное распределение ранга) и Delta-LoRA (обучение только дельты весов). Однако они менее распространены. В целом, область PEFT активно развивается, и в ближайшее время мы увидим ещё больше инноваций.