Дообучение ruGPT-3 XL 1.3B до уровня современных LLM: эксперимент и сравнение с Gemma3
Можно ли превратить старую языковую модель ruGPT-3 XL 1.3B, выпущенную в конце 2020 года, в современную инструктивно-следящую LLM с помощью дообучения? Эксперимент показывает, что методы Supervised Fine-Tuning (SFT) и Direct Preference Optimization (DPO) действительно способны улучшить её, но до уро

Можно ли превратить старую языковую модель ruGPT-3 XL 1.3B, выпущенную в конце 2020 года, в современную инструктивно-следящую LLM с помощью дообучения? Эксперимент показывает, что методы Supervised Fine-Tuning (SFT) и Direct Preference Optimization (DPO) действительно способны улучшить её, но до уровня современных моделей, таких как Gemma3 1B (2025 год), всё ещё далеко. В этой статье мы разберём технические детали, результаты сравнения и перспективы использования устаревших моделей в современных задачах.
Эксперимент: дообучение ruGPT-3 XL 1.3B с помощью SFT и DPO
Исходная модель ruGPT-3 XL 1.3B была обучена исключительно на задачу продолжения текста — она не понимала инструкций и не умела вести диалог. Чтобы научить её отвечать на вопросы и выполнять команды, автор применил двухэтапный процесс: сначала Supervised Fine-Tuning (SFT) на датасете из 50 000 пар «инструкция — ответ», а затем Direct Preference Optimization (DPO) на 10 000 парах ответов, размеченных по предпочтениям. Обучение проводилось на одном GPU с использованием библиотеки Transformers. В результате модель начала демонстрировать способность следовать инструкциям, хотя качество ответов оставалось нестабильным — особенно на сложных или многошаговых запросах.
Какие методы дообучения использовались для ruGPT-3 XL?
SFT — это стандартный метод, при котором модель дообучается на размеченных данных, чтобы научиться генерировать правильные ответы на инструкции. DPO же оптимизирует модель напрямую на основе предпочтений, без необходимости в сложной системе вознаграждений, как в RLHF. Комбинация этих методов позволила улучшить качество ответов, но не устранила фундаментальные ограничения старой архитектуры. Например, модель часто теряла нить разговора или выдавала фактологически неверные сведения, особенно по темам, требующим актуальных знаний.
Предыстория и контекст
В 2020 году, когда вышла ruGPT-3 XL, индустрия ИИ была сосредоточена на генерации текста без явного учёта инструкций. Модели вроде GPT-3 от OpenAI умели продолжать текст, но не были заточены под диалог. Всё изменилось с появлением ChatGPT в 2022 году, который использовал RLHF для следования инструкциям. С тех пор методы SFT и DPO стали стандартом для дообучения базовых моделей. Эксперимент автора показывает, что даже устаревшие модели можно улучшить, но они всё равно уступают современным аналогам, таким как Gemma3, из-за разницы в архитектуре, объёме обучающих данных и качестве предобучения.
Насколько ruGPT-3 XL после дообучения приблизился к Gemma3 1B?
Сравнение проводилось на наборе тестовых вопросов, включающих простые фактологические запросы, инструкции средней сложности и многошаговые задачи. Gemma3 1B значительно превосходит дообученный ruGPT-3 XL по всем метрикам: связность ответов, точность следования инструкциям, способность обрабатывать сложные запросы. Однако дообученный ruGPT-3 XL показал удивительно неплохие результаты на простых вопросах, где требовалась фактологическая точность (например, «Какая столица России?»). Тем не менее, разрыв в качестве остаётся значительным — современная модель выдаёт более естественные и релевантные ответы.
Технические подробности дообучения и датасета
Для SFT использовался датасет из 50 000 примеров, собранный из открытых источников на русском языке: инструкции из RuGPT-3 инструктивного датасета, а также синтезированные пары. DPO проводился на подмножестве из 10 000 пар, где ответы были ранжированы по предпочтениям. Обучение велось на одном GPU NVIDIA A100 в течение нескольких дней. Автор отмечает, что ключевым ограничением является размер модели (1.3B параметров) — современные модели, такие как Gemma3 1B, имеют более эффективную архитектуру (например, использование групповой нормализации и улучшенные функции активации) и обучались на гораздо более качественных и разнообразных данных, включая многократную фильтрацию и чистку.
Кого затронет и как
Разработчики, работающие с русскоязычными моделями, могут использовать этот опыт для дообучения старых моделей под свои задачи, особенно если ресурсы ограничены. Однако для продакшн-систем лучше использовать современные модели, такие как Gemma3 или Llama. Бизнес, использующий чат-ботов, может рассмотреть дообучение ruGPT-3 XL как бюджетный вариант, но с пониманием ограничений — модель может давать нерелевантные ответы на сложные вопросы. В России и СНГ это особенно актуально, так как доступ к современным моделям может быть ограничен из-за санкций или требований к локализации.
Что будет дальше
Автор планирует продолжить работу над HabrGPT 0.5B, дообучая её на большом датасете, собранном из статей Habr. Ожидается, что это позволит улучшить качество генерации технических текстов. В целом, эксперимент показывает, что методы SFT и DPO могут вдохнуть новую жизнь в старые модели, но для достижения уровня современных LLM требуются более фундаментальные изменения в архитектуре и объёме обучающих данных. Возможно, будущие исследования будут направлены на дистилляцию знаний из больших моделей в маленькие, что может дать лучший результат.
Итог
Дообучение ruGPT-3 XL 1.3B с помощью SFT и DPO позволяет получить модель, способную следовать инструкциям, но её качество значительно уступает современным моделям, таким как Gemma3 1B. Тем не менее, это полезный эксперимент, демонстрирующий потенциал методов дообучения. Следите за развитием HabrGPT — возможно, она станет достойной альтернативой для русскоязычных задач.