ServiceNow AI и vLLM: почему точность в RL важнее быстрых исправлений
Команда ServiceNow AI представила новый подход к обучению с подкреплением (RL) для больших языковых моделей, названный «Correctness Before Corrections» (корректность до исправлений). Вместо того чтобы сосредотачиваться на быстрых исправлениях ошибок, исследователи предлагают в первую очередь добиват

Команда ServiceNow AI представила новый подход к обучению с подкреплением (RL) для больших языковых моделей, названный «Correctness Before Corrections» (корректность до исправлений). Вместо того чтобы сосредотачиваться на быстрых исправлениях ошибок, исследователи предлагают в первую очередь добиваться высокой точности на базовых задачах. Такой сдвиг в приоритетах, по их мнению, позволяет избежать нестабильности обучения и катастрофического забывания, которые часто преследуют традиционные методы RL. Результаты экспериментов с фреймворком vLLM показывают, что модели, обученные по принципу «сначала корректность», демонстрируют более высокую точность и устойчивость к шуму в данных. Это открытие может существенно повлиять на то, как компании настраивают языковые модели для коммерческих продуктов — от чат-ботов до систем генерации кода.
Что такое «Correctness Before Corrections» и как это работает
Идея «Correctness Before Corrections» заключается в пересмотре стратегии обратной связи в RL. Традиционные методы часто используют коррекции на основе ошибок на каждом шаге обучения, что может приводить к нестабильности и снижению производительности. Вместо этого ServiceNow AI предлагает сначала обучить модель достигать высокой точности на простых эталонных задачах, а затем постепенно вводить корректирующие сигналы. Технически это реализуется через модификацию функции вознаграждения и расписания обучения. На ранних этапах вознаграждение дается только за правильные ответы, а штрафы за ошибки минимизируются. Это позволяет модели сформировать устойчивое поведение без риска «забыть» ранее изученное.
Почему традиционные методы RL могут вредить моделям?
В стандартном RL для языковых моделей агент получает сигнал вознаграждения после каждого действия, и если действие ошибочно, алгоритм корректирует политику. Однако частые коррекции могут привести к тому, что модель будет «переучиваться» на шум в данных или слишком сильно реагировать на редкие ошибки. Это особенно критично для больших языковых моделей, где катастрофическое забывание — серьезная проблема. ServiceNow AI утверждает, что их подход снижает этот эффект, позволяя модели сначала освоить базовые паттерны, а затем адаптироваться к более сложным сценариям без потери качества.
Детали экспериментов с vLLM
Для проверки гипотезы исследователи использовали фреймворк vLLM версий V0 и V1. Они провели серию экспериментов, сравнивая стандартный RL с подходом «Correctness Before Corrections». В первой фазе обучения модели фокусировались на задачах с четкими критериями правильности, такими как математические вычисления или логические рассуждения. Во второй фазе постепенно вводились более сложные задачи с неоднозначными ответами. Результаты показали, что модели, обученные по новому принципу, не только достигали более высокой точности на тестовых наборах, но и демонстрировали меньшую дисперсию результатов — то есть были более стабильными.
Какие метрики улучшились?
Ключевые метрики включали точность ответов, устойчивость к шуму во входных данных и скорость сходимости. В экспериментах с vLLM V1 модели, использующие «Correctness Before Corrections», показали улучшение точности на 5–10% по сравнению с базовым RL, при этом время обучения сократилось на 15% за счет меньшего количества итераций коррекции. Устойчивость к шуму оценивалась путем добавления случайных искажений в тестовые данные — модели с новым подходом сохраняли точность на 20% выше.
Кому это пригодится в первую очередь?
Разработчики и исследователи в области RL, работающие с большими языковыми моделями, могут напрямую применить этот принцип для улучшения своих систем. Инженеры, создающие чат-ботов, генераторы кода или системы анализа текста, также выиграют от более стабильного и точного поведения моделей. Компании, которые тратят значительные вычислительные ресурсы на тонкую настройку моделей, смогут снизить затраты благодаря более эффективному обучению. Особенно это актуально для коммерческих продуктов, где предсказуемость модели критична для пользовательского опыта.
Как это повлияет на индустрию AI?
Если подход подтвердится на более крупных моделях (с сотнями миллиардов параметров), он может стать стандартом для RL в NLP. Это снизит барьер для внедрения RL в продукты, поскольку уменьшит риски нестабильности. Кроме того, принцип «сначала корректность» может быть адаптирован для других архитектур, таких как рекуррентные сети или гибридные модели, что расширит область применения.
Что осталось за кадром?
ServiceNow AI не раскрыла точные параметры экспериментов, такие как размер моделей, конкретные гиперпараметры или детали реализации в vLLM V1. Также остается открытым вопрос о масштабируемости подхода на модели с сотнями миллиардов параметров — текущие тесты проводились на моделях среднего размера. Неясно, применим ли метод к другим архитектурам, кроме трансформеров, и как он поведет себя в задачах с непрерывным обучением. Исследователи обещают опубликовать больше технических деталей в ближайшее время, но пока сообщество может лишь строить догадки.
Какие следующие шаги?
Ожидается, что ServiceNow AI продолжит тестирование на более крупных моделях и, возможно, выпустит открытый код для воспроизведения результатов. Если подход окажется успешным, это может стимулировать другие компании, такие как OpenAI или Google, пересмотреть свои стратегии RL. Пока же разработчики могут экспериментировать с модификацией функции вознаграждения в своих проектах, используя принцип «сначала корректность» как отправную точку.