GRPO превосходит SFT при адаптации ASR на синтезированной речи: новое исследование
Исследователи из arXiv представили работу, в которой сравнивается эффективность двух методов адаптации больших языковых моделей (LLM) для автоматического распознавания речи (ASR) при использовании синтезированной речи (TTS). В условиях, когда реальные записи речи недоступны из-за юридических и финан

Исследователи из arXiv представили работу, в которой сравнивается эффективность двух методов адаптации больших языковых моделей (LLM) для автоматического распознавания речи (ASR) при использовании синтезированной речи (TTS). В условиях, когда реальные записи речи недоступны из-за юридических и финансовых ограничений — например, в банковской сфере — синтезированная речь становится привлекательной альтернативой. Однако она акустически отличается от реальной речи. Авторы показали, что метод обучения с подкреплением Group Relative Policy Optimization (GRPO) позволяет значительно улучшить качество распознавания по сравнению с традиционным supervised fine-tuning (SFT).
Почему GRPO эффективнее SFT для ASR на синтезированной речи
Данное исследование предлагает практическое решение для регулируемых отраслей, где сбор реальных голосовых данных затруднён. Использование GRPO позволяет эффективно адаптировать ASR-модели на синтезированной речи, что может снизить затраты и ускорить внедрение голосовых интерфейсов в банках, медицинских учреждениях и других сферах с высокими требованиями к конфиденциальности. Результаты показывают, что GRPO извлекает гораздо больше пользы из синтезированной речи, чем SFT.
Как GRPO снижает Word Error Rate на 40%
В ходе экспериментов модель адаптировалась только на синтезированной речи. GRPO, метод без критика, который поощряет гипотезы с низким WER (Word Error Rate), снизил WER на 40% относительно SFT — с 36.71% до 22.09%. Комбинация SFT с последующим GRPO дала ещё большее улучшение — 45%. Анализ показал, что улучшение связано с изменением поведения модели: GRPO уменьшает ошибки вставки за счёт улучшения калибровки остановки и выравнивания речи-текста путём лучшего привязывания внимания к аудио, не затрагивая представления ранних слоёв.
Какие отрасли выиграют от применения GRPO
Разработчиков ASR-систем, работающих в условиях ограниченного доступа к реальным данным, исследователей в области обучения с подкреплением и специалистов по речевым технологиям в регулируемых отраслях. Финансовый сектор, здравоохранение и юридические службы, где конфиденциальность данных критична, могут использовать синтезированную речь для обучения моделей без риска утечки информации.
Ограничения и направления будущих исследований
Неясно, насколько результаты обобщаются на другие языки и домены, а также как GRPO поведёт себя при наличии небольшого количества реальных данных. Возможно, потребуется дополнительная настройка для многоязычных сценариев. Тем не менее, работа открывает путь к более широкому использованию синтезированной речи в ASR, особенно в условиях дефицита реальных записей.