Лучшая ASR-модель для русской IT-диктовки: новый бенчмарк 23 нейросетей

Выбор подходящей системы автоматического распознавания речи для голосового ввода на русском языке с обилием английских терминов — задача нетривиальная. Недавнее исследование, опубликованное на Habr, кардинально меняет представление о лидерах: автор протестировал 23 нейросети в более чем 60 конфигура

Лучшая ASR-модель для русской IT-диктовки: новый бенчмарк 23 нейросетей

Выбор подходящей системы автоматического распознавания речи для голосового ввода на русском языке с обилием английских терминов — задача нетривиальная. Недавнее исследование, опубликованное на Habr, кардинально меняет представление о лидерах: автор протестировал 23 нейросети в более чем 60 конфигурациях, потратив свыше 120 часов вычислений на одной видеокарте RTX 5070 Ti. Вопреки прежним рекомендациям, лучшей оказалась не широко разрекламированная модель, а менее известная альтернатива, что заставляет пересмотреть подходы к выбору инструментов для IT-специалистов.

Ранее в марте автор советовал использовать Whisper Large v3 для голосовой диктовки, но теперь признает, что ошибался дважды: и в методологии выбора, и в самой модели. Новый подход оказался более научным: был собран корпус русско-английских IT-фраз, каждая модель прогнана тысячи раз, а результаты оценены не только по стандартному показателю WER (Word Error Rate), но и по способности сохранять английские термины латиницей и правильно расставлять пунктуацию.

Новый лидер: неожиданный поворот

Главный сюрприз бенчмарка — первое место заняла не Whisper и не GigaAM, а модель Nemo от NVIDIA, точнее, её конфигурация с определёнными параметрами. Автор подчёркивает, что Nemo продемонстрировала оптимальный баланс между точностью распознавания русской речи и корректным сохранением английских терминов. На втором месте расположилась новая версия Whisper Large v3 Turbo, которая, вопреки ожиданиям, превзошла оригинальную v3 по всем ключевым метрикам.

В тестировании участвовали не только открытые модели, но и облачные API. Среди закрытых сервисов лучший результат показал Yandex SpeechKit, который, по словам автора, вплотную приблизился к лидерам, но уступил Nemo в распознавании специфических IT-терминов. Это особенно важно для тех, кто работает с технической документацией или кодом, где точность терминологии критична.

Почему это важно для IT-специалистов

Интерес к ASR-моделям для диктовки резко вырос с распространением голосовых интерфейсов и инструментов вроде Whisper, который стал стандартом де-факто благодаря открытости и поддержке множества языков. Однако русскоязычные пользователи часто жалуются, что Whisper «ломает» английские термины, транскрибируя их кириллицей, и плохо справляется с пунктуацией. Это создаёт серьёзные неудобства для программистов, редакторов и аналитиков, которым приходится вручную исправлять ошибки.

Автор предыдущей статьи рекомендовал Whisper Large v3, но новое исследование показывает, что эта модель не оптимальна для IT-диктовки. Проблема в том, что Whisper обучался на общих данных и не учитывает специфику технического языка. Кроме того, автор изменил методологию: вместо субъективной оценки он использовал автоматические метрики на большом корпусе, что делает результаты более объективными и воспроизводимыми.

Методология тестирования: как это было

Для получения достоверных результатов автор собрал корпус из русско-английских фраз, типичных для IT-специалистов: команды, названия технологий, фразы с кодовыми словами. Каждую модель прогнали в нескольких конфигурациях: с разными промптами, температурами и параметрами декодирования. Всего было выполнено более 100 000 прогонов, что обеспечило статистическую значимость выводов.

Метрики включали не только стандартный WER, но и отдельно оценивалась точность сохранения английских терминов латиницей и качество пунктуации. Это принципиально важно, потому что для программиста критично, чтобы модель писала «Python» и «API», а не «Питон» и «АПИ». Потеря латиницы может привести к неработоспособности кода или неправильному пониманию документации.

Технические детали: почему Nemo оказалась лучше

Nemo от NVIDIA — это семейство моделей, включающее Conformer-архитектуру, которая хорошо зарекомендовала себя в задачах распознавания речи. В отличие от Whisper, Nemo обучена на большом объёме многоязычных данных и лучше адаптируется к специфическим доменам. Автор отмечает, что Nemo показала на 15% меньший WER на IT-корпусе по сравнению с Whisper Large v3, а точность сохранения латиницы была выше на 20%. Эти цифры впечатляют и объясняют, почему Nemo заслуживает внимания.

Важную роль сыграл тюнинг: автор обнаружил, что добавление промпта «IT-диктовка» значительно улучшает результаты для многих моделей. Например, Whisper Large v3 с правильным промптом улучшил свой WER на 8%, но всё равно уступил Nemo. Это говорит о том, что даже лучшие модели требуют настройки под конкретную задачу, и пренебрежение этим аспектом может привести к неоптимальным результатам.

Кому это пригодится и как использовать

Это исследование полезно всем, кто использует голосовой ввод в работе: разработчикам, редакторам технических текстов, аналитикам. Если вы диктуете код или документацию, выбор модели напрямую влияет на скорость и качество работы. Для русскоязычных пользователей особенно важно, что Nemo доступна бесплатно и может работать локально на видеокарте среднего уровня, что обеспечивает приватность и контроль над данными.

Облачные сервисы, такие как Yandex SpeechKit, также остаются хорошим выбором, но они платные и не всегда дают контроль над данными. Для тех, кто ценит конфиденциальность, локальные модели — предпочтительнее. Nemo позволяет обрабатывать речь без отправки данных на внешние серверы, что критично для компаний с высокими требованиями к безопасности.

Как выбрать подходящую модель для диктовки

При выборе ASR-модели для русской IT-диктовки важно учитывать несколько факторов. Прежде всего, обратите внимание на способность модели сохранять английские термины латиницей — это ключевой критерий для технических текстов. Во-вторых, оцените качество пунктуации: правильно расставленные запятые и точки экономят время на редактировании. В-третьих, проверьте скорость работы и требования к оборудованию, особенно если вы планируете использовать модель локально.

Бенчмарк показал, что Nemo от NVIDIA — оптимальный выбор для большинства IT-сценариев. Однако не стоит сбрасывать со счетов Whisper Large v3 Turbo, который занял второе место и может быть полезен в некоторых случаях. Рекомендуется протестировать обе модели на своих данных, чтобы определить, какая лучше подходит для ваших конкретных задач. Автор планирует опубликовать подробную инструкцию по установке и настройке Nemo, что облегчит процесс внедрения.

Что дальше: перспективы развития ASR

Автор обещает расширить корпус и добавить новые модели, включая будущие релизы. Это означает, что лидерборд будет обновляться, и рекомендации могут измениться. Следите за обновлениями, чтобы быть в курсе последних достижений в области распознавания речи. Возможно, вскоре появятся ещё более точные и быстрые модели, которые сделают голосовой ввод ещё удобнее.

Итог

Если вы айтишник и ищете лучшую ASR-модель для русской диктовки, забудьте о Whisper Large v3 — обратите внимание на Nemo от NVIDIA. Она показывает лучший баланс точности и сохранения английских терминов, а также доступна для локального использования. Следите за обновлениями бенчмарка, чтобы быть в курсе новых лидеров и не упустить появление ещё более совершенных решений.