VoiceSwitch: полностью локальная диктовка для русского языка на Mac на базе GigaAM, Whisper и Qwen

VoiceSwitch — это приложение для macOS, которое позволяет диктовать текст полностью локально, без отправки аудио в облако. Оно работает на Mac с процессорами Apple Silicon и использует несколько движков распознавания речи: российскую нейросеть GigaAM, OpenAI Whisper, Qwen от Alibaba и встроенную сис

VoiceSwitch: полностью локальная диктовка для русского языка на Mac на базе GigaAM, Whisper и Qwen

VoiceSwitch — это приложение для macOS, которое позволяет диктовать текст полностью локально, без отправки аудио в облако. Оно работает на Mac с процессорами Apple Silicon и использует несколько движков распознавания речи: российскую нейросеть GigaAM, OpenAI Whisper, Qwen от Alibaba и встроенную систему Apple. Все вычисления выполняются на устройстве, что гарантирует приватность и скорость.

Приложение представляет собой menu bar-утилиту, активируемую глобальной клавишей. После нажатия начинается запись голоса, а после остановки аудио обрабатывается выбранным движком. Распознанный текст может быть автоматически исправлен или сокращён с помощью языковой модели Qwen3-4B, после чего вставляется в активное окно — будь то текстовый редактор, браузер или мессенджер.

Как устроен VoiceSwitch: Swift, Python и локальные нейросети

Приложение построено на двух компонентах: графический интерфейс написан на Swift, а обработка речи вынесена в Python worker. Это позволяет подключать разные модели распознавания без перекомпиляции основного приложения. Разработчик выбрал четыре движка для тестирования: GigaAM (российская модель от команды «Салют»), Whisper (OpenAI), Qwen (Alibaba) и нативное распознавание Apple. Все они работают локально, используя ресурсы нейронного блока (Neural Engine) или GPU Mac.

Архитектура VoiceSwitch предусматривает, что аудиофайл после записи передаётся в Python-скрипт, который загружает модель, выполняет распознавание и возвращает текст. Затем, если включён режим коррекции, текст передаётся в Qwen3-4B — небольшую, но эффективную языковую модель, которая может исправить ошибки, удалить слова-паразиты или сократить расшифровку до сути. Весь конвейер работает на устройстве, без интернет-соединения.

Результаты тестирования: GigaAM vs Whisper vs Qwen vs Apple

Автор провёл сравнение четырёх движков на русском и смешанном аудио. На чистой русской речи лучший результат показала GigaAM — она дала наименьшее количество ошибок, особенно в сложных словах и окончаниях. Whisper (модель large-v3) показал сопоставимое качество, но немного уступал в точности на специфической лексике. Qwen (модель Qwen2-Audio) справился хорошо, но требовал больше ресурсов. Встроенное распознавание Apple оказалось наименее точным для русского языка — оно часто путало похожие по звучанию слова и хуже обрабатывало паузы.

На смешанном аудио, где русская речь перемежалась английскими терминами или техническими названиями, ситуация изменилась. Whisper показал себя лучше всех благодаря тому, что обучался на многоязычных данных. GigaAM, будучи специализированной на русском, иногда «ломала» английские вставки, транскрибируя их как похожие русские слова. Qwen занял промежуточную позицию, а Apple — по-прежнему отставал.

Какой движок распознавания речи выбрать для русского языка?

Если вы работаете преимущественно с русским текстом, лучший выбор — GigaAM. Она обеспечивает максимальную точность на русской речи, особенно в сложных словах и окончаниях. Для смешанного русско-английского контента, например для программистов или технических специалистов, лучше подходит Whisper — он уверенно обрабатывает переключение между языками. Qwen — универсальный вариант, но требует больше ресурсов. Встроенное распознавание Apple стоит использовать только как запасной вариант, когда другие модели недоступны.

Ловушка macOS TCC: почему пришлось повозиться с разрешениями

Одна из главных трудностей при разработке VoiceSwitch — система безопасности macOS Transparency, Consent, and Control (TCC). Чтобы приложение могло записывать звук с микрофона и вставлять текст в другие приложения, требуется явное разрешение пользователя. Причём для каждого приложения-цели (например, для вставки в Safari) нужно отдельное разрешение на управление через Accessibility API. Разработчик подробно описал эту проблему: без правильной настройки entitlements и подписи кода приложение просто не сможет получить доступ к глобальным событиям клавиатуры и микрофону.

Кого затронет VoiceSwitch

Приложение будет полезно разработчикам, журналистам, студентам и всем, кто много печатает и хочет ускорить ввод текста голосом. Особенно актуально для тех, кто работает с конфиденциальными данными и не может использовать облачные сервисы диктовки. VoiceSwitch также может заинтересовать пользователей, которые пишут на смеси русского и английского — например, программистов, комментирующих код на русском, но использующих английские идентификаторы.

Для пользователей в России и СНГ локальная диктовка особенно важна, так как многие облачные сервисы распознавания речи либо недоступны, либо имеют ограничения по скорости и точности. VoiceSwitch предлагает альтернативу, не зависящую от интернета.

Что будет дальше

Сейчас VoiceSwitch доступен в бета-версии. Разработчик планирует добавить поддержку других языков, улучшить интерфейс настройки моделей и, возможно, интегрировать возможность выбора модели для каждого профиля. Также в планах — оптимизация производительности для более старых Mac. Исходный код, вероятно, будет открыт, что позволит сообществу дорабатывать приложение.

Итог

VoiceSwitch — пример того, как современные нейросети могут сделать голосовой ввод полностью локальным и приватным. Сочетание GigaAM для русского, Whisper для многоязычной речи и Qwen для постобработки даёт гибкость и качество, недоступное встроенным инструментам macOS. Если вы работаете с текстом на Mac и цените конфиденциальность, это приложение стоит попробовать.