Apple Core ML OCR: новая модель dots.ocr достигла 97% точности на ICDAR 2019

Команда разработчиков представила dots.ocr — новую модель оптического распознавания символов (OCR), оптимизированную для Apple Core ML. Модель достигла state-of-the-art (SOTA) результатов на бенчмарке ICDAR 2019, показав точность 97%, что на 2% выше предыдущего лучшего показателя. Это означает, что

Apple Core ML OCR: новая модель dots.ocr достигла 97% точности на ICDAR 2019

Команда разработчиков представила dots.ocr — новую модель оптического распознавания символов (OCR), оптимизированную для Apple Core ML. Модель достигла state-of-the-art (SOTA) результатов на бенчмарке ICDAR 2019, показав точность 97%, что на 2% выше предыдущего лучшего показателя. Это означает, что теперь на iPhone, iPad и Mac можно распознавать текст с беспрецедентной точностью, причем все вычисления выполняются локально, без отправки данных в облако.

OCR — ключевая технология для оцифровки документов, распознавания номеров, считывания чеков и автоматизации ввода данных. Повышение точности даже на несколько процентов существенно снижает количество ошибок в реальных сценариях. Кроме того, dots.ocr работает полностью на устройстве (on-device), обеспечивая приватность данных и работу без интернета. Это особенно важно для корпоративных приложений, где конфиденциальность информации имеет первостепенное значение.

Как работает dots.ocr

Модель основана на архитектуре Transformer с использованием предобученного энкодера и декодера. Такой подход позволяет эффективно обрабатывать последовательности символов и учитывать контекст всего изображения. Оптимизация для Apple Neural Engine и Core ML обеспечивает высокую производительность на устройствах Apple: время инференса на iPhone 14 составляет менее 100 мс на одно изображение. Размер модели — около 50 МБ, что позволяет легко встраивать её в мобильные приложения без значительного увеличения их объема.

Какие языки поддерживает модель?

dots.ocr поддерживает распознавание печатного текста на нескольких языках, включая английский, китайский, японский и корейский. Это делает её универсальным инструментом для международных приложений. Разработчики планируют расширять языковую поддержку в будущих версиях. Модель обучена на разнообразных наборах данных, что обеспечивает устойчивость к различным шрифтам и условиям съемки.

Почему это важно для разработчиков и пользователей

Для разработчиков iOS и macOS приложений dots.ocr открывает новые возможности. Теперь можно создавать приложения для сканирования документов, переводчики с камеры, системы автоматического ввода данных с высоким качеством распознавания. Пользователи получат более точные и быстрые инструменты, работающие офлайн и сохраняющие приватность. Например, приложение для сканирования визиток сможет распознавать даже мелкий текст на разных языках без задержек.

Как dots.ocr повлияет на существующие OCR-решения?

Традиционные облачные OCR-сервисы, такие как Google Cloud Vision или Amazon Textract, требуют передачи данных на сервер, что может вызывать задержки и проблемы с конфиденциальностью. dots.ocr предлагает альтернативу: высокая точность на устройстве без компромиссов по скорости. Это особенно важно для приложений, работающих с чувствительными данными, например, в медицине или финансах. Кроме того, модель с открытым исходным кодом под лицензией MIT позволяет разработчикам адаптировать её под свои нужды.

Детали реализации и доступность

Код и веса модели опубликованы на Hugging Face под лицензией MIT, что способствует быстрому внедрению и дальнейшему развитию. Разработчики могут скачать модель и интегрировать её в свои проекты с помощью Core ML. Для работы требуется устройство с Apple Neural Engine, начиная с iPhone 8 и iPad 3-го поколения. Однако производительность на старых устройствах может быть ниже: время инференса на iPhone X может достигать 200 мс, но точность остается высокой.

Какие ограничения есть у модели?

Пока не раскрыты подробности обучения, такие как размер датасета и количество эпох. Также неясно, насколько хорошо модель работает на старых устройствах (iPhone X и более ранних), где производительность Neural Engine ниже. Разработчики рекомендуют тестировать модель на целевых устройствах перед выпуском. Кроме того, модель оптимизирована для печатного текста — распознавание рукописного ввода может быть менее точным.

Будущее развитие

Команда dots.ocr планирует расширять языковую поддержку, улучшать распознавание рукописного текста и оптимизировать модель для более старых устройств. Также ведутся работы над поддержкой многострочного текста и таблиц. С открытым исходным кодом сообщество может внести свой вклад в развитие модели. Возможно, появление dots.ocr подтолкнет других разработчиков к созданию конкурентных on-device OCR-решений, что в конечном итоге выиграют пользователи.

Заключение

dots.ocr — значительный шаг вперед в области on-device OCR для экосистемы Apple. Сочетание SOTA-точности, высокой скорости и приватности делает модель привлекательной как для разработчиков, так и для конечных пользователей. С открытым кодом и активным сообществом dots.ocr имеет все шансы стать стандартом для распознавания текста на устройствах Apple.