Infinity-Parser2: революция в разборе документов с мультизадачным обучением

Новая модель Infinity-Parser2 обещает изменить подход к оцифровке документов, объединяя в себе распознавание текста, анализ макета, таблиц, формул и даже химических структур. Разработчики применили мультизадачное обучение с подкреплением и масштабируемый синтез данных, что позволило достичь рекордно

Infinity-Parser2: революция в разборе документов с мультизадачным обучением

Новая модель Infinity-Parser2 обещает изменить подход к оцифровке документов, объединяя в себе распознавание текста, анализ макета, таблиц, формул и даже химических структур. Разработчики применили мультизадачное обучение с подкреплением и масштабируемый синтез данных, что позволило достичь рекордной точности на бенчмарках. Рассказываем, как это работает и почему это важно для автоматизации документооборота.

Что такое Infinity-Parser2 и как он работает

Infinity-Parser2 — это мультимодальная модель для сквозного разбора документов, представленная в техническом отчёте. В отличие от традиционных OCR-систем, которые выполняют только распознавание текста, эта модель способна одновременно анализировать структуру страницы, выделять таблицы, формулы, графики и даже химические формулы. Секрет такого универсализма — в трёх ключевых инновациях.

Как разработчики решили проблему нехватки данных

Одной из главных проблем при обучении моделей разбора документов является отсутствие качественных размеченных данных. Обычно разметка выполняется вручную, что дорого и медленно. Команда создала контролируемый движок синтеза данных с итеративным уточнением. На его основе был сгенерирован открытый датасет Infinity-Doc2-5M, содержащий 5 миллионов образцов на китайском и английском языках. Каждый образец включает разметку bounding boxes, Markdown, HTML, LaTeX, SMILES, структурированных графиков и порядок чтения. Это позволило модели обучаться на разнообразных и точных примерах.

Почему мультизадачное обучение с подкреплением — прорыв

Модель обучается с помощью Joint Reinforcement Learning по восьми задачам одновременно: разбор документа, анализ макета, таблиц, формул, графиков, химических формул, документный VQA (вопросно-ответная система) и общее мультимодальное понимание. Такой подход позволяет модели не просто распознавать элементы, но и понимать их взаимосвязи. Система вознаграждений поощряет правильное структурирование и интерпретацию, что повышает качество на всех задачах.

Каких результатов удалось достичь

Infinity-Parser2 выпускается в двух вариантах. Flash-версия оптимизирована для низкой задержки и работает в 3.68 раза быстрее предыдущей модели Infinity-Parser-7B, что критично для реального времени. Pro-версия нацелена на максимальную точность: она набрала 87.6% на бенчмарке olmOCR-Bench и 74.3% на ParseBench, превзойдя такие известные решения, как DeepSeek-OCR-2, PaddleOCR-VL-1.5 и MinerU2.5. Особенно впечатляет способность модели обобщаться на сложные элементы: графики, химические формулы и вопросы по документам (VQA).

Как Infinity-Parser2 сравнивается с конкурентами

На тестах модель показала значительное превосходство над аналогами. Например, на ParseBench, который оценивает точность извлечения структурированной информации, Infinity-Parser2-Pro опередил DeepSeek-OCR-2 более чем на 5 процентных пунктов. Это говорит о том, что мультизадачный подход действительно даёт преимущество в комплексном анализе документов.

Кому это пригодится

Новая модель будет полезна разработчикам OCR-систем, которые ищут более универсальное решение. Специалисты по обработке документов смогут автоматизировать извлечение данных из сложных макетов, включая таблицы и формулы. Исследователи в области мультимодального ИИ получат эталон для сравнения. Компании, занимающиеся оцифровкой архивов и автоматизацией документооборота, смогут сократить время и ошибки при вводе данных.

Какие задачи можно решить с помощью Infinity-Parser2

Модель подходит для конвертации отсканированных документов в редактируемые форматы, извлечения данных из счетов и накладных, анализа научных статей с формулами и графиками, а также для создания вопросно-ответных систем по документам. Благодаря поддержке химических формул (SMILES) она может применяться в фармацевтике и химической промышленности.

Что пока остаётся неизвестным

Разработчики не раскрыли точные архитектурные детали: количество параметров, тип трансформера и другие технические характеристики. Также пока нет информации об условиях лицензирования и дате публичного релиза. Это может затруднить внедрение модели в коммерческие продукты до официального анонса.

Перспективы развития технологии разбора документов

Infinity-Parser2 демонстрирует, что мультизадачное обучение с подкреплением может значительно улучшить качество разбора документов. В будущем можно ожидать появления моделей, которые будут ещё точнее обрабатывать рукописный текст, сложные вёрстки и многоколоночные макеты. Открытый датасет Infinity-Doc2-5M также станет стимулом для развития сообщества.

Как начать использовать Infinity-Parser2

Пока модель не выпущена публично, но технический отчёт доступен для изучения. Разработчики могут следить за обновлениями на странице проекта. После релиза, вероятно, будет опубликована демо-версия и API для интеграции. Рекомендуется заранее подготовить тестовые документы для оценки качества на своих данных.