Docmatix: датасет с 2,4 млн изображений для Document VQA от Hugging Face

Hugging Face представила Docmatix — крупнейший открытый датасет для задачи Document Visual Question Answering (документальный визуальный вопросно-ответный анализ). Он включает 2,4 миллиона изображений документов и 9,5 миллионов пар «вопрос-ответ», что в 240 раз превышает размеры существующих публичн

Docmatix: датасет с 2,4 млн изображений для Document VQA от Hugging Face

Hugging Face представила Docmatix — крупнейший открытый датасет для задачи Document Visual Question Answering (документальный визуальный вопросно-ответный анализ). Он включает 2,4 миллиона изображений документов и 9,5 миллионов пар «вопрос-ответ», что в 240 раз превышает размеры существующих публичных датасетов, таких как DocVQA. Этот прорыв открывает новые возможности для обучения моделей, способных понимать и анализировать сложные документы — от счетов и контрактов до научных статей и финансовой отчётности.

Почему Docmatix важен для развития ИИ Традиционные датасеты для Document VQA были ограничены по размеру, что сдерживало прогресс в создании моделей, способных работать с реальными документами. Например, популярный датасет DocVQA содержит всего около 10 тысяч изображений, чего недостаточно для обучения больших языковых моделей (LLM) и мультимодальных архитектур. Docmatix решает эту проблему, предоставляя на два порядка больше данных. Это может ускорить разработку ИИ-ассистентов для автоматизации ввода данных, анализа договоров, обработки счетов и других задач, связанных с документооборотом. Благодаря такому объёму данных модели смогут лучше обобщать и понимать разнообразные форматы документов, включая таблицы, формы и рукописный текст.

Как создавался Docmatix Docmatix построен на основе PDFA-датасета, который содержит PDF-документы с разметкой. Изображения страниц были сгенерированы с помощью рендеринга PDF-файлов, а вопросы и ответы — автоматически с использованием пайплайна на базе языковых моделей, включая Llama 3 и GPT-4. Такой подход позволил масштабировать создание датасета без ручной разметки, но при этом сохранить высокое разнообразие типов документов: научные статьи, формы, таблицы, счета, юридические документы. Каждое изображение сопровождается несколькими вопросами, требующими понимания текста, таблиц и структуры документа. Размер датасета в несжатом виде составляет около 1 ТБ, что делает его серьёзным ресурсом для обучения.

Какие типы документов охватывает датасет Docmatix включает широкий спектр документов: от научных публикаций и технических отчётов до счетов, квитанций, контрактов и анкет. Это важно, потому что модели, обученные только на одном типе документов, плохо обобщаются на другие. Например, модель, обученная на научных статьях, может не справиться с распознаванием таблиц в счетах. Docmatix решает эту проблему, предоставляя разнообразные примеры, что позволяет создавать универсальные решения для Document VQA.

Кому будет полезен Docmatix Исследователи и разработчики в области искусственного интеллекта, работающие над мультимодальными моделями и пониманием документов, получат мощный инструмент для тренировки и тестирования. Бизнес, автоматизирующий обработку документов — бухгалтерия, юриспруденция, страхование — сможет создавать более точные ИИ-ассистенты, которые сократят ручной труд. Например, чат-бот для документооборота, обученный на Docmatix, сможет отвечать на вопросы по контрактам, извлекать ключевые данные из счетов или анализировать финансовую отчётность. Пользователи, разрабатывающие подобные решения, получат доступ к данным, которые ранее были недоступны.

Какие ограничения и неопределённости существуют Несмотря на масштаб, Docmatix имеет ограничения. Во-первых, качество автоматически сгенерированных вопросов и ответов может быть неидеальным — возможны ошибки, неполные ответы или вопросы, не соответствующие содержанию документа. Во-вторых, не указано, планируется ли обновление датасета с учётом обратной связи сообщества. В-третьих, лицензия для коммерческого использования отдельных компонентов (изображений, вопросов) пока не уточнена, что может создать юридические риски для бизнеса. Тем не менее, для исследовательских целей датасет уже доступен и может стать основой для новых прорывов в Document VQA.

Перспективы развития Document VQA с Docmatix Появление такого крупного датасета, как Docmatix, может стимулировать развитие новых архитектур, специально заточенных под анализ документов. Уже сейчас существуют модели, такие как LayoutLM и Donut, которые показывают хорошие результаты на небольших датасетах, но с Docmatix их потенциал может раскрыться полностью. Кроме того, датасет может быть использован для предобучения мультимодальных LLM, что повысит их способность работать с визуальной и текстовой информацией одновременно. В долгосрочной перспективе это приблизит создание полноценных ИИ-ассистентов, способных заменить человека в рутинной работе с документами.

Заключение Docmatix от Hugging Face — это значительный шаг вперёд для области Document VQA. С 2,4 миллионами изображений и 9,5 миллионами пар вопрос-ответ он предоставляет исследователям и разработчикам ресурс, который ранее был недоступен. Несмотря на некоторые неопределённости, датасет уже сейчас может быть использован для обучения более мощных и точных моделей. Если вы работаете над автоматизацией документооборота или исследованиями в области мультимодального ИИ, Docmatix стоит изучить в первую очередь.