Сравнение адаптированных VLM для ответов на вопросы по документам: результаты исследования

Современные Vision-Language Models (VLM) обещают революцию в автоматизации обработки документов, но насколько они эффективны на практике? Недавнее исследование провело всесторонний анализ восьми открытых VLM на задаче Document Visual Question Answering (DocVQA) — умении отвечать на вопросы по изобра

Сравнение адаптированных VLM для ответов на вопросы по документам: результаты исследования

Как Vision-Language Models справляются с вопросами по документам

Современные Vision-Language Models (VLM) обещают революцию в автоматизации обработки документов, но насколько они эффективны на практике? Недавнее исследование провело всесторонний анализ восьми открытых VLM на задаче Document Visual Question Answering (DocVQA) — умении отвечать на вопросы по изображениям документов. Учёные оценивали модели в трёх ключевых доменах: промышленные документы разных типов, инфографика и слайды презентаций. Эксперименты включали zero-shot тестирование, полное fine-tuning с проверкой на внутри- и междатасетных сценариях, а также few-shot обучение для переноса знаний между доменами. Результаты показали, что визуальное понимание остаётся главным узким местом, а не недостаток знаний модели, что меняет фокус дальнейших исследований в этой области.

Почему DocVQA — сложная задача для VLM

Document Visual Question Answering — это мультимодальная задача, требующая одновременного понимания визуальной структуры, текстового содержания и логической разметки документа. В отличие от традиционного OCR или простого распознавания изображений, DocVQA предполагает, что модель должна извлечь информацию из сложных макетов, таблиц, графиков и диаграмм, а затем ответить на естественно-языковой вопрос. До сих пор оставалось неясным, насколько современные VLM устойчивы к различным типам документов и способны переносить знания между доменами. Исследование заполняет этот пробел, показывая, что визуальное понимание — ключевой барьер, а не нехватка языковых знаний.

Какие модели участвовали в эксперименте?

Хотя в публикации не указаны точные названия восьми моделей, известно, что все они являются открытыми VLM, доступными для исследовательского сообщества. Среди популярных открытых VLM можно выделить LLaVA, BLIP-2, InstructBLIP, Qwen-VL, InternVL и другие. Выборка охватывает модели разного размера — от небольших архитектур с несколькими миллиардами параметров до крупных моделей с десятками миллиардов. Это позволило оценить влияние масштабирования на производительность в DocVQA.

Zero-shot результаты: сильные стороны и провалы

В zero-shot сценарии, когда модели не видели примеров из целевого домена, они показали впечатляющие результаты на структурированных макетах, таких как формы и таблицы. Однако на визуально сложных инфографиках и слайдах презентаций производительность резко падала. Это подтверждает гипотезу, что VLM хорошо понимают линейную текстовую информацию, но теряются при необходимости интерпретировать нелинейные визуальные элементы, такие как диаграммы, цветовые кодировки или перекрывающиеся объекты. Интересно, что масштабирование параметров оказалось доминирующим фактором: более крупные модели стабильно превосходили маленькие в zero-shot режиме.

Fine-tuning: маленькие модели догоняют большие

Полное fine-tuning на датасетах DocVQA кардинально изменило картину. Хотя большие модели сохраняли лидерство, supervised fine-tuning давал наибольший относительный прирост производительности для маленьких архитектур. Например, модель с 3 миллиардами параметров после дообучения могла догнать модель с 13 миллиардами в zero-shot. Это открывает возможности для использования компактных моделей в приложениях с ограниченными вычислительными ресурсами. Междатасетное тестирование показало, что модели, обученные на одном домене (например, промышленные документы), частично переносят знания на другие домены, но точность всё равно ниже, чем при внутридатасетном обучении.

Как few-shot обучение помогает переносить знания?

В few-shot экспериментах с 50 образцами целевого домена модели, предварительно дообученные на DocVQA с разными доменами, быстро адаптировались к новому типу документов. В некоторых случаях они даже превзошли полностью supervised аналоги, обученные только на целевом домене с большим количеством данных. Это говорит о том, что разнообразие доменов в предварительном обучении повышает способность модели к обобщению. Few-shot подход особенно перспективен для сценариев, где собрать большой размеченный датасет дорого или невозможно.

Кого затронут результаты исследования

Разработчики VLM получат чёткие указания: улучшение визуального понимания должно стать приоритетом, а не просто увеличение размера модели. Исследователи в области Document AI смогут сосредоточиться на архитектурах, которые лучше обрабатывают визуальную сложность. Компании, автоматизирующие обработку документов в финансах, юриспруденции и других отраслях, получат более адаптивные системы вопросно-ответного анализа. Пользователи таких систем выиграют от повышения точности и устойчивости к разным типам документов.

Что остаётся неизвестным

Исследование не раскрывает конкретные названия восьми моделей и датасеты для fine-tuning, что затрудняет воспроизведение результатов. Также неясно, как выводы масштабируются на другие типы документов, например, рукописные, исторические или сильно повреждённые. Будущие работы должны проверить устойчивость VLM к шуму, искажениям и редким языкам. Кроме того, остаётся открытым вопрос о том, как комбинировать визуальное и текстовое понимание в единой архитектуре для достижения синергетического эффекта.