HART: метод улучшения высокоразрешающего визуального анализа LMM без дополнительной разметки
Исследователи представили HART (High-resolution Annotation-free Reasoning Technique) — метод, который позволяет большим мультимодальным моделям (LMM) эффективно обрабатывать изображения высокого разрешения без дорогостоящей разметки. HART использует замкнутый цикл с самоверификацией: модель выделяет

Исследователи представили HART (High-resolution Annotation-free Reasoning Technique) — метод, который позволяет большим мультимодальным моделям (LMM) эффективно обрабатывать изображения высокого разрешения без дорогостоящей разметки. HART использует замкнутый цикл с самоверификацией: модель выделяет релевантные области, проверяет их и уточняет рассуждение. Это решает ключевую проблему современных LMM — квадратичный рост числа токенов при увеличении разрешения, который ведет к избыточности и шуму. В отличие от традиционных подходов, требующих ручной аннотации ключевых областей, HART обучается без внешних подсказок, что снижает затраты и ускоряет внедрение высокоразрешающего анализа в таких сферах, как медицина, автономное вождение и спутниковая съемка.
Как работает HART
Метод основан на пост-тренировочной парадигме с использованием Advantage Preference Group Relative Policy Optimization (AP-GRPO). Это алгоритм оптимизации, который позволяет модели точно локализовать ключевые области на изображении без внешних подсказок. HART не просто выделяет фрагменты, а строит объяснимые пути рассуждения: сначала модель идентифицирует потенциально важные участки, затем проверяет их релевантность через внутреннюю самоверификацию. Если область не соответствует задаче, модель корректирует фокус. Такой замкнутый цикл обеспечивает высокую точность при минимальном шуме.
Почему традиционные методы неэффективны?
Стандартные LMM обрабатывают изображения высокого разрешения путем нарезки на патчи, что приводит к квадратичному росту числа токенов. Это не только замедляет обработку, но и вносит шум — модель «тонет» в деталях, не относящихся к задаче. Ручная разметка ключевых областей решает проблему, но требует огромных ресурсов. HART обходит это ограничение, используя самоверификацию: модель учится отличать важное от второстепенного без внешних аннотаций.
Результаты экспериментов
Эффективность HART подтверждена на нескольких бенчмарках: MME-RealWorld-Lite, TreeBench, V Bench, HR-Bench-4K/8K и MMStar. Во всех задачах — от распознавания мелких объектов до сложных визуальных рассуждений — HART превзошел сильные базовые модели, включая LLaVA-NeXT, InternVL и GPT-4V. Особенно заметен прирост на наборах с высоким разрешением (4K и 8K), где традиционные методы теряют точность из-за шума. Например, на HR-Bench-8K HART показал улучшение на 12% по сравнению с лучшими аналогами.
Какие задачи решает HART?
Метод особенно полезен для сценариев, где требуется детальный анализ: медицинская диагностика (выявление патологий на снимках), автономное вождение (распознавание мелких объектов на дороге), спутниковая съемка (обнаружение изменений на местности). HART также подходит для задач визуального вопрос-ответа (VQA) и рассуждений, где необходимо сопоставлять мелкие детали с контекстом.
Кого затронет эта технология
Разработчиков мультимодальных AI-моделей, исследователей компьютерного зрения и компании, работающие с анализом изображений высокого разрешения. HART упрощает внедрение высокоразрешающего анализа, снижая порог входа: теперь не нужно собирать размеченные датасеты для каждой новой задачи. Это ускоряет разработку приложений в медицине, робототехнике, геоинформационных системах.
Какие ограничения остаются?
Пока неясно, как HART масштабируется на видео или потоки изображений — метод тестировался только на статичных кадрах. Также не изучена устойчивость к визуальным помехам (шум, размытие, частичное перекрытие). Возможно, потребуется дополнительная адаптация для работы с динамическими сценами. Тем не менее, текущие результаты впечатляют и открывают путь к более эффективным и доступным мультимодальным системам.