Почему Vision-Language модели не умеют считать: новое исследование раскрывает корень проблемы

Vision-Language модели (VLM) отлично справляются с описанием изображений, но терпят неудачу, когда нужно точно подсчитать количество объектов за пределами диапазона, на котором они обучались. Исследователи выявили, что узкое место кроется не в восприятии или понимании величины, а в этапе символьного

Почему Vision-Language модели не умеют считать: новое исследование раскрывает корень проблемы

Vision-Language модели (VLM) отлично справляются с описанием изображений, но терпят неудачу, когда нужно точно подсчитать количество объектов за пределами диапазона, на котором они обучались. Исследователи выявили, что узкое место кроется не в восприятии или понимании величины, а в этапе символьного отображения — модель не может сопоставить визуальное количество с числовым токеном. Работа опубликована на arXiv и предлагает новое объяснение этого ограничения, которое мешает многим приложениям ИИ.

Почему визуальный счёт критичен для ИИ

Визуальный подсчёт объектов — одна из базовых задач для систем искусственного интеллекта, от анализа медицинских изображений до автономного вождения. Например, в радиологии модель должна точно подсчитать количество узелков на снимке лёгких, а в беспилотном автомобиле — число пешеходов на перекрёстке. Если модель не может обобщить навык счёта на количества, выходящие за пределы обучающей выборки, это ставит под угрозу надёжность и безопасность таких систем. Понимание корня проблемы — первый шаг к созданию более гибких и обобщающих моделей.

Как исследователи разложили процесс счёта на этапы

Авторы работы разбили визуальный подсчёт на три когнитивных этапа: визуальная индивидуация (выделение отдельных объектов на изображении), осознание количества (понимание, сколько объектов присутствует), и символьное отображение (сопоставление этого количества с числовым символом, например, цифрой или словом). Чтобы выяснить, на каком этапе происходит сбой, они использовали синтетические доски для игры Go с различным количеством камней и линейные зонды — инструменты, которые анализируют внутренние представления модели.

Какие этапы работают корректно

Оказалось, что визуальные кодировщики VLM сохраняют линейно разделимые представления количества даже для чисел, которые модель никогда не видела во время обучения. Это означает, что модель способна выделять объекты и различать разные количества на уровне восприятия — сбой не в зрении. Более того, модели демонстрируют скрытое осознание величины: они успешно выполняют сравнительные рассуждения о количествах, которые не могут перечислить. Например, модель может правильно ответить, что на одной доске камней больше, чем на другой, даже если точное число выходит за пределы её обученного диапазона.

Где находится узкое место

Истинная проблема обнаружилась на третьем этапе — символьном отображении. Модель не проецирует корректные визуальные величины на символьные токены. Иными словами, она видит, что объектов много, понимает, что их больше, чем пять, но не может сопоставить это с конкретным числом, например, «семь» или «девять». Это подтверждает гипотезу фрагментированной величины: VLM не формируют универсальное числовое пространство, а изучают разрозненные статистические многообразия, зависящие от модальности. Визуальное представление количества и символьное представление числа существуют в модели как отдельные «островки», которые не соединяются для невиданных количеств. Результаты были валидированы на современной foundation модели, что указывает на системный характер проблемы.

Почему простое масштабирование данных не поможет

Авторы подчёркивают, что простое увеличение объёма обучающих данных вряд ли решит проблему. Поскольку модель не формирует единого кросс-модального пространства для чисел, добавление большего количества примеров с известными количествами лишь укрепит существующие разрозненные многообразия, но не создаст мост между ними. Необходимы архитектурные изменения или новые индуктивные приоры, которые заставят модель связывать визуальные и символьные представления чисел напрямую.

Кого затронет это открытие

Результаты исследования имеют прямое значение для разработчиков VLM, исследователей в области компьютерного зрения и обработки естественного языка, а также инженеров, создающих системы, требующие точного визуального подсчёта. Например, в робототехнике, где робот должен подсчитать количество деталей на конвейере, или в системах видеонаблюдения, где нужно оценить число людей в толпе. Понимание того, что проблема лежит в символьном отображении, а не в восприятии, позволяет сосредоточить усилия на разработке методов, улучшающих кросс-модальное связывание.

Что остаётся неизвестным

Пока неясно, какие именно индуктивные приоры или архитектурные изменения могут преодолеть этот разрыв. Возможно, потребуется введение специальных модулей, которые явно обучаются отображать визуальные величины в числовые токены, или использование методов, основанных на аналогиях с человеческим познанием. Исследователи планируют изучить, можно ли обучить модель формировать универсальное числовое пространство с помощью специальных задач, таких как предсказание количества в разных модальностях одновременно.

Как это исследование меняет подход к разработке VLM

Работа подчёркивает, что даже мощные foundation модели имеют фундаментальные ограничения, которые не устраняются простым масштабированием. Для достижения настоящего обобщения в таких базовых навыках, как счёт, необходимо переосмыслить архитектуру и методы обучения. Возможно, будущие VLM будут включать отдельные компоненты для обработки количества, которые явно связывают визуальные и символьные представления, подобно тому, как это происходит в человеческом мозге.

Заключение

Исследование раскрывает ключевое узкое место визуального счёта в Vision-Language моделях: проблема не в восприятии или понимании величины, а в символьном отображении. Модели видят и понимают количество, но не могут назвать его, если оно выходит за пределы обученного диапазона. Это открытие направляет будущие усилия на создание архитектур, способных формировать единое числовое пространство, что приблизит ИИ к более человеческому уровню обобщения.