ImagingBench показал: ИИ не понимает физику вычислительной съёмки — провал в оптике и реконструкции

Группа исследователей представила новый бенчмарк ImagingBench, который показал, что современные vision-language модели (VLM) и агентные ИИ не способны решать задачи вычислительной съёмки на физически точном уровне. В то время как такие системы превосходно справляются с семантическим анализом изображ

ImagingBench показал: ИИ не понимает физику вычислительной съёмки — провал в оптике и реконструкции

Группа исследователей представила новый бенчмарк ImagingBench, который показал, что современные vision-language модели (VLM) и агентные ИИ не способны решать задачи вычислительной съёмки на физически точном уровне. В то время как такие системы превосходно справляются с семантическим анализом изображений, они терпят неудачу в задачах, требующих понимания волновой оптики, обратной реконструкции и калибровки. Это открытие ставит под сомнение готовность ИИ к применению в научной визуализации, медицинской диагностике и других областях, где критична физическая достоверность.

Как устроен ImagingBench

ImagingBench — это бенчмарк, опубликованный на arXiv, который включает 20 задач из пяти категорий: волновая и лучевая оптика, обработка сигналов изображений, обратная реконструкция, вычислительное зондирование и калибровка. Задачи охватывают такие методы, как линзовая и безлинзовая съёмка, event-камеры, time-of-flight, голография и другие. Исследователи тестировали модели в трёх режимах: Expert (фиксированный эксперт), Planner (планировщик) и Forward (прямая симуляция). Режим Expert предполагает, что модель получает готовое решение, Planner позволяет модели самой выбирать шаги, а Forward — это прямая симуляция физического процесса. Тестирование показало, что даже в режиме Planner, который даёт модели больше свободы, результаты лишь незначительно улучшаются по сравнению с Expert.

Почему ИИ не понимает физику вычислительной съёмки

Современные VLM, такие как Gemini, GPT и Qwen, обучены на огромных объёмах данных, но эти данные в основном содержат семантическую информацию — объекты, сцены, тексты. Физические процессы, лежащие в основе вычислительной съёмки, такие как дифракция, интерференция или обратная реконструкция, редко встречаются в обучающих наборах. В результате модели генерируют визуально правдоподобные, но физически неточные результаты. Например, они могут правильно идентифицировать объект на изображении, но не могут восстановить его форму из данных event-камеры или рассчитать параметры линзы для фокусировки. Это особенно критично для задач вычислительного зондирования, где требуется точное понимание физики распространения света.

Какие задачи оказались самыми сложными

Наиболее слабые результаты модели показали на задачах вычислительного зондирования: безлинзовая съёмка, event-based реконструкция, time-of-flight и голография. В этих задачах требуется не просто анализ изображения, а обратная реконструкция физического процесса. Например, в безлинзовой съёмке нужно восстановить сцену по дифракционной картине, что требует решения обратной задачи оптики. Модели не справляются с этим, так как не обладают встроенным пониманием волновой природы света. В то же время специализированные неагентные методы, основанные на классических алгоритмах, показывают значительно лучшие результаты.

Кого затронет это открытие

Разработчики агентных ИИ-систем, исследователи в области компьютерного зрения и вычислительной съёмки, а также инженеры, создающие приложения для научной визуализации и медицинской диагностики, должны учитывать эти ограничения. Если ИИ не понимает физику, его нельзя использовать для задач, где требуется высокая точность, например, в микроскопии, астрономии или автономном вождении. Это также ставит под вопрос универсальность агентных ИИ, которые часто рекламируются как способные решать любые задачи.

Можно ли научить ИИ понимать физику?

Остаётся неясным, какие архитектурные изменения или методы обучения могли бы устранить разрыв между семантической компетенцией и физической точностью. Возможно, потребуется включение физических симуляторов в процесс обучения или использование гибридных моделей, сочетающих нейронные сети с классическими алгоритмами. Также не проводилось сравнение с узкоспециализированными моделями, обученными на физических данных. Это направление остаётся открытым для исследований.

Что дальше

ImagingBench — это первый шаг к систематической оценке физической компетенции ИИ. В будущем бенчмарк может быть расширен новыми задачами и режимами тестирования. Исследователи надеются, что это стимулирует разработку моделей, которые не только видят, но и понимают физику мира.