Vision Transformers превзошли CNN в моделировании человеческого восприятия текстур
Недавнее исследование показало, что Vision Transformers (ViTs) точнее, чем свёрточные нейросети (CNN), отражают то, как человек обрабатывает текстурные паттерны. Это открытие бросает вызов устоявшемуся мнению о том, что CNN являются лучшей моделью биологического зрения. Учёные из области вычислитель

Недавнее исследование показало, что Vision Transformers (ViTs) точнее, чем свёрточные нейросети (CNN), отражают то, как человек обрабатывает текстурные паттерны. Это открытие бросает вызов устоявшемуся мнению о том, что CNN являются лучшей моделью биологического зрения. Учёные из области вычислительной науки о зрении опубликовали на arXiv препринт, в котором сравнили внутренние представления текстур в CNN и ViTs с данными психофизических экспериментов на людях. Результаты демонстрируют, что для задач, выходящих за рамки распознавания объектов, ViTs могут быть более адекватной моделью человеческого зрения. Это может повлиять на выбор архитектуры при создании систем компьютерного зрения, ориентированных на человека, а также на понимание механизмов визуального восприятия в нейронауках.
Как проводилось сравнение текстурных представлений
В работе использовались текстуры разной сложности, сгенерированные тремя различными алгоритмами из одних и тех же исходных изображений. Исследователи применили ранговую статистику, чтобы оценить информацию, закодированную во внутренних представлениях одной CNN (предположительно ResNet) и трёх ViTs (например, ViT-B/16). Такой подход позволил количественно сравнить, насколько схожи или различны внутренние коды этих моделей при обработке одного и того же текстурного стимула. Ранговая статистика особенно полезна, поскольку она не зависит от абсолютных значений активаций, а фокусируется на относительном порядке, что делает сравнение более устойчивым к различиям в архитектурах.
Почему ViTs показали более высокую согласованность с человеком
Результаты показали, что представления текстур хорошо согласованы между разными ViTs, но не между ViTs и CNN. Это означает, что разные ViTs кодируют текстуры сходным образом, тогда как CNN использует принципиально иной код. Более того, ViTs формируют схожие представления для текстур разной сложности, что напоминает инвариантность человеческого восприятия к некоторым трансформациям. Человеческая способность распознавать текстуры лучше предсказывается по представлениям ViTs, чем CNN, что подтверждает гипотезу о том, что ViTs являются более точной моделью перцептивной обработки текстур.
Последствия для компьютерного зрения и нейронаук
Долгое время CNN считались основной моделью биологического зрения из-за их сходства с нейронными и поведенческими данными. Однако новое исследование показывает, что для задач, выходящих за рамки распознавания объектов (например, восприятие текстур), ViTs могут быть более адекватной моделью человеческого зрения. Это может повлиять на выбор архитектуры при создании систем компьютерного зрения, ориентированных на человека. Например, в медицинской визуализации, где текстура тканей играет ключевую роль в диагностике, использование ViTs может улучшить точность и интерпретируемость моделей. Кроме того, для исследователей нейронаук, которые используют глубокие модели для моделирования биологического зрения, эти результаты подсказывают, что ViTs могут быть лучшей основой для построения гипотез о работе зрительной коры.
Влияние на разработку систем распознавания образов
Разработчики систем распознавания образов, где важна текстурная информация, также могут извлечь пользу из этого открытия. Например, в анализе материалов, где текстура поверхности определяет свойства объекта, ViTs могут обеспечить более надёжное распознавание. Специалисты по психофизике, изучающие визуальное восприятие, получат новый инструмент для проверки теорий о том, как мозг обрабатывает текстуры. Однако важно отметить, что пока неясно, насколько результаты обобщаются на другие типы текстур и более широкий класс зрительных стимулов. Также не указано, какие конкретно архитектуры CNN и ViTs использовались, что затрудняет воспроизведение и сравнение.
Ограничения и дальнейшие вопросы
Несмотря на многообещающие результаты, исследование имеет ограничения. Во-первых, не указано, какие именно архитектуры CNN и ViTs применялись — например, была ли это ResNet-50 или более современная EfficientNet, и какие варианты ViT (например, ViT-L/16) участвовали. Во-вторых, неясно, как эти результаты соотносятся с нейронными данными, такими как функциональная магнитно-резонансная томография (fMRI) или электрофизиология. Без прямой корреляции с активностью мозга остаётся неопределённость, насколько ViTs действительно отражают биологические процессы. Кроме того, текстуры в эксперименте были сгенерированы алгоритмически, и их разнообразие ограничено. Будущие исследования должны проверить, сохраняются ли преимущества ViTs на натуральных текстурах и при других задачах, например, при различении текстур на фоне шума.
Какие архитектуры лучше подходят для моделирования зрения человека
Это исследование поднимает важный вопрос: какие архитектуры лучше всего подходят для моделирования зрения человека? Если ViTs превосходят CNN в восприятии текстур, то, возможно, они также лучше моделируют другие аспекты зрения, такие как восприятие формы или движения. С другой стороны, CNN остаются сильными в задачах распознавания объектов, где они демонстрируют высокую эффективность. Возможно, будущие гибридные модели, сочетающие преимущества обеих архитектур, смогут ещё точнее воспроизводить человеческое зрение. Для практических приложений, где важна текстурная информация, рекомендуется рассмотреть ViTs в качестве основной архитектуры, но с учётом вычислительных затрат.
Кого затронет это открытие
Исследователей в области компьютерного зрения и нейронаук, использующих глубокие модели для моделирования биологического зрения. Разработчиков систем распознавания образов, где важна текстурная информация (например, медицинская визуализация, анализ материалов). Специалистов по психофизике, изучающих визуальное восприятие. Также это может затронуть инженеров, создающих системы для анализа изображений в промышленности, где текстура играет ключевую роль.
Что пока неизвестно
Не указано, какие конкретно архитектуры CNN и ViTs использовались, а также насколько результаты обобщаются на другие типы текстур и более широкий класс зрительных стимулов. Также неясно, как эти результаты соотносятся с нейронными данными (например, fMRI или электрофизиологией). Кроме того, не исследовано влияние размера обучающей выборки и предобучения на качество текстурных представлений. Будущие работы должны прояснить эти аспекты, чтобы утверждения о превосходстве ViTs стали более обоснованными.