Новая модель VNCT отказывается от направленного сканирования в SSM для компьютерного зрения

Модели пространства состояний (SSM) в компьютерном зрении долгое время полагались на направленное сканирование для обработки изображений, но это вносило пространственные искажения. Недавняя статья arXiv:2607.03589 представляет Vision Non-Causal Trapezoidal Mamba (VNCT) — некаузальную SSM второго пор

Новая модель VNCT отказывается от направленного сканирования в SSM для компьютерного зрения

Модели пространства состояний (SSM) в компьютерном зрении долгое время полагались на направленное сканирование для обработки изображений, но это вносило пространственные искажения. Недавняя статья arXiv:2607.03589 представляет Vision Non-Causal Trapezoidal Mamba (VNCT) — некаузальную SSM второго порядка, которая позволяет всем токенам изображения взаимодействовать за один проход, полностью устраняя направленное сканирование. Этот подход не только решает проблему ориентационной чувствительности, но и улучшает производительность в задачах сегментации, классификации и обнаружения объектов.

Почему направленное сканирование было проблемой

Направленное сканирование в SSM предполагает последовательную обработку токенов изображения в определенном порядке, например, слева направо или сверху вниз. Это вносит пространственное смещение, делая представления зависимыми от ориентации. В результате модели хуже справляются с поворотами и отражениями изображений, а также теряют точность при локализации объектов и сохранении границ. VNCT демонстрирует, что отказ от этой техники не только возможен, но и приводит к значительному улучшению: модель показывает меньшую деградацию при аугментациях и повышает Boundary IoU до 3.7 пунктов по сравнению с аналогами.

Как работает VNCT: некаузальная динамика второго порядка

VNCT использует динамику второго порядка и некаузальную обработку, что позволяет обмениваться информацией между всеми пикселями без последовательного сканирования. В отличие от каузальных SSM, где каждый токен зависит только от предыдущих, VNCT обрабатывает всю последовательность токенов одновременно, что устраняет пространственное смещение. Модель основана на архитектуре Mamba, но модифицирована для некаузальной работы, что делает ее более эффективной для задач компьютерного зрения, где важна глобальная контекстная информация.

Какие задачи решает VNCT и насколько она эффективна

VNCT протестирована на нескольких бенчмарках: классификация ImageNet-1K, обнаружение и сегментация объектов COCO, а также семантическая сегментация ADE20K. Результаты показывают превосходство как над SSM с направленным сканированием, так и над некаузальными SSM первого порядка. Например, в сегментации Boundary IoU улучшен на 3.7 пункта, что критично для задач, требующих точного выделения границ. Модель также устойчива к поворотам и отражениям, что делает ее привлекательной для приложений с аугментацией данных.

Кому будет полезна эта разработка

Разработчики моделей компьютерного зрения, исследователи в области архитектур нейросетей и инженеры, внедряющие SSM в приложениях, где важны скорость инференса и устойчивость к трансформациям изображений, найдут VNCT полезной. Особенно это актуально для задач автономного вождения, медицинской визуализации и робототехники, где ориентационная инвариантность и точность сегментации имеют решающее значение.

Какие остаются открытые вопросы

Несмотря на впечатляющие результаты, в статье не указано, насколько VNCT масштабируется на очень большие датасеты и модели. Также отсутствует сравнение по вычислительным затратам с современными Vision Transformers. Будущие исследования должны оценить эффективность VNCT при увеличении размера модели и датасета, а также сравнить скорость инференса и потребление памяти с альтернативами.

Какие перспективы у некаузальных SSM в компьютерном зрении

Отказ от направленного сканирования открывает новые возможности для SSM в компьютерном зрении. VNCT показывает, что некаузальные модели второго порядка могут конкурировать с современными подходами, такими как Vision Transformers, при этом сохраняя преимущества SSM в эффективности. Дальнейшие исследования могут привести к созданию еще более мощных архитектур, которые объединят сильные стороны SSM и трансформеров.

Как VNCT может повлиять на индустрию

Если VNCT подтвердит свою масштабируемость, это может привести к замене направленных SSM в коммерческих продуктах, где важна точность сегментации и устойчивость к аугментациям. Например, в системах видеонаблюдения, автономных автомобилях и медицинских анализаторах изображений. Кроме того, упрощение архитектуры за счет отказа от направленного сканирования может ускорить инференс и снизить энергопотребление.

Что дальше: куда движутся исследования SSM

Исследователи уже работают над улучшением некаузальных SSM, включая интеграцию механизмов внимания и адаптивные шаги по времени. VNCT — это шаг вперед, но еще предстоит решить проблемы масштабирования и вычислительной эффективности. В ближайшие годы мы увидим появление гибридных моделей, которые сочетают преимущества SSM и трансформеров, а также новые методы обучения без направленного сканирования.