Разреженное внимание в CLIP: как α-entmax улучшает плотные предсказания с открытым словарём
Исследователи нашли способ повысить точность плотных предсказаний модели CLIP, заменив стандартный механизм softmax-внимания на разреженный аналог. Этот подход, основанный на α-entmax, обнуляет нерелевантные токены, снижая шум и улучшая локализацию объектов. В результате модель точнее справляется с

Исследователи нашли способ повысить точность плотных предсказаний модели CLIP, заменив стандартный механизм softmax-внимания на разреженный аналог. Этот подход, основанный на α-entmax, обнуляет нерелевантные токены, снижая шум и улучшая локализацию объектов. В результате модель точнее справляется с задачами семантической сегментации и мелкозернистого поиска, особенно когда базовое внимание размывается за пределы целевого класса.
CLIP, разработанный OpenAI, стал одной из самых влиятельных моделей в области компьютерного зрения благодаря способности работать с открытым словарём — то есть распознавать объекты, не входящие в обучающую выборку. Однако в плотных предсказаниях, таких как семантическая сегментация, где каждый пиксель изображения должен быть отнесён к определённому классу, CLIP сталкивается с проблемой шума. Стандартный softmax распределяет вес внимания по всем парам токенов, включая семантически нерелевантные области. Это приводит к размытым границам и неточной локализации.
Как работает разреженное внимание в CLIP
Предложенный метод заменяет row-wise softmax в последних слоях визуального самовнимания на α-entmax. В отличие от softmax, который присваивает ненулевой вес каждому токену, entmax использует порог, зависящий от данных, и обнуляет низкие оценки внимания. Это означает, что модель фокусируется только на наиболее релевантных токенах, игнорируя фоновый шум. Важно, что замена происходит на этапе инференса, то есть не требует переобучения модели.
α-entmax является обобщением softmax и sparsemax. Параметр α контролирует степень разреженности: при α=2 получается sparsemax, который полностью обнуляет некоторые токены, а при α=1 — стандартный softmax. Исследователи экспериментировали с различными значениями α и обнаружили, что оптимальный баланс между разреженностью и сохранением информации достигается при α=1.5. Этот параметр позволяет эффективно отсекать шум, не теряя при этом важные детали.
Метод универсален: он работает как для стандартного механизма query-key внимания, так и для вариантов с самокорреляцией. Это делает его применимым к различным архитектурам на основе трансформеров, использующих CLIP в качестве backbone.
Почему это важно для плотных предсказаний
Плотные предсказания с открытым словарём требуют от модели точной пространственной локализации. Например, в семантической сегментации необходимо правильно классифицировать каждый пиксель, а в мелкозернистом поиске — найти объекты по описанию. CLIP с softmax-вниманием часто «размазывает» внимание на соседние объекты или фон, что снижает точность. Разреженное внимание решает эту проблему, заставляя модель игнорировать нерелевантные области.
Эксперименты показали значительное улучшение на наборах данных Pascal VOC, Pascal Context и ADE20K. Наибольший прирост наблюдался в сценариях, где базовое внимание было сильно размыто — например, при сегментации мелких объектов или объектов на зашумлённом фоне. Для FG-OVD (fine-grained open-vocabulary detection) точность поиска также выросла, особенно для классов с высокой визуальной вариативностью.
Интересно, что улучшение коррелирует с тем, насколько сильно исходное softmax-внимание отклонялось от идеальной маски целевого класса. Чем больше шума в исходных весах, тем эффективнее работает разреженная замена.
Какие задачи можно решить с помощью разреженного внимания в CLIP?
Разреженное внимание в CLIP открывает новые возможности для задач, требующих точной локализации. Прежде всего, это семантическая сегментация — как стандартная, так и с открытым словарём. Модель может точнее выделять границы объектов, даже если они не были размечены в обучающих данных. Кроме того, метод полезен для мелкозернистого поиска изображений по текстовому описанию: разреженное внимание помогает игнорировать фоновые элементы и фокусироваться на ключевых деталях.
Другие потенциальные применения включают детекцию объектов с открытым словарём, где важно не только найти объект, но и точно определить его положение. В таких задачах разреженное внимание может снизить количество ложных срабатываний и улучшить Intersection over Union (IoU). Наконец, метод может быть полезен в задачах визуального вопрошания (VQA), где модель должна отвечать на вопросы об изображении, и точная локализация релевантных областей критична.
Кому будет полезен этот метод
Разработчики моделей компьютерного зрения получат простой и эффективный способ улучшить плотные предсказания без переобучения. Исследователи в области open-vocabulary предсказаний смогут использовать разреженное внимание для повышения точности своих моделей. Специалисты по семантической сегментации и поиску изображений увидят немедленный прирост качества на своих задачах.
Метод особенно ценен для практических приложений, где важна производительность: автономное вождение, медицинская визуализация, робототехника. В этих областях точная локализация объектов критична, а разреженное внимание помогает снизить количество ошибок.
Что остаётся неизвестным
Хотя результаты впечатляют, остаются вопросы. Как метод влияет на производительность CLIP в других задачах, например, в классификации изображений? Возможно, разреженное внимание может ухудшить результаты на задачах, где контекст важен. Также неясно, насколько метод устойчив к различным архитектурам трансформеров — все эксперименты проводились на конкретной реализации CLIP.
Кроме того, исследование сосредоточено только на визуальной модальности. Как разреженное внимание поведёт себя в мультимодальных задачах, где задействованы текст и изображение? Возможно, для текстовой модальности softmax остаётся предпочтительным. Наконец, не приведены результаты для других датасетов и сценариев, например, для видео или 3D-данных.
Тем не менее, предложенный подход открывает новое направление для улучшения плотных предсказаний. Дальнейшие исследования могут ответить на эти вопросы и расширить применение метода.