HSA: иерархический метод для семантической декомпозиции сцены на нескольких уровнях
Исследователи предложили Hierarchical Slot Attention (HSA) — метод, который учится декомпозировать визуальные сцены на нескольких уровнях детализации: глобальный (фон/передний план), семантический (категории объектов) и паноптический (отдельные экземпляры). В отличие от классического slot attention,

Исследователи предложили Hierarchical Slot Attention (HSA) — метод, который учится декомпозировать визуальные сцены на нескольких уровнях детализации: глобальный (фон/передний план), семантический (категории объектов) и паноптический (отдельные экземпляры). В отличие от классического slot attention, который создаёт плоский набор слотов на основе внешнего вида, HSA строит иерархию, соответствующую человеческому восприятию. Этот подход позволяет модели понимать сцену не как набор разрозненных элементов, а как структурированную композицию, где каждый объект имеет своё место и значение. HSA объединяет три уровня анализа в одной архитектуре, что делает его универсальным инструментом для задач компьютерного зрения.
Почему традиционные методы не справляются с семантической декомпозицией
Традиционные методы объектно-центрированного обучения, такие как Slot Attention, создают плоский набор слотов на основе визуальных признаков. Они не могут выделять семантические уровни без супервизии, так как названия категорий — это человеческие конструкты, а не видимые паттерны. Например, модель может разделить изображение на отдельные объекты, но не сможет сказать, что один из них — "человек", а другой — "машина". Для этого требуется дополнительная разметка, что дорого и трудоёмко. HSA решает эту проблему, обучаясь на небольшом количестве размеченных данных (всего 10%) и используя специальную функцию потерь для согласования иерархии. Это позволяет одной модели заменить три отдельные: одну для сегментации фона, вторую для семантической сегментации и третью для паноптической сегментации.
Как HSA учится на ограниченных данных без потери точности?
Ключевая инновация HSA — иерархическая функция потерь (hierarchical alignment loss), которая согласует предсказания между уровнями декомпозиции. Эта функция штрафует модель, если слоты на разных уровнях не соответствуют друг другу. Например, если на семантическом уровне слот представляет "человека", то на паноптическом уровне соответствующие слоты должны представлять отдельных людей. Такое согласование позволяет модели эффективно учиться даже при малом количестве размеченных данных. Эксперименты показывают, что HSA достигает высокого качества сегментации, используя лишь 10% размеченных примеров, что значительно снижает затраты на аннотацию.
Как устроен HSA: три уровня декомпозиции
Метод основан на механизме slot attention с итеративной конкуренцией между слотами. HSA вводит три уровня декомпозиции: holistic (разделение на передний план и фон), semantic (классы объектов, например, человек, машина) и panoptic (индивидуальные экземпляры). На первом уровне модель определяет, какие части изображения относятся к фону, а какие — к объектам. На втором уровне она группирует объекты по семантическим категориям, а на третьем — выделяет каждый отдельный экземпляр. Такая иерархия позволяет модели одновременно решать несколько задач сегментации, используя общие представления. Для обучения используется иерархическая функция потерь, которая согласует предсказания между уровнями. Также предложены метрики grouping purity и containment для оценки того, насколько иерархия закодирована в пространстве представлений. Grouping purity измеряет, насколько чисто слоты на каждом уровне соответствуют истинным группам, а containment — насколько хорошо слоты вышестоящего уровня содержат слоты нижестоящего.
Кому пригодится HSA и где его применять
Исследователей в области объектно-центрированного обучения, компьютерного зрения и робототехники, а также разработчиков систем анализа сцен. Метод может быть полезен для задач, требующих многоуровневого понимания изображений: автономное вождение, анализ медицинских снимков, взаимодействие человека с роботом. Например, в автономном вождении HSA может одновременно выделять дорогу (фон), автомобили (семантический класс) и каждый конкретный автомобиль (экземпляр). В медицине — сегментировать органы на разных уровнях: лёгкие (фон/передний план), типы тканей (семантический) и отдельные опухоли (экземпляры). Такая универсальность делает HSA перспективным инструментом для создания интеллектуальных систем, способных понимать сцены так же глубоко, как человек.
Что пока остаётся загадкой
Код будет опубликован после принятия статьи. Неизвестна производительность на других наборах данных и в условиях сильного шума или частичного перекрытия объектов. Также не исследовано влияние доли размеченных данных менее 10%. Возможно, что при очень малом количестве аннотаций модель не сможет правильно выучить семантические категории. Кроме того, пока неясно, как HSA справляется с сценами, содержащими множество мелких объектов или объектов с высокой внутриклассовой вариативностью. Эти вопросы требуют дальнейших исследований, но уже сейчас HSA демонстрирует впечатляющие результаты на стандартных бенчмарках.