Гибридный метод TMI улучшает сегментацию редких классов на 9.5 AP

Исследователи представили метод TMI (Text-to-Image Meets Image-to-Image), который решает проблему сегментации экземпляров с длиннохвостым распределением категорий и межклассовой неоднозначностью. Подход сочетает генерацию синтетических данных через text-to-image (T2I) и контекстно-осознанное редакти

Гибридный метод TMI улучшает сегментацию редких классов на 9.5 AP

Исследователи представили метод TMI (Text-to-Image Meets Image-to-Image), который решает проблему сегментации экземпляров с длиннохвостым распределением категорий и межклассовой неоднозначностью. Подход сочетает генерацию синтетических данных через text-to-image (T2I) и контекстно-осознанное редактирование image-to-image (I2I). На бенчмарке LVIS метод показал улучшение общей AP до +4.0 баллов и AP для редких классов до +9.5 баллов, что делает его перспективным для задач с несбалансированными данными.

Почему это важно

Сегментация экземпляров с большим словарём ограничена неравномерным распределением классов и тонкими различиями между ними. Синтез данных — перспективная альтернатива, но существующие методы имеют недостатки: T2I-подходы наследуют шумные псевдо-метки и плохо работают на редких классах, а copy-paste методы нарушают контекстуальную реалистичность. TMI устраняет эти ограничения, повышая качество сегментации особенно для редких категорий.

Как работает TMI

TMI состоит из двух ветвей: T2I-ветвь генерирует разнообразные сцены с широким охватом категорий, а I2I-редактор VRAIN (Verified Rare-class Augmentation via INstructed editing) вставляет высоконадёжные экземпляры в семантически подходящие места реальных сцен. Для обеспечения достоверности меток используется teacher-student схема, которая сохраняет только объекты указанных категорий. Эксперименты на LVIS показали масштабируемость метода с увеличением ёмкости backbone.

Какие проблемы решает TMI в сегментации редких классов?

Основная проблема — дисбаланс классов: редкие категории имеют мало примеров, что приводит к низкой точности. TMI решает это за счёт генерации синтетических данных, которые обогащают обучающую выборку. Кроме того, метод учитывает контекст сцены, избегая неестественных комбинаций, характерных для простых copy-paste подходов.

Кого затронет

Метод полезен исследователям и разработчикам в области компьютерного зрения, работающим над сегментацией изображений, особенно в условиях несбалансированных данных. Потенциально может быть применён в системах автономного вождения, медицинской визуализации и других областях, где редкие классы критичны.

Что пока неизвестно

Неизвестна производительность метода на других датасетах, кроме LVIS, а также его устойчивость к различным типам шума в данных. Требуется дополнительная валидация на реальных приложениях. Однако первые результаты обнадёживают и открывают путь к более эффективной сегментации в условиях длинного хвоста.