Гибридный метод TMI улучшает сегментацию редких классов на 9.5 AP
Исследователи представили метод TMI (Text-to-Image Meets Image-to-Image), который решает проблему сегментации экземпляров с длиннохвостым распределением категорий и межклассовой неоднозначностью. Подход сочетает генерацию синтетических данных через text-to-image (T2I) и контекстно-осознанное редакти

Исследователи представили метод TMI (Text-to-Image Meets Image-to-Image), который решает проблему сегментации экземпляров с длиннохвостым распределением категорий и межклассовой неоднозначностью. Подход сочетает генерацию синтетических данных через text-to-image (T2I) и контекстно-осознанное редактирование image-to-image (I2I). На бенчмарке LVIS метод показал улучшение общей AP до +4.0 баллов и AP для редких классов до +9.5 баллов, что делает его перспективным для задач с несбалансированными данными.
Почему это важно
Сегментация экземпляров с большим словарём ограничена неравномерным распределением классов и тонкими различиями между ними. Синтез данных — перспективная альтернатива, но существующие методы имеют недостатки: T2I-подходы наследуют шумные псевдо-метки и плохо работают на редких классах, а copy-paste методы нарушают контекстуальную реалистичность. TMI устраняет эти ограничения, повышая качество сегментации особенно для редких категорий.
Как работает TMI
TMI состоит из двух ветвей: T2I-ветвь генерирует разнообразные сцены с широким охватом категорий, а I2I-редактор VRAIN (Verified Rare-class Augmentation via INstructed editing) вставляет высоконадёжные экземпляры в семантически подходящие места реальных сцен. Для обеспечения достоверности меток используется teacher-student схема, которая сохраняет только объекты указанных категорий. Эксперименты на LVIS показали масштабируемость метода с увеличением ёмкости backbone.
Какие проблемы решает TMI в сегментации редких классов?
Основная проблема — дисбаланс классов: редкие категории имеют мало примеров, что приводит к низкой точности. TMI решает это за счёт генерации синтетических данных, которые обогащают обучающую выборку. Кроме того, метод учитывает контекст сцены, избегая неестественных комбинаций, характерных для простых copy-paste подходов.
Кого затронет
Метод полезен исследователям и разработчикам в области компьютерного зрения, работающим над сегментацией изображений, особенно в условиях несбалансированных данных. Потенциально может быть применён в системах автономного вождения, медицинской визуализации и других областях, где редкие классы критичны.
Что пока неизвестно
Неизвестна производительность метода на других датасетах, кроме LVIS, а также его устойчивость к различным типам шума в данных. Требуется дополнительная валидация на реальных приложениях. Однако первые результаты обнадёживают и открывают путь к более эффективной сегментации в условиях длинного хвоста.