MMDiff: как замороженный диффузионный трансформер научили генерировать изображения и сегментацию одновременно

Исследователи представили MMDiff — метод, который позволяет замороженному диффузионному трансформеру одновременно генерировать изображения и дополнительные модальности, такие как семантическая сегментация, карты глубины и выделение значимых объектов. Вместо того чтобы отбрасывать промежуточные призн

MMDiff: как замороженный диффузионный трансформер научили генерировать изображения и сегментацию одновременно

Исследователи представили MMDiff — метод, который позволяет замороженному диффузионному трансформеру одновременно генерировать изображения и дополнительные модальности, такие как семантическая сегментация, карты глубины и выделение значимых объектов. Вместо того чтобы отбрасывать промежуточные признаки, вычисляемые в процессе денойзинга, MMDiff использует их для обучения легких декодеров, предсказывающих эти модальности. Это открывает путь к более эффективным пайплайнам синтеза данных и автоматической разметки.

Как работает MMDiff

Основная идея MMDiff заключается в том, что диффузионные трансформеры (DiT) в процессе генерации изображения вычисляют богатые перцептивные представления, которые обычно игнорируются после получения финального RGB-изображения. Авторы заметили, что эти промежуточные признаки содержат информацию, достаточную для предсказания различных визуальных модальностей. MMDiff извлекает признаки на нескольких шагах денойзинга и объединяет их с помощью пространственно-варьируемых весов агрегации. Это позволяет получить более полное представление, чем при использовании признаков только с одного шага.

Ключевое открытие состоит в том, что перцептивная информация распределена вдоль траектории денойзинга неравномерно. На ранних шагах модель фокусируется на глобальной структуре, а на поздних — на деталях. Мультишаговое слияние с адаптивными весами позволяет эффективно комбинировать эти уровни информации. В результате MMDiff достигает улучшения на 28.7% mIoU для семантической сегментации по сравнению с извлечением признаков из одного шага.

Почему это важно для компьютерного зрения

Современные генеративные модели, такие как Stable Diffusion или DALL-E, создают только RGB-изображения. Для многих задач компьютерного зрения, включая автономное вождение, робототехнику и медицинскую визуализацию, требуются дополнительные модальности: разметка сегментации, карты глубины, карты нормалей. Обычно их получают с помощью отдельных моделей, что увеличивает вычислительные затраты и усложняет пайплайны. MMDiff показывает, что замороженный диффузионный трансформер сам по себе содержит достаточно информации для предсказания этих модальностей без дообучения основной модели. Это может упростить синтез мультимодальных данных, ускорить разметку датасетов и улучшить качество обучающих выборок.

Технические детали и преимущества

MMDiff использует concept-driven attention extraction для интерпретируемого пространственного управления. Это позволяет модели фокусироваться на определенных объектах или регионах при генерации дополнительных модальностей. Авторы показали, что признаки замороженного диффузионного трансформера конкурентоспособны с современными энкодерами, такими как DINOv3, и даже дополняют их. Всё обучение сводится к тренировке легких головок декодеров на замороженном backbone, что делает метод эффективным с точки зрения вычислительных ресурсов.

Какие задачи решает MMDiff

MMDiff может быть полезен для автоматической разметки датасетов, создания мультимодальных симуляторов и улучшения качества предсказаний в задачах сегментации и оценки глубины. Разработчики моделей компьютерного зрения смогут генерировать синтетические данные с полной разметкой без дополнительных затрат. Исследователи генеративного ИИ получат новый инструмент для изучения внутренних представлений диффузионных моделей. Инженеры по синтезу данных смогут ускорить подготовку обучающих выборок для беспилотных автомобилей и роботов.

Какие ограничения у MMDiff?

На данный момент неясно, насколько хорошо метод масштабируется на другие типы диффузионных моделей, например, Stable Diffusion. Также не исследована производительность на видео или 3D-данных. В препринте не указаны точные архитектуры декодеров и вычислительные затраты на инференс. Тем не менее, результаты на изображениях выглядят многообещающими и открывают новые возможности для мультимодальной генерации.

Перспективы развития

MMDiff демонстрирует, что замороженные диффузионные трансформеры могут служить универсальными перцептивными бэкбонами для множества задач. В будущем возможно расширение метода на другие модальности, такие как нормали, оптический поток или даже семантические ключевые точки. Совместная генерация изображения и разметки может улучшить качество обеих задач за счет взаимного обучения. Также интересно исследовать, можно ли использовать MMDiff для интерактивной разметки, где пользователь указывает объекты, а модель дорисовывает сегментацию.

Заключение

MMDiff — это шаг к более эффективному использованию внутренних представлений диффузионных моделей. Метод позволяет одновременно генерировать изображение и несколько дополнительных модальностей без дообучения основной модели. Это упрощает пайплайны синтеза данных и может найти применение в автоматической разметке, симуляторах и мультимодальном обучении. Несмотря на некоторые неясности, подход выглядит перспективным и может стимулировать дальнейшие исследования в области мультимодальной генерации.