SAM-MT: новая модель для сегментации видео с несколькими объектами в реальном времени

Сегментация нескольких объектов в видео в реальном времени — одна из самых сложных задач компьютерного зрения. Новый подход SAM-MT, представленный группой исследователей в препринте на arXiv, обещает решить её, сохраняя высокую скорость даже при увеличении числа целей. В отличие от предыдущих методо

SAM-MT: новая модель для сегментации видео с несколькими объектами в реальном времени

Сегментация нескольких объектов в видео в реальном времени — одна из самых сложных задач компьютерного зрения. Новый подход SAM-MT, представленный группой исследователей в препринте на arXiv, обещает решить её, сохраняя высокую скорость даже при увеличении числа целей. В отличие от предыдущих методов, которые копировали однобъектную обработку для каждого нового объекта, что вело к падению FPS и неограниченной задержке, SAM-MT использует архитектуру Segment Anything 2 (SAM2) и вводит механизмы, позволяющие обрабатывать множество объектов параллельно без потери производительности.

Почему это важно Задача сегментации видео с несколькими объектами (VOS) критична для множества прикладных областей — от автономного вождения и видеонаблюдения до редактирования видео и робототехники. До сих пор существующие подходы не могли обеспечить одновременно высокую точность и производительность при росте числа объектов. SAM-MT впервые демонстрирует, что можно сохранить скорость, сравнимую с однобъектными моделями, независимо от количества целей. Это открывает путь к практическому применению VOS в реальном времени, где каждая миллисекунда на счету.

Как работает SAM-MT Ключевое новшество SAM-MT — использование явных запросов (explicit queries) для представления отдельных объектов, объединённых с общим представлением глобального контекста. Такая архитектура позволяет модели одновременно обрабатывать все объекты, избегая дублирования вычислений. В основе лежит модифицированная версия SAM2, дополненная тремя важными механизмами.

Что такое decoupled masked attention и зачем он нужен? Decoupled masked attention — это механизм раздельного внимания для каждого объекта, который предотвращает перекрёстные помехи между разными целями. В традиционных подходах внимание модели может «путать» объекты, особенно при их частичном перекрытии. SAM-MT решает эту проблему, выделяя каждому объекту собственный канал внимания, что повышает точность сегментации и стабильность предсказаний.

Как работает разреженная память для временной эволюции? Для отслеживания объектов во времени SAM-MT использует разреженную память (sparse memory). В отличие от плотных карт памяти, которые требуют больших вычислительных ресурсов, разреженная память хранит только ключевые признаки для каждого объекта, что обеспечивает стабильную временную эволюцию без перегрузки модели. Это позволяет эффективно обрабатывать длинные видео с большим числом кадров.

Как модель справляется с окклюзиями и перекрытиями? Специализированные механизмы обработки окклюзий и предотвращения перекрытий встроены в архитектуру. Когда один объект временно закрывает другой, модель использует контекстную информацию и историю движения, чтобы предсказать положение скрытого объекта. При обнаружении возможного перекрытия активируются дополнительные проверки, чтобы маски разных объектов не накладывались друг на друга.

Каких результатов удалось достичь? На тестовых данных SAM-MT демонстрирует впечатляющую производительность: более 36 FPS при сегментации 10 объектов одновременно. Это соответствует скорости однобъектных базовых линий, что ранее считалось недостижимым для многобъектных систем. При этом качество сегментации сохраняется на уровне оригинального SAM2, а в некоторых сценариях даже превосходит его за счёт учёта межобъектных взаимодействий.

Кого затронет эта разработка? Новая модель будет полезна разработчикам систем компьютерного зрения, инженерам по видеоаналитике, исследователям в области автономного транспорта и видеоредакторам. Метод может быть интегрирован в коммерческие продукты, требующие реального времени, такие как системы видеонаблюдения с одновременным отслеживанием множества людей или автомобилей, а также в инструменты для автоматического монтажа видео.

Что пока неизвестно? Несмотря на многообещающие результаты, в публикации не указаны точные требования к аппаратному обеспечению (GPU, объём памяти) для достижения заявленной скорости. Также не проведено сравнение с самыми современными многобъектными методами на стандартных бенчмарках, таких как DAVIS и YouTube-VOS. Без этих данных сложно оценить практическую применимость модели в реальных условиях. Кроме того, не описано поведение модели при очень большом числе объектов (например, более 20) или в сценариях с быстрым движением камеры.

Перспективы и дальнейшие шаги SAM-MT открывает новое направление в сегментации видео — объединение высокой точности и производительности для множества объектов. В будущем исследователи планируют оптимизировать модель для работы на мобильных устройствах и встраиваемых системах, а также расширить её возможности на сегментацию с учётом семантических классов. Если текущие ограничения будут преодолены, SAM-MT может стать стандартом для задач VOS в реальном времени.