Whareformer: нейросеть для трекинга объектов в длинных эгоцентричных видео
Исследователи создали Whareformer — первую нейросеть, способную непрерывно отслеживать объекты в длинных видео от первого лица, даже когда те исчезают из кадра. Эта модель решает задачу OSNOM (Out of Sight, Not out of Mind), которая требует удерживать информацию о положении объектов на протяжении вс

Исследователи создали Whareformer — первую нейросеть, способную непрерывно отслеживать объекты в длинных видео от первого лица, даже когда те исчезают из кадра. Эта модель решает задачу OSNOM (Out of Sight, Not out of Mind), которая требует удерживать информацию о положении объектов на протяжении всего видео, несмотря на окклюзии и выход из поля зрения. Разработка может кардинально улучшить системы дополненной реальности, помощники для слабовидящих и анализ человеческой деятельности.
Как работает Whareformer Whareformer основан на архитектуре transformer и состоит из двух ключевых компонентов: обновляемой памяти треков и модуля назначения. Память хранит эволюционирующие представления каждого отслеживаемого объекта, включая его внешний вид (what) и уточнённое 3D-положение (where). Модуль назначения ассоциирует новые наблюдения с существующими треками в прямом направлении, используя относительные расстояния. Для обнаружения новых объектов применяется специальный токен New Track. Благодаря такому подходу модель обучается всего на 56 видео, но показывает state-of-the-art результаты на 260 длинных тестовых видео из трёх наборов данных: EPIC-KITCHENS-100, IT3DEgo и HD-EPIC.
Какие задачи решает Whareformer? Основная задача — трекинг объектов в эгоцентричных видео, где камера постоянно движется, а объекты часто выходят из кадра или перекрываются. Например, в кухонных сценариях человек может взять предмет, положить его в шкаф, а затем достать другой — Whareformer продолжает отслеживать все объекты, даже когда они не видны. Это критически важно для дополненной реальности, где виртуальные подсказки должны привязываться к реальным объектам, и для помощников слабовидящих, которые должны предупреждать о расположении предметов.
Почему это важно для компьютерного зрения Эгоцентричные видео становятся всё более распространёнными благодаря умным очкам и носимой технике. Однако трекинг объектов, которые временно или постоянно исчезают из поля зрения, остаётся одной из ключевых проблем. Предыдущие методы либо использовали эвристики, либо не справлялись с длительными видео. Whareformer впервые предлагает сквозное нейросетевое решение, которое эффективно использует память и 3D-информацию для непрерывного отслеживания.
Кого затронет эта технология? Разработчики систем анализа видео, исследователи в области компьютерного зрения, компании, создающие носимые устройства с камерами, и специалисты по дополненной реальности — все они выиграют от появления Whareformer. Модель может быть интегрирована в приложения для умных очков, роботов-помощников и систем видеонаблюдения.
Что пока неизвестно Детали реализации и код, по-видимому, не опубликованы; неизвестно, как модель будет работать в реальном времени на ограниченном железе. Также неясна устойчивость к очень сильным окклюзиям или резким движениям камеры. Исследователи планируют представить полную архитектуру на ближайшей конференции.
Как Whareformer сравнивается с другими методами? На тестовых наборах данных Whareformer превзошёл все предыдущие подходы с большим отрывом. Например, на EPIC-KITCHENS-100 улучшение составило более 10% по метрике HOTA (Higher Order Tracking Accuracy). Модель особенно сильна в сценариях с длительными окклюзиями, где другие методы теряют объекты.
Перспективы применения В дополненной реальности Whareformer может обеспечить стабильное наложение виртуальных объектов на реальные, даже когда пользователь отворачивается. Для слабовидящих людей система сможет непрерывно озвучивать расположение ключевых предметов. В анализе деятельности человека модель позволит автоматически распознавать последовательности действий, например, приготовление блюда, отслеживая все используемые ингредиенты и инструменты.
Какие ограничения есть у Whareformer? Модель требует 3D-информации, которая может быть недоступна на простых камерах. Также обучение на 56 видео может не покрыть все возможные сценарии, хотя тестирование на 260 видео показало хорошую обобщаемость. Скорость работы пока не раскрыта, но архитектура transformer может быть тяжёлой для мобильных устройств.
Заключение Whareformer открывает новое направление в трекинге объектов для эгоцентричного видео. Сочетание памяти, 3D-положения и трансформеров позволяет решать задачу OSNOM эффективнее, чем когда-либо. Ожидается, что после публикации кода и деталей реализации технология быстро найдёт применение в коммерческих продуктах.