EventVGGT: оценка глубины по событиям через кросс-модальную дистилляцию без аннотаций
Оценка глубины на основе данных событийных камер становится возможной без размеченных данных благодаря новому методу EventVGGT. Исследователи впервые применили дистилляцию пространственно-временных и многовидовых геометрических приоритетов из модели Visual Geometry Grounded Transformer (VGGT) в собы

Оценка глубины на основе данных событийных камер становится возможной без размеченных данных благодаря новому методу EventVGGT. Исследователи впервые применили дистилляцию пространственно-временных и многовидовых геометрических приоритетов из модели Visual Geometry Grounded Transformer (VGGT) в событийный домен. Это позволяет эффективно использовать преимущества событийных камер — высокую чувствительность к быстрым движениям и экстремальному освещению — для задач робототехники и автономного вождения.
Как работает EventVGGT
EventVGGT обрабатывает событийный поток как связную видеопоследовательность, а не как отдельные кадры. В основе метода лежит трехуровневая стратегия дистилляции знаний. Первый уровень — Cross-Modal Feature Mixture (CMFM) — отвечает за слияние признаков RGB и событий, позволяя модели учиться на синергии двух модальностей. Второй уровень — Spatio-Temporal Feature Distillation (STFD) — переносит пространственно-временные представления из VGGT в событийную модель. Третий уровень — Temporal Consistency Distillation (TCD) — обеспечивает согласованность глубины между последовательными кадрами, что критично для динамических сцен.
Почему это важно для компьютерного зрения
Событийные камеры, в отличие от обычных, регистрируют изменения яркости с микросекундной задержкой. Они не страдают от размытия движения и работают в условиях резких перепадов освещения. Однако нехватка размеченных данных для обучения нейросетей долгое время сдерживала их применение. EventVGGT решает эту проблему, используя дистилляцию знаний без необходимости в аннотациях. Эксперименты на датасете EventScape показали снижение средней абсолютной ошибки глубины на 30 метров более чем на 53% — с 2.30 до 1.06. Модель также демонстрирует робастную zero-shot генерализацию на датасетах DENSE и MVSEC, что подтверждает её универсальность.
Какие практические задачи решает EventVGGT?
Метод ориентирован на разработчиков систем компьютерного зрения, работающих с событийными камерами, исследователей в области робототехники и автономного вождения, а также специалистов по 3D-восприятию. Благодаря способности работать без размеченных данных, EventVGGT может быть интегрирован в прототипы и промышленные решения быстрее, чем традиционные подходы. Например, в задачах навигации дронов или оценки глубины в условиях плохой видимости.
Ограничения и нерешённые вопросы
Несмотря на впечатляющие результаты, остаются открытые вопросы. В работе не указано, насколько метод чувствителен к шуму событий, который неизбежен в реальных условиях. Также не раскрыта производительность в реальном времени — критический параметр для робототехники. Будущие исследования могут быть направлены на адаптацию EventVGGT для работы на бортовых вычислителях с ограниченными ресурсами.
EventVGGT открывает новые возможности для оценки глубины без аннотаций, делая событийные камеры более привлекательными для практического применения. Дальнейшее развитие метода может привести к созданию полностью автономных систем восприятия, способных работать в экстремальных условиях.