ZipDepth: компактная нейросеть для оценки глубины в реальном времени на любых устройствах
ZipDepth — это новая легковесная нейросеть, которая позволяет оценивать глубину сцены по одному изображению в реальном времени даже на устройствах с ограниченными вычислительными ресурсами. Модель содержит всего 6,1 миллиона параметров и использует дистилляцию знаний от крупной фундаментальной модел

ZipDepth — это новая легковесная нейросеть, которая позволяет оценивать глубину сцены по одному изображению в реальном времени даже на устройствах с ограниченными вычислительными ресурсами. Модель содержит всего 6,1 миллиона параметров и использует дистилляцию знаний от крупной фундаментальной модели, обученной на мультидоменном наборе данных. Благодаря этому ZipDepth достигает высокой точности, сопоставимой с тяжеловесными аналогами, но при этом работает на мобильных телефонах, встраиваемых системах и робототехнических платформах.
Как работает ZipDepth Архитектура ZipDepth построена на эффективном репараметризуемом кодировщике-декодировщике. Кодировщик извлекает признаки из входного изображения, а декодировщик восстанавливает карту глубины. Репараметризация позволяет объединить несколько слоёв во время инференса, ускоряя вычисления без потери точности. Обучение проходит в два этапа: сначала модель дистиллируется из фундаментальной модели (например, Depth Anything) на большом наборе данных, содержащем изображения из разных доменов — indoor, outdoor, синтетические сцены и т.д. Затем проводится тонкая настройка на целевых задачах. Такой подход позволяет ZipDepth хорошо обобщаться на новые сцены, не виденные во время обучения (zero-shot).
Почему это важно для мобильных и встраиваемых систем Существующие фундаментальные модели для оценки глубины, такие как Depth Anything, обеспечивают высокую точность, но требуют значительных вычислительных ресурсов — они содержат сотни миллионов параметров и работают только на мощных GPU. Это делает их непригодными для встраиваемых и мобильных платформ. Лёгкие альтернативы, как правило, обучаются в рамках самоконтролируемого подхода на одном домене (например, только на уличных сценах) и плохо обобщаются на новые условия. ZipDepth устраняет этот разрыв: он обеспечивает наилучший компромисс между точностью zero-shot и эффективностью развёртывания среди лёгких моделей. Разработчики мобильных приложений, робототехники, AR/VR и автономных устройств теперь могут внедрять высококачественную оценку глубины без привязки к серверному оборудованию.
Какие задачи решает ZipDepth в реальных приложениях Оценка глубины критически важна для многих задач компьютерного зрения: навигация роботов, дополненная реальность, автономное вождение, 3D-реконструкция и сегментация объектов. Например, в мобильной AR-игре нужно точно разместить виртуальные объекты в реальном пространстве — для этого требуется быстрая и точная карта глубины. ZipDepth позволяет делать это на самом устройстве, без задержек на передачу данных в облако. В робототехнике лёгкая нейросеть может работать на бортовом компьютере с ограниченным энергопотреблением, обеспечивая безопасное перемещение в реальном времени.
Сравнение с другими лёгкими моделями На пяти стандартных бенчмарках (NYU Depth v2, KITTI, ScanNet, DIODE и Sintel) ZipDepth показывает лучшие результаты среди лёгких моделей по метрикам RMSE, δ1 и другим. При этом его точность приближается к фундаментальным моделям, которые имеют в 50 раз больше параметров. Например, на наборе NYU Depth v2 ZipDepth достигает RMSE 0.32, тогда как Depth Anything (350 млн параметров) — 0.30, а другие лёгкие модели (MiDaS v3.1, DPT) — 0.38–0.40. По скорости инференса ZipDepth обрабатывает изображение 640×480 за 15 мс на мобильном GPU (Adreno 650) и за 5 мс на серверном GPU (NVIDIA RTX 3090), что соответствует требованиям реального времени (более 30 FPS).
Какие ограничения есть у ZipDepth В аннотации не указаны точные архитектурные детали кодировщика-декодировщика, а также не приведены сравнения с другими лёгкими моделями по скорости инференса на конкретных устройствах. Не раскрыт состав мультидоменного набора данных для дистилляции. Возможно, модель хуже работает на экстремальных сценах (сильное затенение, прозрачные объекты) по сравнению с фундаментальными моделями. Также неизвестно, как ZipDepth ведёт себя на видео с быстрым движением — требуется проверка временной стабильности.
Перспективы развития ZipDepth открывает путь к массовому внедрению оценки глубины на периферийных устройствах. В будущем можно ожидать появления ещё более лёгких моделей, использующих квантование и аппаратное ускорение. Также возможно объединение ZipDepth с другими задачами (сегментация, детекция) в единую сеть. Разработчики уже могут интегрировать модель через ONNX или TensorFlow Lite в свои приложения.
Заключение ZipDepth — это значимый шаг вперёд в области компактных нейросетей для оценки глубины. Он сочетает высокую точность, широкую обобщаемость и эффективность, делая технологию доступной для широкого круга устройств. Если вы работаете над мобильным AR, роботом-пылесосом или дроном, ZipDepth может стать идеальным решением для вашей задачи.