HAJJv2-CrowdCount: новый бенчмарк для zero-shot подсчёта толпы в экстремальных условиях

Учёные представили новый бенчмарк HAJJv2-CrowdCount, предназначенный для тестирования zero-shot моделей подсчёта людей в экстремальных условиях массовых скоплений. Этот датасет содержит покадровые аннотации количества людей в тестовых видеозаписях хаджа, где плотность толпы превышает 1000 человек на

HAJJv2-CrowdCount: новый бенчмарк для zero-shot подсчёта толпы в экстремальных условиях

Учёные представили новый бенчмарк HAJJv2-CrowdCount, предназначенный для тестирования zero-shot моделей подсчёта людей в экстремальных условиях массовых скоплений. Этот датасет содержит покадровые аннотации количества людей в тестовых видеозаписях хаджа, где плотность толпы превышает 1000 человек на кадр, а съёмка ведётся под крутыми углами с сильной окклюзией. Исследователи сравнили три подхода: открытый детектор YOLO-World, точечный счётчик APGCC и сегментационный счётчик SAM3Count. Результаты показали, что SAM3Count демонстрирует наименьшую среднюю абсолютную ошибку (MAE 70.4), но на самых плотных кадрах его ошибка превышает 300, тогда как APGCC деградирует более плавно (MAE 114.9). Этот бенчмарк заполняет важный пробел в открытых данных и подчёркивает, что выбор модели зависит от плотности сцены.

Почему автоматический подсчёт толпы критичен для безопасности

Автоматический подсчёт людей во время массовых мероприятий, таких как хадж, концерты или спортивные события, имеет решающее значение для управления безопасностью и предотвращения давки. Однако существующие модели компьютерного зрения часто показывают низкую точность в реальных условиях из-за экстремальной плотности, окклюзии и нестандартных ракурсов камер. Новый бенчмарк HAJJv2-CrowdCount специально создан для оценки zero-shot моделей, которые не требуют дополнительного обучения на конкретных данных, что делает их привлекательными для быстрого развёртывания.

Как устроен датасет HAJJv2-CrowdCount

Датасет основан на видеозаписях хаджа из предыдущего набора HAJJv2, но теперь содержит покадровые аннотации количества людей для каждого кадра тестовых видео. Это позволяет оценивать модели не только на отдельных изображениях, но и на временных рядах, что важно для анализа динамики толпы. Разметка выполнена вручную с высокой точностью, что делает бенчмарк надёжным инструментом для сравнения алгоритмов.

Какие zero-shot модели сравнивались

Исследователи выбрали три различные парадигмы zero-shot подсчёта. Первая — открытый словарь на основе YOLO-World, который обнаруживает людей по текстовому описанию. Вторая — точечный счёт с помощью APGCC, который предсказывает карту плотности без детекции отдельных объектов. Третья — сегментационный счёт SAM3Count, использующий сегментацию для идентификации каждого человека. Каждый подход имеет свои сильные и слабые стороны.

Какая модель показала лучшие результаты в среднем

SAM3Count достиг наилучшей средней абсолютной ошибки (MAE) 70.4 с 95% доверительным интервалом от 56.0 до 86.1. Это означает, что в среднем модель ошибается на 70 человек на кадр. YOLO-World показал MAE 92.0, а APGCC — 152.9. Однако средние показатели не отражают всей картины.

Что происходит на самых плотных кадрах

На кадрах с максимальной плотностью (более 1000 человек) результаты кардинально меняются. SAM3Count и YOLO-World демонстрируют MAE более 300, то есть ошибка превышает 30% от реального числа. В то же время APGCC, который в среднем хуже, на плотных кадрах ошибается всего на 114.9 — его производительность деградирует более плавно. Это объясняется тем, что точечный подход меньше зависит от точной сегментации, которая страдает при сильной окклюзии.

Какую модель выбрать для разных сценариев

Выбор модели зависит от ожидаемой плотности сцены. Для умеренно плотных сцен (до 500 человек) SAM3Count обеспечивает наилучшую точность. Для экстремально плотных сцен, характерных для хаджа, APGCC оказывается более надёжным, хотя и менее точным в среднем. YOLO-World занимает промежуточную позицию, но его преимущество — возможность детекции по текстовому запросу, что может быть полезно для поиска конкретных объектов.

Кого затронут результаты этого исследования

Результаты важны для организаторов массовых мероприятий, которые могут использовать автоматический подсчёт для мониторинга безопасности. Разработчики систем видеонаблюдения получат ориентиры для выбора модели под конкретные условия. Исследователи в области компьютерного зрения смогут использовать HAJJv2-CrowdCount как бенчмарк для своих алгоритмов. Кроме того, работа подчёркивает необходимость создания специализированных датасетов для экстремальных условий.

Что остаётся неизвестным

Пока неясно, как модели поведут себя на других плотных сценах, например, на демонстрациях или в транспортных узлах. Также остаётся открытым вопрос о возможности адаптации точечного подхода для сегментации отдельных людей. Кроме того, тестирование проводилось только на отдельных кадрах, а не на полных видеорядах, что не позволяет оценить временную согласованность предсказаний. Будущие исследования могут расширить бенчмарк на другие сценарии и форматы аннотаций.