Гибридные нейросети научились распознавать насилие на видео точнее

Ученые разработали гибридную модель, которая распознает насилие на видео с точностью более 97%. Она объединяет сверточные и рекуррентные нейросети и может применяться в системах видеонаблюдения.

Гибридные нейросети научились распознавать насилие на видео точнее

Распознавание насилия на видео — одна из самых сложных задач компьютерного зрения. Алгоритму нужно отличить драку от дружеского похлопывания по плечу, а агрессивную жестикуляцию — от эмоционального разговора. Исследователи из Университета Ла-Коруньи предложили решение, которое заметно превосходит существующие методы: гибридная архитектура, сочетающая сверточные и рекуррентные нейросети, достигает точности 97,6% на стандартных тестах.

Работа опубликована в журнале Scientific Reports. Авторы использовали открытые наборы данных Hockey Fight, Movies и Surveillance Camera Fight, которые содержат размеченные видео с драками и повседневными сценами. Модель обучалась на кадрах, извлеченных из роликов, и показала стабильно высокие результаты на всех трех датасетах, что говорит о ее универсальности.

Как устроена гибридная модель распознавания насилия

Ключевая идея — объединить два подхода. Сверточные сети (CNN) хорошо извлекают пространственные признаки из отдельных кадров: они видят позы, жесты, объекты. Рекуррентные сети (RNN), в частности LSTM, анализируют последовательность кадров во времени и улавливают динамику — например, резкие движения или ускорение. Вместе они позволяют модели учитывать и то, что происходит в кадре, и как это меняется.

Архитектура состоит из нескольких блоков. Сначала каждый кадр проходит через сверточную сеть, которая выделяет карту признаков. Затем эти карты подаются на вход рекуррентному слою, который обрабатывает их как временной ряд. На выходе — классификатор, который решает, есть ли на видео насилие. Авторы экспериментировали с разными конфигурациями и обнаружили, что добавление механизма внимания (attention) к сверточным блокам улучшает точность, позволяя модели фокусироваться на наиболее значимых частях кадра.

Интересно, что модель обучалась на кадрах, а не на полных видеопотоках. Это упрощает обучение и делает систему быстрее в работе. На тестах гибридная архитектура превзошла как чистые CNN, так и чистые RNN, а также многие современные подходы, включая трехмерные сверточные сети (C3D) и модели на основе трансформеров.

Предыстория и контекст

Задача распознавания насилия активно исследуется с начала 2010-х годов. Первые работы использовали ручные признаки — например, оптический поток или гистограммы градиентов. С появлением глубокого обучения точность выросла, но проблема осталась: модели часто путают насилие с похожими действиями, такими как спорт или игра. Современные системы видеонаблюдения все еще полагаются в основном на операторов, которые следят за сотнями камер, что приводит к ошибкам и задержкам.

Гибридный подход не нов, но авторы применили его с рядом улучшений. Они использовали предобученные сверточные сети (ResNet, DenseNet) в качестве экстракторов признаков, что ускорило обучение и повысило точность. Кроме того, они встроили механизм внимания, который позволяет модели игнорировать нерелевантные объекты — например, прохожих или фон — и сосредоточиться на людях, участвующих в конфликте.

Работа вписывается в более широкий тренд развития интеллектуальных систем безопасности. Подобные алгоритмы уже используются для обнаружения драк в метро, школах и на стадионах, но их точность оставляет желать лучшего. Новая модель может стать шагом к более надежным системам, которые будут не только фиксировать происшествия, но и предупреждать о них в реальном времени.

Чем отличается от предыдущих методов?

Главное отличие — в эффективности. Модель достигает точности 97,6% на наборе Hockey Fight, что на несколько пунктов выше, чем у лучших предыдущих методов (например, 94% у C3D). При этом она работает быстрее и требует меньше вычислительных ресурсов, поскольку анализирует кадры, а не полные видео. Это делает ее пригодной для использования на обычных серверах или даже на периферийных устройствах.

Кроме того, модель устойчива к разным условиям съемки. На датасете Surveillance Camera Fight, который содержит видео с уличных камер с низким разрешением и плохим освещением, точность составила 96,8%. Это важно для реального применения, где качество видео далеко от идеального.

Технические подробности и производительность

Авторы провели серию экспериментов, чтобы найти оптимальную конфигурацию. Они сравнивали разные сверточные основы: ResNet-50, DenseNet-121 и Inception-v3. Лучший результат показала комбинация DenseNet-121 с LSTM и механизмом внимания. Модель обучалась на видеокарте NVIDIA Tesla V100, обучение заняло около 12 часов на каждом наборе данных.

Интересно, что модель хорошо обобщается: обученная на одном датасете, она показывала приличные результаты на других без дообучения. Это говорит о том, что она выучила общие признаки насилия, а не переобучилась под конкретные видео. Авторы также протестировали модель на видео с различными типами насилия — от драк до ограблений — и она стабильно их распознавала.

Сравнение с конкурентами показывает преимущество гибридного подхода. Например, модель на основе трансформеров (TimeSformer) достигла точности 91%, но требовала значительно больше памяти и времени. Трехмерные сверточные сети (I3D) показали 93%, но тоже уступают гибриду. Авторы объясняют это тем, что сверточные сети лучше работают с пространственной информацией, а рекуррентные — с временной, и их сочетание дает синергию.

Кого затронет и как

Разработчики систем видеонаблюдения — главные бенефициары. Они смогут интегрировать модель в свои продукты для автоматического обнаружения драк, нападений и других инцидентов. Это позволит операторам сосредоточиться на самых важных событиях, а не просматривать все камеры подряд. В перспективе такие системы могут использоваться в школах, торговых центрах, на транспорте и в общественных местах.

Правоохранительные органы также заинтересованы в подобных инструментах. Автоматическое распознавание насилия может помочь в расследовании инцидентов, а также в профилактике преступлений. Однако здесь встают вопросы этики и приватности: массовое видеонаблюдение с автоматическим анализом вызывает опасения у правозащитников. Авторы отмечают, что их модель предназначена для помощи операторам, а не для замены человеческого суждения, и подчеркивают важность соблюдения законодательства о защите данных.

Для обычных пользователей изменения будут незаметны, но в долгосрочной перспективе такие технологии могут сделать общественные пространства безопаснее. Например, в метро или на стадионах система сможет мгновенно оповещать охрану о начале драки, что сократит время реакции.

Что будет дальше

Авторы планируют расширить наборы данных и добавить больше типов насилия, включая вербальную агрессию и кибербуллинг. Они также работают над оптимизацией модели для работы в реальном времени на мобильных устройствах и встраиваемых системах. В планах — интеграция с существующими платформами видеонаблюдения, такими как Milestone или Genetec.

Следующим шагом может стать использование трансформеров для обработки временной информации вместо LSTM. Это позволит модели учитывать более длинные контексты и, возможно, повысит точность еще на несколько пунктов. Однако такие модели требуют больше ресурсов, поэтому авторы ищут компромисс между точностью и скоростью.

Итог

Гибридная модель распознавания насилия на видео достигла впечатляющей точности 97,6% и превзошла существующие методы. Она объединяет сильные стороны сверточных и рекуррентных нейросетей, что делает ее надежной и эффективной. Это важный шаг к созданию интеллектуальных систем безопасности, которые смогут автоматически обнаруживать опасные ситуации и помогать людям. Следите за развитием этой технологии — она может изменить подход к видеонаблюдению в ближайшие годы.