SAC²-Net: семантическая привязка и комплементарное слияние для распознавания микровыражений
Распознавание микровыражений — одна из самых сложных задач в области компьютерного зрения. Эти кратковременные, непроизвольные движения лица длятся всего доли секунды, но несут огромную информацию о скрытых эмоциях человека. Группа исследователей представила SAC²-Net — новую нейросетевую архитектуру

Распознавание микровыражений — одна из самых сложных задач в области компьютерного зрения. Эти кратковременные, непроизвольные движения лица длятся всего доли секунды, но несут огромную информацию о скрытых эмоциях человека. Группа исследователей представила SAC²-Net — новую нейросетевую архитектуру, которая объединяет две модальности: оптический поток, отслеживающий смещение мышц, и увеличение движения, фиксирующее изменения текстуры кожи. Метод использует семантическую привязку через Action Units (AU) и комплементарно-консенсусное слияние для повышения точности распознавания.
Почему распознавание микровыражений так важно
Микровыражения возникают непроизвольно и длятся от 1/25 до 1/5 секунды. Они часто противоречат сознательно демонстрируемым эмоциям, поэтому их анализ критически важен в психологии, криминалистике, безопасности и медицине. Например, в аэропортах системы распознавания микровыражений могут выявлять подозрительное поведение, а в клинической практике — диагностировать депрессию или посттравматическое расстройство.
Существующие методы анализа микровыражений обычно рассматривают каждую модальность по отдельности или объединяют их без учёта взаимодополняемости. Оптический поток хорошо отражает смещение мышц, но может быть зашумлён при быстрых движениях. Увеличение движения, напротив, чувствительно к изменениям текстуры, но теряет информацию при слабом освещении. SAC²-Net явно моделирует эту двойную комплементарность: когда одна модальность информативна, другая может компенсировать её недостатки.
Как устроена архитектура SAC²-Net
Архитектура SAC²-Net состоит из двух ключевых модулей, которые работают последовательно и совместно.
Semantic Anchoring Soft Alignment (SASA)
Первый модуль — Semantic Anchoring Soft Alignment (SASA) — решает проблему кросс-модальной гетерогенности. Оптический поток и увеличение движения имеют разные физические единицы и распределения, поэтому их прямое сравнение затруднено. SASA преобразует активированные Action Units (AU) в текстовые промпты и использует иерархические мягкие метки для выравнивания представлений движения и оптического потока. Action Units — это стандартизированные единицы движения лица, определённые в системе FACS (Facial Action Coding System). Каждая AU соответствует сокращению определённой мышцы, например, AU4 — сдвиг бровей, AU12 — поднятие уголков губ.
В SASA сначала из видеоряда извлекаются признаки обеих модальностей с помощью свёрточных нейросетей. Затем эти признаки выравниваются в общем семантическом пространстве, где расстояние между образцами с одинаковыми AU минимизируется, а с разными — увеличивается. Для этого используются мягкие метки, которые учитывают не только наличие AU, но и их интенсивность. Такой подход позволяет сохранить семантическую близость анатомически связанных образцов, даже если они получены из разных модальностей.
Complementary-Consensus Fusion (CCF)
Второй модуль — Complementary-Consensus Fusion (CCF) — отвечает за объединение информации из двух модальностей с учётом их пространственно изменчивой надёжности. В разных участках лица одна модальность может быть точнее другой. Например, вокруг глаз оптический поток может быть более информативен, а в области рта — увеличение движения.
CCF работает в два этапа. На первом этапе происходит обмен комплементарными сигналами: слабые или зашумлённые локальные признаки одной модальности усиливаются с помощью достоверных признаков из другой. Для этого вычисляется карта надёжности для каждой модальности, и признаки с низкой надёжностью заменяются или дополняются признаками из другой модальности с высокой надёжностью. На втором этапе применяется консенсусное уточнение: обе модальности согласовываются для выделения общих пространственных паттернов, которые наиболее важны для классификации. Это стимулирует сеть фокусироваться на одних и тех же участках лица, независимо от модальности.
Какие проблемы решает SAC²-Net
Метод решает две ключевые проблемы, характерные для распознавания микровыражений. Первая — кросс-модальная гетерогенность: оптический поток и увеличение движения имеют разные типы данных и распределения, что затрудняет их совместное использование. SASA решает эту проблему путём выравнивания в семантическом пространстве AU. Вторая проблема — пространственно изменчивая надёжность модальностей: в разных участках лица одна модальность может быть точнее другой. CCF адаптивно комбинирует модальности, усиливая надёжные признаки и подавляя ненадёжные.
Для кого предназначена эта технология
Разработка SAC²-Net будет полезна специалистам по компьютерному зрению, которые занимаются анализом лица и поведенческой биометрией. Исследователи в области аффективных вычислений смогут использовать архитектуру для создания более точных систем распознавания эмоций. Кроме того, метод может быть адаптирован для других задач, где требуется мультимодальное слияние с учётом комплементарности, например, в анализе жестов или речевых паттернов.
Какие результаты и ограничения известны
В аннотации не указаны конкретные результаты сравнения с существующими методами и датасеты для тестирования. Однако можно предположить, что SAC²-Net тестировался на стандартных наборах данных, таких как CASME II, SAMM или SMIC. Не раскрыты также вычислительные затраты и время обучения. Для практического применения важно знать, насколько быстро работает модель и какие требования к оборудованию. Возможно, в полной версии статьи эти детали будут представлены.
Что будет дальше
Дальнейшие исследования могут быть направлены на расширение архитектуры для работы с тремя и более модальностями, например, с добавлением аудио или данных ЭМГ. Также возможно применение SAC²-Net к задаче распознавания макровыражений или общему анализу лицевой динамики. Важным направлением является повышение устойчивости к шумам и изменениям освещения, что критично для реальных условий эксплуатации.