Новый AI-метод оценивает качество движений человека в сгенерированных видео на 68% точнее
Исследователи разработали метрику Generative Action Tell-Tales, которая оценивает качество человеческих движений в видео, созданных нейросетями, на 68% точнее существующих методов. Это позволяет выявлять анатомические и временные ошибки, которые часто возникают при генерации видео с помощью моделей

Исследователи разработали метрику Generative Action Tell-Tales, которая оценивает качество человеческих движений в видео, созданных нейросетями, на 68% точнее существующих методов. Это позволяет выявлять анатомические и временные ошибки, которые часто возникают при генерации видео с помощью моделей вроде Sora или Runway. Новая метрика объединяет анализ скелетной геометрии и визуальных признаков, что дает более объективную оценку, близкую к человеческому восприятию.
Что произошло Группа исследователей представила новую метрику для оценки качества человеческих действий в видео, сгенерированных нейросетями. Метод, названный Generative Action Tell-Tales, использует комбинацию признаков скелетной геометрии, которые не зависят от внешности человека, и визуальных признаков из видео. Такой подход позволяет точнее измерить, насколько движения соответствуют реальным действиям. В отличие от традиционных метрик, которые фокусируются на внешнем виде, новая метрика учитывает динамику и анатомическую корректность.
Почему это важно Современные видеогенеративные модели, такие как Sora и Runway, часто создают анатомически некорректные или неестественные движения. Например, руки могут быть согнуты под невозможным углом, или походка выглядит неестественно. Существующие метрики, включая FVD и CLIP, плохо улавливают такие временные и физические ошибки, так как ориентированы на внешний вид, а не на динамику. Новая метрика позволяет объективно оценивать эти артефакты, что критически важно для развития реалистичной генерации видео. Без точной оценки качества разработчики не могут эффективно улучшать свои модели.
Детали Метод основан на обучении латентного пространства реальных человеческих действий. Исследователи объединили признаки скелетной геометрии, такие как положение суставов и углы, с визуальными признаками из видео. Это позволило получить устойчивое представление правдоподобия действия. Для проверки метрики был создан специальный бенчмарк, нацеленный на временные аспекты, включая плавность движений и анатомические ограничения. Результаты показали улучшение более чем на 68% по сравнению с существующими методами, такими как VBench и CLIPScore. Метрика также показала более высокую корреляцию с человеческим восприятием, что подтверждает ее практическую ценность.
Как новая метрика сравнивается с существующими? Существующие метрики, такие как FVD (Fréchet Video Distance) и CLIPScore, в основном оценивают визуальное сходство и семантическую согласованность, но игнорируют временные и физические аспекты движений. Generative Action Tell-Tales специально разработана для обнаружения ошибок в динамике, таких как неестественные ускорения или нарушения анатомических ограничений. В тестах она превзошла VBench на 68% и показала в два раза лучшую корреляцию с оценками людей. Это делает ее незаменимым инструментом для разработчиков, стремящихся к созданию реалистичных видео.
Кого затронет Разработчиков видеогенеративных моделей, исследователей в области компьютерного зрения и AI, а также пользователей, создающих контент с помощью генеративных нейросетей. Для разработчиков новая метрика станет надежным инструментом для оценки и улучшения своих моделей. Исследователи смогут использовать ее для сравнения различных подходов к генерации видео. Пользователи, создающие контент, получат более качественные видео с естественными движениями.
Что пока неизвестно Неясно, насколько метрика устойчива к различным типам контента, например, к нечеловеческим персонажам или абстрактным движениям. Также не раскрыты вычислительные затраты метода и его применимость в реальном времени. Возможно, для работы метрики требуются значительные вычислительные ресурсы, что ограничит ее использование в приложениях реального времени. Будущие исследования должны прояснить эти вопросы.