OPSD-V: самодистилляция улучшает качество длинных видео в AR-генераторах
Генерация длинных видео с помощью авторегрессионных диффузионных моделей часто страдает от накопления ошибок и потери динамики. Новый метод OPSD-V (On-Policy Self-Distillation for Video) решает эту проблему, используя самодистилляцию для дообучения малошаговых генераторов без изменения архитектуры и

Генерация длинных видео с помощью авторегрессионных диффузионных моделей часто страдает от накопления ошибок и потери динамики. Новый метод OPSD-V (On-Policy Self-Distillation for Video) решает эту проблему, используя самодистилляцию для дообучения малошаговых генераторов без изменения архитектуры или увеличения вычислительных затрат на инференсе. Этот подход позволяет создавать более плавные и реалистичные длинные видео, что открывает новые возможности для приложений в области искусственного интеллекта, медиа и развлечений.
Как OPSD-V решает проблему накопления ошибок
Авторегрессионные генераторы видео создают контент по частям, используя ранее сгенерированные кадры как контекст. Однако при генерации длинных последовательностей ошибки в ранних кадрах накапливаются, ухудшая качество последующих. OPSD-V вводит реальные длинные видео в качестве временного контекста во время обучения, что позволяет модели получать более чистые сигналы для коррекции.
В процессе обучения студент генерирует каждый чанк видео, используя свой собственный KV-кэш, накопленный на предыдущих шагах. Учитель, в свою очередь, оценивает те же состояния денойзинга, но с более чистым кэшем, где старая история заменяется реальным видеоконтекстом. Это создает плотные корректирующие цели на уровне каждого шага денойзинга, не требуя изменения сэмплера, числа шагов или механизма кэша во время инференса.
Почему это важно для генерации длинных видео
Существующие малошаговые AR-генераторы видео, такие как Self-Forcing и LongLive, демонстрируют хорошие результаты на коротких роликах, но при увеличении длины видео качество падает: появляются артефакты, снижается согласованность движения. OPSD-V позволяет улучшить визуальное качество и динамику движения без увеличения времени генерации или сложности модели.
В тестах на моделях Self-Forcing и LongLive метод показал значительное улучшение метрик VBenchLong, которые оценивают долговременную согласованность и реалистичность. В пользовательском исследовании с участием 10 человек, оценивавших 20 пар видео, OPSD-V предпочли в 66% случаев (82.5% без учета ничьих). Это подтверждает, что зрители воспринимают улучшение качества как значимое.
Какие проблемы решает OPSD-V в авторегрессионных моделях?
Основная проблема, которую решает OPSD-V — это ослабление динамики и накопление ошибок при генерации длинных последовательностей. В авторегрессионных моделях каждый новый кадр зависит от предыдущих, и любая неточность может усиливаться. OPSD-V предоставляет модели более точные ориентиры за счет использования реальных видео, что позволяет сохранять плавность и реалистичность движения на протяжении всего ролика.
Кроме того, метод не требует изменения архитектуры модели или увеличения числа шагов денойзинга. Это означает, что разработчики могут применять OPSD-V для дообучения уже существующих моделей, получая улучшение без дополнительных вычислительных затрат на этапе инференса.
Детали реализации OPSD-V
Ключевая идея OPSD-V заключается в использовании реальных длинных видео как временного контекста во время обучения. Студент генерирует каждый чанк, используя свой собственный ранее сгенерированный KV-кэш, а учитель оценивает те же состояния денойзинга, но с более чистым AR-совместимым кэшем, где старая история заменяется реальным видеоконтекстом. Это обеспечивает плотные корректирующие цели на уровне денойзинга без изменения сэмплера, числа шагов или механизма кэша на инференсе.
Метод протестирован на моделях Self-Forcing и LongLive, показав улучшение визуального качества, динамики движения и метрик VBenchLong. В пользовательском исследовании (10 участников, 20 пар видео) OPSD-V предпочли в 66% случаев (82.5% без учета ничьих).
Кого затронет OPSD-V
Разработчиков и исследователей в области генерации видео, особенно тех, кто работает с авторегрессионными диффузионными моделями. Метод может быть применен для улучшения существующих малошаговых генераторов без изменения архитектуры. Это делает OPSD-V привлекательным для интеграции в существующие пайплайны генерации видео, а также для создания новых приложений, требующих длинных и качественных видеороликов.
Что пока неизвестно
Неизвестно, насколько метод масштабируется на более длинные видео (сверх тестированных) и как он поведет себя на других архитектурах AR-генераторов. Также неясно, можно ли применить OPSD-V к другим типам генеративных моделей, не основанным на авторегрессии. Дальнейшие исследования должны прояснить эти вопросы.