Ускорение генерации видео в 30 раз: новый метод Dynamic-in-Few-Step
Исследователи разработали метод Dynamic-in-Few-Step, который ускоряет генерацию видео на диффузионных моделях в 30 раз без потери качества. Технология объединяет дистилляцию в несколько шагов с динамическим структурным разрежением, превращая предобученную модель в набор специализированных подшаговых

Исследователи разработали метод Dynamic-in-Few-Step, который ускоряет генерацию видео на диффузионных моделях в 30 раз без потери качества. Технология объединяет дистилляцию в несколько шагов с динамическим структурным разрежением, превращая предобученную модель в набор специализированных подшаговых моделей. На примере Wan-14B удалось сократить вычислительные затраты на 24% на шаг при 4-шаговой дистилляции, получив прирост скорости в 1,2 раза в реальном времени и общее ускорение в 30 раз по сравнению с 50-шаговым учителем.
Как работает Dynamic-in-Few-Step
Современные диффузионные модели видео, такие как Sora или Wan, требуют огромных вычислительных ресурсов, что ограничивает их практическое применение. Предыдущие методы дистилляции ускоряли инференс, но игнорировали разную вычислительную сложность разных шумовых уровней. Новый подход впервые интегрирует динамическую разреженность напрямую в процесс дистилляции, адаптируя архитектуру под каждый шаг денойзинга. Это ортогонально существующим техникам ускорения и может комбинироваться с ними для ещё большего эффекта.
Метод основан на совместной оптимизации шагов денойзинга и структурной разреженности модели. В результате предобученная диффузионная модель преобразуется в компактную смесь моделей (Mixture-of-Models, MoM), где каждый шаг использует свою разреженную подсеть. Для стабильного обучения авторы разработали прогрессивную стратегию тренировки и механизм развёртки выходов (Output Rollout), обеспечивающий согласованное обучение структурных решений между временными шагами. Также создан специализированный инференс-движок для эффективного развёртывания MoM.
Почему это важно для генеративного ИИ
Диффузионные модели видео стали прорывом в создании реалистичного контента, но их высокая ресурсоёмкость делает их недоступными для многих компаний. Например, генерация одного видеоролика может занимать минуты даже на мощных GPU. Dynamic-in-Few-Step снижает вычислительную нагрузку, сохраняя при этом качество, что открывает путь к более широкому внедрению таких моделей в коммерческие продукты.
Разработчики и исследователи в области генеративного ИИ, особенно те, кто работает с большими диффузионными моделями видео, могут интегрировать этот метод в свои пайплайны. Это снижает затраты на инференс, делая технологию доступнее для стартапов и среднего бизнеса. Подход также применим к другим типам диффузионных моделей, таким как генерация изображений или аудио.
Какие результаты показал метод на практике
На модели Wan-14B метод удалил 24% FLOPs на шаг поверх 4-шаговой дистилляции, добавив ускорение в 1,2 раза по настенному времени и достигнув 30-кратного ускорения относительно 50-шагового учителя. При этом качество генерации осталось конкурентоспособным — визуальные метрики не ухудшились по сравнению с полной моделью.
Интересно, что ускорение достигается не только за счёт сокращения шагов, но и благодаря адаптивному разрежению на каждом шаге. Это означает, что модель использует ровно столько вычислительных ресурсов, сколько нужно для текущего уровня шума, не тратя лишние вычисления на простые этапы.
Какие ограничения есть у Dynamic-in-Few-Step
Пока неясно, как метод ведёт себя на моделях меньшего размера или на других архитектурах, например на основе Transformer. Также нет данных о влиянии на качество при более агрессивном разрежении или на других датасетах. Отсутствуют сравнения с альтернативными методами динамического разрежения, такими как AdaPrune или SparseGPT.
Кроме того, метод требует дополнительной настройки и обучения для каждой модели, что может быть трудоёмким. Однако авторы утверждают, что процесс дистилляции занимает всего несколько часов на одном GPU, что делает его практичным.
Как метод может повлиять на будущее генерации видео
Dynamic-in-Few-Step — это шаг к более эффективным диффузионным моделям. Если метод будет масштабироваться на другие архитектуры, мы можем увидеть значительное снижение стоимости генерации видео. Это ускорит внедрение ИИ в кинопроизводство, рекламу и социальные сети.
В перспективе комбинация с другими техниками ускорения, такими как квантование или прунинг, может дать ещё больший выигрыш. Исследователи уже работают над этим, что делает Dynamic-in-Few-Step важным вкладом в область генеративного ИИ.
Что такое динамическая разреженность в контексте диффузионных моделей
Динамическая разреженность означает, что модель адаптирует свою архитектуру для каждого шага денойзинга. В отличие от статического разрежения, где структура фиксирована, здесь подсеть выбирается динамически в зависимости от текущего шумового уровня. Это позволяет более эффективно распределять вычислительные ресурсы.
В случае Dynamic-in-Few-Step разреженность встроена прямо в процесс дистилляции, что обеспечивает оптимальное сочетание скорости и качества. Это новое слово в области, так как предыдущие работы либо использовали разрежение отдельно, либо не учитывали разную сложность шагов.
Кому стоит обратить внимание на эту технологию
Разработчики генеративных моделей, инженеры по оптимизации инференса и исследователи в области сжатия нейросетей. Также технология интересна стартапам, которые хотят внедрить генерацию видео, но ограничены в вычислительных ресурсах.
Даже если вы не работаете напрямую с видео, принципы Dynamic-in-Few-Step могут быть адаптированы для других задач, где используется многошаговая генерация, например в аудио или 3D-моделях.
Какие следующие шаги ожидаются в этой области
Ожидается, что метод будет протестирован на более широком спектре моделей и датасетов. Также вероятно появление гибридных подходов, объединяющих Dynamic-in-Few-Step с другими методами ускорения. В долгосрочной перспективе это может привести к созданию моделей, способных генерировать видео в реальном времени на обычном оборудовании.
Пока же Dynamic-in-Few-Step остаётся одним из самых эффективных способов ускорения диффузионных моделей без потери качества, что делает его важным инструментом для всех, кто работает с генеративным ИИ.