OpenCoF: как генерация видео меняет подход к рассуждению в AI

OpenCoF — это новый фреймворк, который обучает модели рассуждать через генерацию видео. В отличие от традиционного Chain-of-Thought (CoT), где рассуждение строится на текстовых шагах, OpenCoF использует Chain-of-Frame (CoF): последовательность временно связанных кадров. Это позволяет моделям понимат

OpenCoF: как генерация видео меняет подход к рассуждению в AI

OpenCoF — это новый фреймворк, который обучает модели рассуждать через генерацию видео. В отличие от традиционного Chain-of-Thought (CoT), где рассуждение строится на текстовых шагах, OpenCoF использует Chain-of-Frame (CoF): последовательность временно связанных кадров. Это позволяет моделям понимать логические последствия и временные зависимости, что открывает путь к более интеллектуальным системам. В рамках работы создан датасет OpenCoF-17K на 17 000 видео для 11 типов задач и модель Wan-CoF, дообученная на основе Wan2.2-I2V-A14B.

Как работает Chain-of-Frame Вместо того чтобы генерировать текст, модель создаёт последовательность кадров, каждый из которых отражает шаг рассуждения. Например, для задачи "Что произойдёт, если мяч ударится о стену?" модель генерирует кадры: мяч летит, мяч касается стены, мяч отскакивает. Такой подход позволяет модели визуализировать причинно-следственные связи, что особенно полезно для задач, требующих пространственного и временного понимания. Исследователи внедрили визуальные и текстовые токены рассуждения: первые захватывают низкоуровневые визуальные подсказки, вторые — высокоуровневые семантические приоритеты для пространственного и временного рассуждения. Анализ внимания показал, как эти токены работают по глубине модели, шагам денойзинга, пространству и времени.

Почему это важно для развития AI Современные модели генерации видео обучаются на общих видеокорпусах и не специализируются на рассуждении. OpenCoF предлагает новый способ развития способности к рассуждению у генеративных моделей. Это может привести к созданию систем, которые не просто генерируют контент, но и понимают его логику. Например, такие модели смогут предсказывать последствия действий в робототехнике или помогать в обучении через визуализацию процессов.

Каких результатов достигла модель Wan-CoF Модель Wan-CoF достигает значительного прироста производительности на четырёх бенчмарках видео-рассуждения по сравнению с базовой Wan2.2-I2V-A14B. Улучшения наблюдаются в задачах, требующих понимания временных последовательностей и причинно-следственных связей. Это подтверждает, что обучение через генерацию видео действительно развивает способность к рассуждению.

Какие задачи решает OpenCoF? Датасет OpenCoF-17K включает 11 типов задач, таких как прогнозирование движения объектов, понимание физических взаимодействий и логические цепочки событий. Например, модель может сгенерировать видео, показывающее, что произойдёт, если стакан упадёт со стола: он разобьётся, вода прольётся. Это демонстрирует понимание физики и временных зависимостей.

Кого затронет эта технология Разработчиков моделей генерации видео, исследователей в области рассуждений в AI, а также специалистов по компьютерному зрению и мультимодальным системам. OpenCoF может быть интегрирован в системы, требующие визуального рассуждения, например, в автономные транспортные средства или образовательные платформы.

Что пока неизвестно Неясно, насколько хорошо OpenCoF масштабируется на более сложные задачи и как он сравнивается с альтернативными подходами к рассуждению через генерацию. Также остаётся открытым вопрос о вычислительных затратах: генерация видео требует больше ресурсов, чем текстовые методы. Будущие исследования должны показать, можно ли оптимизировать процесс без потери качества рассуждения.