Qwen-Video-Edit: edición de video por instrucciones con nodos ComfyUI

ComfyUI Wikinews

Qwen-Video-Edit reutiliza el DiT de Qwen-Image-Edit para editar latentes de video de Wan 2.1 por instrucciones, con nodos oficiales de ComfyUI y checkpoints 360P/480P/720P.

Qwen-Video-Edit es un modelo de edición de video por instrucciones que reutiliza el DiT de Qwen-Image-Edit para editar directamente los latentes del VAE de video de Wan 2.1, sin necesidad de un transformer preentrenado en video. El lanzamiento inicial llegó el 14 de agosto (código, paper, checkpoint de 360P); el 20 de agosto el proyecto añadió soporte oficial de ComfyUI y nuevos checkpoints de 480P y 720P.

El trabajo viene de Yunpeng Bai (UT Austin), Yossi Gandelsman, Michaël Gharbi (Adobe) y Qixing Huang (UT Austin), con un paper y una página de proyecto llena de demos de antes/después.

Demo de edición de video largo

Un video largo editado por fragmentos con distintas instrucciones: a la izquierda el original, a la derecha el resultado editado.

Cómo funciona

En lugar de adaptar un transformer de difusión de video, Qwen-Video-Edit enseña a un modelo de edición de imágenes a trabajar con latentes de video:

  • Proyecciones warm-started — dos proyecciones entrenables muy pequeñas conectan los latentes de video de 16 canales de Wan 2.1 con el espacio de tokens del DiT, inicializadas desde las capas de entrada/salida del propio DiT para que un video estático se incruste igual que una imagen de Qwen
  • Codificación posicional en rejilla — los fotogramas latentes se disponen como teselas de una gran imagen virtual, alineándose con el prior del modelo de imágenes
  • Prompt + vista previa en rejilla — una rama Qwen2.5-VL codifica la instrucción junto con una vista previa de los fotogramas fuente

El VAE congelado de Wan 2.1 se encarga de codificar y decodificar, y una etapa opcional de mejora por denoising de Wan 2.2 (de Ditto) limpia los latentes editados.

"Transforma el video en una ilustración de cuento infantil en tonos pastel" — resultado editado de la galería de la página del proyecto.

Nodos de ComfyUI

El repositorio funciona también como un paquete de nodos personalizados de ComfyUI con tres nodos en la categoría QwenVideoEdit, con semántica de fragmento único (una llamada al sampler edita una ventana de num_frames):

NodoFunción
Qwen-Video-Edit LoaderCarga el DiT, el codificador de texto, el VAE y tu checkpoint afinado
Qwen-Video-Edit Sampler (one chunk)Edita un fragmento de fotogramas: prompt, num_frames, max_pixels, steps, cfg_scale, seed
Wan2.2 Enhance (Ditto)Mejora de denoising obligatoria con wan22_ckpt_dir
Demo del workflow de ComfyUI de Qwen-Video-Edit

Checkpoints

Todos los checkpoints afinados están en Hugging Face, y los recomendados también están duplicados en ModelScope. Los nombres de carpeta codifican el subconjunto de entrenamiento (Ditto-1M) y el número de fotogramas soportado.

CheckpointDatos de entrenamientoFotogramasPíxeles máx.
360P/step-30000global + local45245760
480P/global_45/step-6000global45399360
480P/local_45/step-11000local45399360
480P/sim2real_45/step-7000sim2real45399360
480P/global_local_81/step-6500global + local81399360
720P/global_local_45/step-3500global + local45921600

"Transforma la escena en una pintura de tinta digital" — resultado editado de la galería de la página del proyecto.

Disponibilidad

Qwen-Video-Edit se distribuye como un paquete de nodos personalizados de ComfyUI: clona yunpeng1998/Qwen-Video-Edit en ComfyUI/custom_nodes/, instala sus dependencias más ComfyUI-VideoHelperSuite, y carga el workflow de ejemplo (comfyui_workflows/qwen_video_edit_chunk.json). La primera ejecución descarga unos 55GB de pesos base (DiT de Qwen-Image-Edit, codificador de texto, VAE de Wan 2.1); la etapa de mejora con Wan 2.2 además necesita Wan-AI/Wan2.2-T2V-A14B. Los ajustes latent_mode / pe_mode / zero_cond_t del checkpoint deben coincidir con el checkpoint cargado. Los checkpoints recomendados tienen un espejo en ModelScope.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Qwen-Video-Edit: edición de video por instrucciones con nodos ComfyUI | ComfyUI Wiki