Qwen-Video-Edit: edición de video por instrucciones con nodos ComfyUI
Qwen-Video-Edit reutiliza el DiT de Qwen-Image-Edit para editar latentes de video de Wan 2.1 por instrucciones, con nodos oficiales de ComfyUI y checkpoints 360P/480P/720P.
Qwen-Video-Edit es un modelo de edición de video por instrucciones que reutiliza el DiT de Qwen-Image-Edit para editar directamente los latentes del VAE de video de Wan 2.1, sin necesidad de un transformer preentrenado en video. El lanzamiento inicial llegó el 14 de agosto (código, paper, checkpoint de 360P); el 20 de agosto el proyecto añadió soporte oficial de ComfyUI y nuevos checkpoints de 480P y 720P.
El trabajo viene de Yunpeng Bai (UT Austin), Yossi Gandelsman, Michaël Gharbi (Adobe) y Qixing Huang (UT Austin), con un paper y una página de proyecto llena de demos de antes/después.
Un video largo editado por fragmentos con distintas instrucciones: a la izquierda el original, a la derecha el resultado editado.
Cómo funciona
En lugar de adaptar un transformer de difusión de video, Qwen-Video-Edit enseña a un modelo de edición de imágenes a trabajar con latentes de video:
- Proyecciones warm-started — dos proyecciones entrenables muy pequeñas conectan los latentes de video de 16 canales de Wan 2.1 con el espacio de tokens del DiT, inicializadas desde las capas de entrada/salida del propio DiT para que un video estático se incruste igual que una imagen de Qwen
- Codificación posicional en rejilla — los fotogramas latentes se disponen como teselas de una gran imagen virtual, alineándose con el prior del modelo de imágenes
- Prompt + vista previa en rejilla — una rama Qwen2.5-VL codifica la instrucción junto con una vista previa de los fotogramas fuente
El VAE congelado de Wan 2.1 se encarga de codificar y decodificar, y una etapa opcional de mejora por denoising de Wan 2.2 (de Ditto) limpia los latentes editados.
"Transforma el video en una ilustración de cuento infantil en tonos pastel" — resultado editado de la galería de la página del proyecto.
Nodos de ComfyUI
El repositorio funciona también como un paquete de nodos personalizados de ComfyUI con tres nodos en la categoría QwenVideoEdit, con semántica de fragmento único (una llamada al sampler edita una ventana de num_frames):
| Nodo | Función |
|---|---|
Qwen-Video-Edit Loader | Carga el DiT, el codificador de texto, el VAE y tu checkpoint afinado |
Qwen-Video-Edit Sampler (one chunk) | Edita un fragmento de fotogramas: prompt, num_frames, max_pixels, steps, cfg_scale, seed |
Wan2.2 Enhance (Ditto) | Mejora de denoising obligatoria con wan22_ckpt_dir |
Checkpoints
Todos los checkpoints afinados están en Hugging Face, y los recomendados también están duplicados en ModelScope. Los nombres de carpeta codifican el subconjunto de entrenamiento (Ditto-1M) y el número de fotogramas soportado.
| Checkpoint | Datos de entrenamiento | Fotogramas | Píxeles máx. |
|---|---|---|---|
360P/step-30000 ⭐ | global + local | 45 | 245760 |
480P/global_45/step-6000 | global | 45 | 399360 |
480P/local_45/step-11000 | local | 45 | 399360 |
480P/sim2real_45/step-7000 | sim2real | 45 | 399360 |
480P/global_local_81/step-6500 ⭐ | global + local | 81 | 399360 |
720P/global_local_45/step-3500 | global + local | 45 | 921600 |
"Transforma la escena en una pintura de tinta digital" — resultado editado de la galería de la página del proyecto.
Disponibilidad
Qwen-Video-Edit se distribuye como un paquete de nodos personalizados de ComfyUI: clona yunpeng1998/Qwen-Video-Edit en ComfyUI/custom_nodes/, instala sus dependencias más ComfyUI-VideoHelperSuite, y carga el workflow de ejemplo (comfyui_workflows/qwen_video_edit_chunk.json). La primera ejecución descarga unos 55GB de pesos base (DiT de Qwen-Image-Edit, codificador de texto, VAE de Wan 2.1); la etapa de mejora con Wan 2.2 además necesita Wan-AI/Wan2.2-T2V-A14B. Los ajustes latent_mode / pe_mode / zero_cond_t del checkpoint deben coincidir con el checkpoint cargado. Los checkpoints recomendados tienen un espejo en ModelScope.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.