Qwen-Video-Edit : édition vidéo par instructions avec nœuds ComfyUI
Qwen-Video-Edit réutilise le DiT de Qwen-Image-Edit pour éditer les latents vidéo de Wan 2.1 par instructions, avec des nœuds ComfyUI officiels et des checkpoints 360P/480P/720P.
Qwen-Video-Edit est un modèle d'édition vidéo par instructions qui réutilise le DiT de Qwen-Image-Edit pour éditer directement les latents du VAE vidéo de Wan 2.1, sans transformer pré-entraîné sur la vidéo. La première version est arrivée le 14 août (code, article, checkpoint 360P) ; le 20 août, le projet a ajouté un support officiel de ComfyUI ainsi que de nouveaux checkpoints 480P et 720P.
Les travaux viennent de Yunpeng Bai (UT Austin), Yossi Gandelsman, Michaël Gharbi (Adobe) et Qixing Huang (UT Austin), avec un article et une page projet pleine de démos avant/après.
Une vidéo longue éditée morceau par morceau avec différentes instructions : la source à gauche, le résultat édité à droite.
Comment ça marche
Au lieu d'adapter un transformer de diffusion vidéo, Qwen-Video-Edit apprend à un modèle d'édition d'images à travailler sur les latents vidéo :
- Projections warm-started — deux petites projections entraînables relient les latents vidéo 16 canaux de Wan 2.1 à l'espace de tokens du DiT, initialisées depuis les couches d'entrée/sortie du DiT lui-même pour qu'une vidéo statique soit intégrée comme une image Qwen
- Encodage positionnel en grille — les trames latentes sont disposées comme des tuiles d'une grande image virtuelle, en cohérence avec l'a priori du modèle d'images
- Prompt + aperçu en grille — une branche Qwen2.5-VL encode l'instruction avec un aperçu des trames sources
Le VAE figé de Wan 2.1 assure l'encodage et le décodage, et une étape optionnelle d'amélioration par débruitage Wan 2.2 (issue de Ditto) nettoie les latents édités.
« Transforme la vidéo en illustration de livre d'enfants aux tons pastel » — résultat édité de la galerie de la page projet.
Nœuds ComfyUI
Le dépôt fait aussi office de pack de nœuds personnalisés ComfyUI avec trois nœuds dans la catégorie QwenVideoEdit, en sémantique de fragment unique (un appel au sampler édite une fenêtre de num_frames) :
| Nœud | Rôle |
|---|---|
Qwen-Video-Edit Loader | Charge le DiT, l'encodeur de texte, le VAE et votre checkpoint affiné |
Qwen-Video-Edit Sampler (one chunk) | Édite un fragment de trames : prompt, num_frames, max_pixels, steps, cfg_scale, seed |
Wan2.2 Enhance (Ditto) | Amélioration par débruitage obligatoire avec wan22_ckpt_dir |
Checkpoints
Tous les checkpoints affinés sont sur Hugging Face, et les recommandés sont aussi miroités sur ModelScope. Les noms de dossiers encodent le sous-ensemble d'entraînement (Ditto-1M) et le nombre de trames pris en charge.
| Checkpoint | Données d'entraînement | Trames | Pixels max. |
|---|---|---|---|
360P/step-30000 ⭐ | global + local | 45 | 245760 |
480P/global_45/step-6000 | global | 45 | 399360 |
480P/local_45/step-11000 | local | 45 | 399360 |
480P/sim2real_45/step-7000 | sim2real | 45 | 399360 |
480P/global_local_81/step-6500 ⭐ | global + local | 81 | 399360 |
720P/global_local_45/step-3500 | global + local | 45 | 921600 |
« Transforme la scène en peinture à l'encre numérique » — résultat édité de la galerie de la page projet.
Disponibilité
Qwen-Video-Edit se distribue comme un pack de nœuds personnalisés ComfyUI : clonez yunpeng1998/Qwen-Video-Edit dans ComfyUI/custom_nodes/, installez ses dépendances plus ComfyUI-VideoHelperSuite, puis chargez le workflow d'exemple (comfyui_workflows/qwen_video_edit_chunk.json). La première exécution télécharge environ 55 Go de poids de base (DiT de Qwen-Image-Edit, encodeur de texte, VAE de Wan 2.1) ; l'étape d'amélioration Wan 2.2 nécessite en plus Wan-AI/Wan2.2-T2V-A14B. Les réglages latent_mode / pe_mode / zero_cond_t du checkpoint doivent correspondre au checkpoint chargé. Les checkpoints recommandés disposent d'un miroir ModelScope.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.