Qwen-Video-Edit : édition vidéo par instructions avec nœuds ComfyUI

ComfyUI Wikinews

Qwen-Video-Edit réutilise le DiT de Qwen-Image-Edit pour éditer les latents vidéo de Wan 2.1 par instructions, avec des nœuds ComfyUI officiels et des checkpoints 360P/480P/720P.

Qwen-Video-Edit est un modèle d'édition vidéo par instructions qui réutilise le DiT de Qwen-Image-Edit pour éditer directement les latents du VAE vidéo de Wan 2.1, sans transformer pré-entraîné sur la vidéo. La première version est arrivée le 14 août (code, article, checkpoint 360P) ; le 20 août, le projet a ajouté un support officiel de ComfyUI ainsi que de nouveaux checkpoints 480P et 720P.

Les travaux viennent de Yunpeng Bai (UT Austin), Yossi Gandelsman, Michaël Gharbi (Adobe) et Qixing Huang (UT Austin), avec un article et une page projet pleine de démos avant/après.

Démo d'édition de vidéo longue

Une vidéo longue éditée morceau par morceau avec différentes instructions : la source à gauche, le résultat édité à droite.

Comment ça marche

Au lieu d'adapter un transformer de diffusion vidéo, Qwen-Video-Edit apprend à un modèle d'édition d'images à travailler sur les latents vidéo :

  • Projections warm-started — deux petites projections entraînables relient les latents vidéo 16 canaux de Wan 2.1 à l'espace de tokens du DiT, initialisées depuis les couches d'entrée/sortie du DiT lui-même pour qu'une vidéo statique soit intégrée comme une image Qwen
  • Encodage positionnel en grille — les trames latentes sont disposées comme des tuiles d'une grande image virtuelle, en cohérence avec l'a priori du modèle d'images
  • Prompt + aperçu en grille — une branche Qwen2.5-VL encode l'instruction avec un aperçu des trames sources

Le VAE figé de Wan 2.1 assure l'encodage et le décodage, et une étape optionnelle d'amélioration par débruitage Wan 2.2 (issue de Ditto) nettoie les latents édités.

« Transforme la vidéo en illustration de livre d'enfants aux tons pastel » — résultat édité de la galerie de la page projet.

Nœuds ComfyUI

Le dépôt fait aussi office de pack de nœuds personnalisés ComfyUI avec trois nœuds dans la catégorie QwenVideoEdit, en sémantique de fragment unique (un appel au sampler édite une fenêtre de num_frames) :

NœudRôle
Qwen-Video-Edit LoaderCharge le DiT, l'encodeur de texte, le VAE et votre checkpoint affiné
Qwen-Video-Edit Sampler (one chunk)Édite un fragment de trames : prompt, num_frames, max_pixels, steps, cfg_scale, seed
Wan2.2 Enhance (Ditto)Amélioration par débruitage obligatoire avec wan22_ckpt_dir
Démo du workflow ComfyUI de Qwen-Video-Edit

Checkpoints

Tous les checkpoints affinés sont sur Hugging Face, et les recommandés sont aussi miroités sur ModelScope. Les noms de dossiers encodent le sous-ensemble d'entraînement (Ditto-1M) et le nombre de trames pris en charge.

CheckpointDonnées d'entraînementTramesPixels max.
360P/step-30000global + local45245760
480P/global_45/step-6000global45399360
480P/local_45/step-11000local45399360
480P/sim2real_45/step-7000sim2real45399360
480P/global_local_81/step-6500global + local81399360
720P/global_local_45/step-3500global + local45921600

« Transforme la scène en peinture à l'encre numérique » — résultat édité de la galerie de la page projet.

Disponibilité

Qwen-Video-Edit se distribue comme un pack de nœuds personnalisés ComfyUI : clonez yunpeng1998/Qwen-Video-Edit dans ComfyUI/custom_nodes/, installez ses dépendances plus ComfyUI-VideoHelperSuite, puis chargez le workflow d'exemple (comfyui_workflows/qwen_video_edit_chunk.json). La première exécution télécharge environ 55 Go de poids de base (DiT de Qwen-Image-Edit, encodeur de texte, VAE de Wan 2.1) ; l'étape d'amélioration Wan 2.2 nécessite en plus Wan-AI/Wan2.2-T2V-A14B. Les réglages latent_mode / pe_mode / zero_cond_t du checkpoint doivent correspondre au checkpoint chargé. Les checkpoints recommandés disposent d'un miroir ModelScope.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Qwen-Video-Edit : édition vidéo par instructions avec nœuds ComfyUI | ComfyUI Wiki