Wan2.2 Dancer : génération de vidéos de danse à l'échelle de la minute, de la musique à la danse par Tongyi Lab

ComfyUI Wiki

Wan2.2 Dancer (Wan-Dancer-14B) est un modèle de génération de vidéos de danse à partir de musique, développé par Tongyi Lab (Alibaba), basé sur l'architecture Wan2.2 MoE. Il génère des vidéos de danse 720p/30fps à partir de musique et d'images de référence.

W

Wan2.2 Dancer

VidéoMusique-vers-DanseImage-vers-VidéoOpen Source

Modèle de génération de vidéos de danse à l'échelle de la minute par Tongyi Lab (Alibaba Group). Basé sur l'architecture Wan2.2 MoE, il génère des vidéos de danse 720p/30fps synchronisées sur la musique à partir d'une image de référence, et prend en charge les genres de danse classique chinoise, K-Pop, street, claquettes et latine.

Présentation

Wan-Dancer-14B est un modèle open source de Tongyi Lab (le laboratoire de recherche en IA d'Alibaba Group, à l'origine de Qwen, Wan et Tongyi Fun) qui génère des vidéos de danse de haute qualité et synchronisées rythmiquement à partir de musique et d'images de référence. Le modèle surmonte la limitation de durée conventionnelle de la génération vidéo basée sur la diffusion, produisant une vidéo stable en 720p à 30fps pendant plus d'une minute — un exploit que les modèles existants peinent généralement à atteindre au-delà de 20 secondes.

Le modèle accepte une image de référence (montrant l'apparence et la pose du danseur) et un fichier audio (piste musicale), ainsi qu'un prompt textuel décrivant le style de danse souhaité. Il génère ensuite une vidéo de danse complète en accord avec le rythme et la structure de la musique.

Architecture

Wan-Dancer utilise un cadre hiérarchique qui dissocie le processus de génération en deux étapes :

Étape 1 : Planification globale des keyframes

La première étape génère des segments de keyframes de 5 secondes qui capturent la structure musicale complète de la piste, assurant une cohérence globale sur toute la durée. Elle traite la piste musicale entière comme contexte pour une planification à longue portée.

Étape 2 : Raffinement temporel local

La deuxième étape affine chaque segment en trames haute résolution 720p, ajoutant des détails fins tout en maintenant la fluidité temporelle entre les segments.

Innovations techniques clés

  • Plongements RoPE à mappage temporel : Adaptation dynamique du taux d'images pour aligner précisément le timing des mouvements avec les battements et la structure de la musique, permettant une synchronisation précise entre l'audio et la vidéo.
  • Fonction de perte basée sur le flux optique : Améliore la continuité du mouvement en pénalisant les tremblements et les transitions brusques entre les trames adjacentes, résultant en des mouvements de danse plus fluides.
  • Contrôle de la vitesse de mouvement : Préserve les détails haute fidélité lors des mouvements rapides et des transitions nettes, évitant le flou de mouvement et les artefacts courants dans la génération vidéo longue durée.
  • Contexte musical complet : Contrairement aux modèles qui traitent de courtes fenêtres audio, l'étape globale utilise la piste musicale entière pour une planification cohérente à longue portée sur toute la durée de la danse.

Le cadre s'appuie sur les travaux de Wan2.1, DiffSynth-Studio et l'architecture Wan2.2 MoE.

Genres de danse

Wan-Dancer prend en charge cinq genres de danse avec une synchronisation musicale complète :

GenreDescription
Danse classique chinoiseMouvements élégants et fluides avec une esthétique traditionnelle chinoise
Danse K-PopChorégraphie moderne et énergique synchronisée sur la musique pop
Danse streetMouvements urbains et libres avec influence hip-hop
ClaquettesJeu de pieds rythmique synchronisé sur une musique percussive
Danse latineStyles de danse en couple passionnés et dynamiques

Intégration ComfyUI

Wan-Dancer-14B est nativement pris en charge dans ComfyUI 0.22.0+. Commencez avec le workflow officiel Wan-Dancer. Assurez-vous d'avoir mis à jour ComfyUI vers la dernière version.

Fichiers de modèle requis

Placez les fichiers suivants dans votre répertoire ComfyUI/models/ :

+--- diffusion_models/
|    +--- wan2.2_dancer_14b_global_fp8_scaled.safetensors
|    +--- wan2.2_dancer_14b_local_fp8_scaled.safetensors
+--- loras/
|    +--- lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
+--- text_encoders/
|    +--- umt5_xxl_fp16.safetensors
+--- clip_vision/
|    +--- clip_vision_h.safetensors
+--- vae/
|    +--- Wan2_1_VAE_bf16.safetensors

Les fichiers de modèle sont hébergés sur les dépôts Comfy-Org/Wan-Dancer et Comfy-Org/Wan_2.1_ComfyUI_repackaged.

Ce modèle génère 149 trames à la fois, ce qui nécessite une grande quantité de VRAM. Le workflow par défaut produit 5 secondes de vidéo. Assurez-vous de disposer d'un GPU puissant (24 Go+ VRAM recommandé) avant de lancer l'exécution.

Ressources

Guides and workflows related to this model series.

No articles found.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…