Wan2.2 Dancer : génération de vidéos de danse à l'échelle de la minute, de la musique à la danse par Tongyi Lab
Wan2.2 Dancer (Wan-Dancer-14B) est un modèle de génération de vidéos de danse à partir de musique, développé par Tongyi Lab (Alibaba), basé sur l'architecture Wan2.2 MoE. Il génère des vidéos de danse 720p/30fps à partir de musique et d'images de référence.
Wan2.2 Dancer
VidéoMusique-vers-DanseImage-vers-VidéoOpen SourceModèle de génération de vidéos de danse à l'échelle de la minute par Tongyi Lab (Alibaba Group). Basé sur l'architecture Wan2.2 MoE, il génère des vidéos de danse 720p/30fps synchronisées sur la musique à partir d'une image de référence, et prend en charge les genres de danse classique chinoise, K-Pop, street, claquettes et latine.
Présentation
Wan-Dancer-14B est un modèle open source de Tongyi Lab (le laboratoire de recherche en IA d'Alibaba Group, à l'origine de Qwen, Wan et Tongyi Fun) qui génère des vidéos de danse de haute qualité et synchronisées rythmiquement à partir de musique et d'images de référence. Le modèle surmonte la limitation de durée conventionnelle de la génération vidéo basée sur la diffusion, produisant une vidéo stable en 720p à 30fps pendant plus d'une minute — un exploit que les modèles existants peinent généralement à atteindre au-delà de 20 secondes.
Le modèle accepte une image de référence (montrant l'apparence et la pose du danseur) et un fichier audio (piste musicale), ainsi qu'un prompt textuel décrivant le style de danse souhaité. Il génère ensuite une vidéo de danse complète en accord avec le rythme et la structure de la musique.
Architecture
Wan-Dancer utilise un cadre hiérarchique qui dissocie le processus de génération en deux étapes :
Étape 1 : Planification globale des keyframes
La première étape génère des segments de keyframes de 5 secondes qui capturent la structure musicale complète de la piste, assurant une cohérence globale sur toute la durée. Elle traite la piste musicale entière comme contexte pour une planification à longue portée.
Étape 2 : Raffinement temporel local
La deuxième étape affine chaque segment en trames haute résolution 720p, ajoutant des détails fins tout en maintenant la fluidité temporelle entre les segments.
Innovations techniques clés
- Plongements RoPE à mappage temporel : Adaptation dynamique du taux d'images pour aligner précisément le timing des mouvements avec les battements et la structure de la musique, permettant une synchronisation précise entre l'audio et la vidéo.
- Fonction de perte basée sur le flux optique : Améliore la continuité du mouvement en pénalisant les tremblements et les transitions brusques entre les trames adjacentes, résultant en des mouvements de danse plus fluides.
- Contrôle de la vitesse de mouvement : Préserve les détails haute fidélité lors des mouvements rapides et des transitions nettes, évitant le flou de mouvement et les artefacts courants dans la génération vidéo longue durée.
- Contexte musical complet : Contrairement aux modèles qui traitent de courtes fenêtres audio, l'étape globale utilise la piste musicale entière pour une planification cohérente à longue portée sur toute la durée de la danse.
Le cadre s'appuie sur les travaux de Wan2.1, DiffSynth-Studio et l'architecture Wan2.2 MoE.
Genres de danse
Wan-Dancer prend en charge cinq genres de danse avec une synchronisation musicale complète :
| Genre | Description |
|---|---|
| Danse classique chinoise | Mouvements élégants et fluides avec une esthétique traditionnelle chinoise |
| Danse K-Pop | Chorégraphie moderne et énergique synchronisée sur la musique pop |
| Danse street | Mouvements urbains et libres avec influence hip-hop |
| Claquettes | Jeu de pieds rythmique synchronisé sur une musique percussive |
| Danse latine | Styles de danse en couple passionnés et dynamiques |
Intégration ComfyUI
Wan-Dancer-14B est nativement pris en charge dans ComfyUI 0.22.0+. Commencez avec le workflow officiel Wan-Dancer. Assurez-vous d'avoir mis à jour ComfyUI vers la dernière version.
Fichiers de modèle requis
Placez les fichiers suivants dans votre répertoire ComfyUI/models/ :
+--- diffusion_models/
| +--- wan2.2_dancer_14b_global_fp8_scaled.safetensors
| +--- wan2.2_dancer_14b_local_fp8_scaled.safetensors
+--- loras/
| +--- lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
+--- text_encoders/
| +--- umt5_xxl_fp16.safetensors
+--- clip_vision/
| +--- clip_vision_h.safetensors
+--- vae/
| +--- Wan2_1_VAE_bf16.safetensorsLes fichiers de modèle sont hébergés sur les dépôts Comfy-Org/Wan-Dancer et Comfy-Org/Wan_2.1_ComfyUI_repackaged.
Ressources
| Ressource | Lien |
|---|---|
| Article | arXiv:2607.09581 |
| Page du projet | humanaigc.github.io/wan-dancer-project/ |
| Dépôt GitHub | github.com/Wan-Video/Wan-Dancer |
| HuggingFace (Original) | Wan-AI/Wan-Dancer-14B |
| HuggingFace (Comfy-Org) | Comfy-Org/Wan-Dancer |
| Workflow ComfyUI | video_wan_dancer.json |
| ModelScope | modelscope.cn/models/Wan-AI/Wan-Dancer-14B |
| Démo ModelScope | modelscope.ai/studios/Wan-AI/Wan-Dancer |
Guides and workflows related to this model series.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.