Wan2.2 Dancer: generación de video de música a baile a escala de minutos por Tongyi Lab
Wan2.2 Dancer (Wan-Dancer-14B) es un modelo de generación de video de música a baile desarrollado por Tongyi Lab (Alibaba), construido sobre la arquitectura Wan2.2 MoE. Genera videos de baile a 720p/30fps a partir de música e imágenes de referencia.
Wan2.2 Dancer
VideoMúsica a BaileImagen a VideoCódigo AbiertoModelo de generación de video de música a baile a escala de minutos desarrollado por Tongyi Lab (Alibaba Group). Basado en la arquitectura Wan2.2 MoE, genera videos de baile a 720p/30fps sincronizados con la música a partir de una imagen de referencia, compatible con los géneros de danza clásica china, K-Pop, callejera, claqué y latina.
| Desarrollador | Tongyi Lab (Alibaba Group) |
| Fecha de lanzamiento | 2026-07-13 |
| Arquitectura | Marco jerárquico basado en Wan2.2 MoE (Planificador global de fotogramas clave + Refinador temporal local) |
| Licencia | Apache-2.0 |
| Parámetros | 14B (total: ramas global y local) |
| Capacidades | Música a baile, Imagen a video, 5 géneros de baile, salida de hasta minutos |
| Resolución de salida | 720p a 30fps, hasta más de 60 segundos |
| Hardware probado | 8 x NVIDIA A800 80GB |
Descripción general
Wan-Dancer-14B es un modelo de código abierto de Tongyi Lab (el instituto de investigación de IA de Alibaba Group detrás de Qwen, Wan y Tongyi Fun) que genera videos de baile de alta calidad y sincronizados rítmicamente a partir de música e imágenes de referencia. El modelo supera la barrera de duración convencional de la generación de video basada en difusión, produciendo video estable a 720p y 30fps durante más de un minuto, una hazaña con la que los modelos existentes suelen tener dificultades más allá de los 20 segundos.
El modelo acepta una imagen de referencia (que muestra la apariencia y pose del bailarín) y un archivo de audio (pista musical), junto con un prompt de texto que describe el estilo de baile deseado. Luego genera un video de baile completo que coincide con el ritmo y la estructura de la música.
Arquitectura
Wan-Dancer emplea un marco jerárquico que desacopla el proceso de generación en dos etapas:
Etapa 1: Planificación global de fotogramas clave
La primera etapa genera segmentos de fotogramas clave de 5 segundos que capturan la estructura musical completa de la pista, asegurando coherencia global a lo largo de toda la duración. Procesa la pista musical completa como contexto para la planificación a largo plazo.
Etapa 2: Refinamiento temporal local
La segunda etapa refina cada segmento en fotogramas de alta resolución a 720p, agregando detalles finos mientras mantiene la suavidad temporal entre segmentos.
Innovaciones técnicas clave
- Incrustaciones RoPE mapeadas en el tiempo: Adaptación dinámica de la tasa de fotogramas que alinea precisamente el tiempo del movimiento con los ritmos y la estructura musical, permitiendo una sincronización exacta entre audio y video.
- Función de pérdida basada en flujo óptico: Mejora la continuidad del movimiento penalizando las sacudidas y las transiciones abruptas entre fotogramas adyacentes, lo que resulta en movimientos de baile más suaves.
- Control de velocidad de movimiento: Preserva los detalles de alta fidelidad durante movimientos rápidos y transiciones bruscas, evitando el desenfoque de movimiento y los artefactos comunes en la generación de video de larga duración.
- Contexto musical de pista completa: A diferencia de los modelos que procesan ventanas de audio cortas, la etapa global utiliza la pista musical completa para una planificación coherente a largo plazo a lo largo de toda la duración del baile.
El marco se basa en el trabajo de Wan2.1, DiffSynth-Studio y la arquitectura Wan2.2 MoE.
Géneros de baile
Wan-Dancer es compatible con cinco géneros de baile con sincronización musical completa:
| Género | Descripción |
|---|---|
| Danza clásica china | Movimientos elegantes y fluidos con estética tradicional china |
| Danza K-Pop | Coreografía moderna y enérgica sincronizada con música pop |
| Danza callejera | Movimientos urbanos y libres con influencia del hip-hop |
| Claqué | Juego de pies rítmico sincronizado con música percusiva |
| Danza latina | Estilos de baile apasionados y dinámicos en pareja |
Integración con ComfyUI
Wan-Dancer-14B es compatible de forma nativa con ComfyUI 0.22.0+. Comience con el flujo de trabajo oficial de Wan-Dancer. Asegúrate de haber actualizado ComfyUI a la última versión.
Archivos de modelo requeridos
Coloca los siguientes archivos en tu directorio ComfyUI/models/:
+--- diffusion_models/
| +--- wan2.2_dancer_14b_global_fp8_scaled.safetensors
| +--- wan2.2_dancer_14b_local_fp8_scaled.safetensors
+--- loras/
| +--- lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
+--- text_encoders/
| +--- umt5_xxl_fp16.safetensors
+--- clip_vision/
| +--- clip_vision_h.safetensors
+--- vae/
| +--- Wan2_1_VAE_bf16.safetensorsLos archivos de modelo están alojados en los repositorios Comfy-Org/Wan-Dancer y Comfy-Org/Wan_2.1_ComfyUI_repackaged.
Recursos
| Recurso | Enlace |
|---|---|
| Artículo | arXiv:2607.09581 |
| Página del proyecto | humanaigc.github.io/wan-dancer-project/ |
| Repositorio de GitHub | github.com/Wan-Video/Wan-Dancer |
| HuggingFace (Original) | Wan-AI/Wan-Dancer-14B |
| HuggingFace (Comfy-Org) | Comfy-Org/Wan-Dancer |
| Flujo de trabajo de ComfyUI | video_wan_dancer.json |
| ModelScope | modelscope.cn/models/Wan-AI/Wan-Dancer-14B |
| Demo de ModelScope | modelscope.ai/studios/Wan-AI/Wan-Dancer |
Guides and workflows related to this model series.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.