Wan2.2 Dancer: generación de video de música a baile a escala de minutos por Tongyi Lab

ComfyUI Wiki

Wan2.2 Dancer (Wan-Dancer-14B) es un modelo de generación de video de música a baile desarrollado por Tongyi Lab (Alibaba), construido sobre la arquitectura Wan2.2 MoE. Genera videos de baile a 720p/30fps a partir de música e imágenes de referencia.

W

Wan2.2 Dancer

VideoMúsica a BaileImagen a VideoCódigo Abierto

Modelo de generación de video de música a baile a escala de minutos desarrollado por Tongyi Lab (Alibaba Group). Basado en la arquitectura Wan2.2 MoE, genera videos de baile a 720p/30fps sincronizados con la música a partir de una imagen de referencia, compatible con los géneros de danza clásica china, K-Pop, callejera, claqué y latina.

DesarrolladorTongyi Lab (Alibaba Group)
Fecha de lanzamiento2026-07-13
ArquitecturaMarco jerárquico basado en Wan2.2 MoE (Planificador global de fotogramas clave + Refinador temporal local)
LicenciaApache-2.0
Parámetros14B (total: ramas global y local)
CapacidadesMúsica a baile, Imagen a video, 5 géneros de baile, salida de hasta minutos
Resolución de salida720p a 30fps, hasta más de 60 segundos
Hardware probado8 x NVIDIA A800 80GB

Descripción general

Wan-Dancer-14B es un modelo de código abierto de Tongyi Lab (el instituto de investigación de IA de Alibaba Group detrás de Qwen, Wan y Tongyi Fun) que genera videos de baile de alta calidad y sincronizados rítmicamente a partir de música e imágenes de referencia. El modelo supera la barrera de duración convencional de la generación de video basada en difusión, produciendo video estable a 720p y 30fps durante más de un minuto, una hazaña con la que los modelos existentes suelen tener dificultades más allá de los 20 segundos.

El modelo acepta una imagen de referencia (que muestra la apariencia y pose del bailarín) y un archivo de audio (pista musical), junto con un prompt de texto que describe el estilo de baile deseado. Luego genera un video de baile completo que coincide con el ritmo y la estructura de la música.

Arquitectura

Wan-Dancer emplea un marco jerárquico que desacopla el proceso de generación en dos etapas:

Etapa 1: Planificación global de fotogramas clave

La primera etapa genera segmentos de fotogramas clave de 5 segundos que capturan la estructura musical completa de la pista, asegurando coherencia global a lo largo de toda la duración. Procesa la pista musical completa como contexto para la planificación a largo plazo.

Etapa 2: Refinamiento temporal local

La segunda etapa refina cada segmento en fotogramas de alta resolución a 720p, agregando detalles finos mientras mantiene la suavidad temporal entre segmentos.

Innovaciones técnicas clave

  • Incrustaciones RoPE mapeadas en el tiempo: Adaptación dinámica de la tasa de fotogramas que alinea precisamente el tiempo del movimiento con los ritmos y la estructura musical, permitiendo una sincronización exacta entre audio y video.
  • Función de pérdida basada en flujo óptico: Mejora la continuidad del movimiento penalizando las sacudidas y las transiciones abruptas entre fotogramas adyacentes, lo que resulta en movimientos de baile más suaves.
  • Control de velocidad de movimiento: Preserva los detalles de alta fidelidad durante movimientos rápidos y transiciones bruscas, evitando el desenfoque de movimiento y los artefactos comunes en la generación de video de larga duración.
  • Contexto musical de pista completa: A diferencia de los modelos que procesan ventanas de audio cortas, la etapa global utiliza la pista musical completa para una planificación coherente a largo plazo a lo largo de toda la duración del baile.

El marco se basa en el trabajo de Wan2.1, DiffSynth-Studio y la arquitectura Wan2.2 MoE.

Géneros de baile

Wan-Dancer es compatible con cinco géneros de baile con sincronización musical completa:

GéneroDescripción
Danza clásica chinaMovimientos elegantes y fluidos con estética tradicional china
Danza K-PopCoreografía moderna y enérgica sincronizada con música pop
Danza callejeraMovimientos urbanos y libres con influencia del hip-hop
ClaquéJuego de pies rítmico sincronizado con música percusiva
Danza latinaEstilos de baile apasionados y dinámicos en pareja

Integración con ComfyUI

Wan-Dancer-14B es compatible de forma nativa con ComfyUI 0.22.0+. Comience con el flujo de trabajo oficial de Wan-Dancer. Asegúrate de haber actualizado ComfyUI a la última versión.

Archivos de modelo requeridos

Coloca los siguientes archivos en tu directorio ComfyUI/models/:

+--- diffusion_models/
|    +--- wan2.2_dancer_14b_global_fp8_scaled.safetensors
|    +--- wan2.2_dancer_14b_local_fp8_scaled.safetensors
+--- loras/
|    +--- lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
+--- text_encoders/
|    +--- umt5_xxl_fp16.safetensors
+--- clip_vision/
|    +--- clip_vision_h.safetensors
+--- vae/
|    +--- Wan2_1_VAE_bf16.safetensors

Los archivos de modelo están alojados en los repositorios Comfy-Org/Wan-Dancer y Comfy-Org/Wan_2.1_ComfyUI_repackaged.

Este modelo renderiza 149 fotogramas a la vez, lo que requiere una gran cantidad de VRAM. El flujo de trabajo predeterminado genera 5 segundos de video. Asegúrate de tener una GPU potente (se recomienda 24 GB+ de VRAM) antes de ejecutarlo.

Recursos

RecursoEnlace
ArtículoarXiv:2607.09581
Página del proyectohumanaigc.github.io/wan-dancer-project/
Repositorio de GitHubgithub.com/Wan-Video/Wan-Dancer
HuggingFace (Original)Wan-AI/Wan-Dancer-14B
HuggingFace (Comfy-Org)Comfy-Org/Wan-Dancer
Flujo de trabajo de ComfyUIvideo_wan_dancer.json
ModelScopemodelscope.cn/models/Wan-AI/Wan-Dancer-14B
Demo de ModelScopemodelscope.ai/studios/Wan-AI/Wan-Dancer

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…