Wan-Animate-2: Animación de personajes de extremo a extremo en ComfyUI

ComfyUI Wikinews

Alibaba Tongyi Lab publica Wan-Animate-2, un modelo de animación de personajes que consume vídeos de conducción, con control de perspectiva por texto y soporte nativo en ComfyUI.

Alibaba Tongyi Lab publicó Wan-Animate-2 el 7 de agosto de 2026: un framework de animación de personajes de extremo a extremo que consume un vídeo de conducción directamente dentro de un Diffusion Transformer rediseñado. Los pesos de los modelos Base y Destilación, los scripts de inferencia y un artículo de arXiv están disponibles públicamente bajo la licencia Apache-2.0.

Arquitectura de Wan-Animate-2

Arquitectura DiT de doble rama de Wan-Animate-2: el vídeo de conducción se consume directamente, con Time-Align RoPE y Atención Sparse-Ref fusionando apariencia y movimiento (fuente: página del proyecto)

Vídeos de demostración

Animación de personajes de alta fidelidad para una sola persona

Animación multicarácter: conducción de movimiento de uno a varios y de varios a varios

Animación de personajes en streaming en tiempo real con Wan-Animate-2-Lite

Novedades frente a Wan-Animate

  • Sin extractores de movimiento intermedios. Wan-Animate-2 introduce el vídeo de conducción directamente en un Diffusion Transformer rediseñado, eliminando los pasos de extracción de esqueleto/expresiones que causaban deriva de identidad y errores de movimiento.
  • Control de perspectiva guiado por texto. La perspectiva de cámara de salida se desacopla del vídeo de conducción, lo que permite tomas desde múltiples ángulos de la misma animación con identidad consistente.
  • Animación multicarácter. Admite conducción de movimiento de uno a varios y de varios a varios en una sola pasada.
  • Wan-Animate-2-Lite. Una variante eficiente que alcanza los umbrales de inferencia en tiempo real para la animación de personajes en streaming, orientada a avatares digitales y presentadores de streaming en vivo.

Cómo funciona

Wan-Animate-2 utiliza una arquitectura DiT de doble rama que condiciona la generación a partir de una imagen de referencia y un vídeo de referencia al mismo tiempo:

  • Time-Align RoPE alinea las posiciones temporales entre los tokens de vídeo en denoising y los tokens de referencia.
  • Atención Sparse-Ref atiende selectivamente a las características de referencia informativas en lugar de atender a la secuencia de referencia completa en cada paso.

La variante de destilación ejecuta 10 pasos sin orientación libre de clasificador (scheduler de Euler), mientras que el modelo base sigue el muestreo estándar de 40 pasos.

Soporte de ComfyUI

Wan-Animate-2 tiene soporte nativo en ComfyUI mediante dos nuevos nodos experimentales: WanAnimate2ToVideo (anima un personaje a partir de una imagen de referencia usando un vídeo de pose/conducción, con controles de pose_strength, pose_start_percent, pose_end_percent y reference_image_strength) y WanAnimate2Cache (almacena en caché las activaciones por bloque de la rama de pose, reduciendo aproximadamente a la mitad el tiempo de generación a costa de ~12.5 GB de RAM del sistema en 480x832/81 fotogramas).

Los pesos reempaquetados de Comfy-Org incluyen modelos de diffusion bf16 e int8-convrot, la LoRA de destilación de pasos lightx2v, codificadores de texto, VAE y visión CLIP en carpetas listas para ComfyUI. La plantilla de flujo de trabajo oficial:

Disponibilidad

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Wan-Animate-2: Animación de personajes de extremo a extremo en ComfyUI | ComfyUI Wiki