Wan-Animate-2 : animation de personnages de bout en bout dans ComfyUI
Alibaba Tongyi Lab publie Wan-Animate-2, un modèle d'animation de personnages qui consomme les vidéos de pilotage, avec contrôle du point de vue par texte et support ComfyUI.
Alibaba Tongyi Lab a publié Wan-Animate-2 le 7 août 2026 : un framework d'animation de personnages de bout en bout qui consomme directement une vidéo de pilotage dans un Diffusion Transformer redessiné. Les poids du Modèle de base et du Modèle de distillation, les scripts d'inférence et un article arXiv sont tous publics sous licence Apache-2.0.
Architecture DiT à deux branches de Wan-Animate-2 : la vidéo de pilotage est consommée directement, avec Time-Align RoPE et Sparse-Ref Attention qui fusionnent l'apparence et le mouvement (source : page du projet)
Vidéos de démonstration
Animation d'un seul personnage en haute fidélité
Animation multi-personnages : pilotage du mouvement d'un personnage vers plusieurs et de plusieurs vers plusieurs
Animation de personnages en streaming en temps réel avec Wan-Animate-2-Lite
Nouveautés par rapport à Wan-Animate
- Aucun extracteur de mouvement intermédiaire. Wan-Animate-2 alimente directement un Diffusion Transformer redessiné avec la vidéo de pilotage, éliminant les étapes d'extraction du squelette et des expressions qui causaient une dérive d'identité et des erreurs de mouvement.
- Contrôle du point de vue par texte. La perspective de caméra en sortie est découplée de la vidéo de pilotage, ce qui permet des prises de vue sous plusieurs angles de la même animation avec une identité cohérente.
- Animation multi-personnages. Prend en charge le pilotage du mouvement d'un personnage vers plusieurs et de plusieurs vers plusieurs en une seule passe.
- Wan-Animate-2-Lite. Une variante efficace qui atteint les seuils d'inférence en temps réel pour l'animation de personnages en streaming, destinée aux avatars numériques et aux streamers.
Comment ça marche
Wan-Animate-2 utilise une architecture DiT à deux branches qui conditionne la génération sur une image de référence et une vidéo de référence en même temps :
- Time-Align RoPE aligne les positions temporelles entre les jetons vidéo de débruitage et les jetons de référence.
- Sparse-Ref Attention prête sélectivement attention aux caractéristiques de référence informatives, plutôt que d'analyser l'intégralité de la séquence de référence à chaque étape.
La variante de distillation effectue 10 étapes sans guidance par classificateur (Euler scheduler), tandis que le Modèle de base suit l'échantillonnage standard en 40 étapes.
Prise en charge de ComfyUI
Wan-Animate-2 est pris en charge nativement dans ComfyUI avec deux nouveaux nœuds expérimentaux : WanAnimate2ToVideo (anime un personnage à partir d'une image de référence en utilisant une vidéo de pose/pilotage, avec les contrôles pose_strength, pose_start_percent, pose_end_percent et reference_image_strength) et WanAnimate2Cache (met en cache les activations par bloc de la branche de pose, réduisant environ de moitié le temps de génération au prix d'environ 12,5 Go de RAM système à 480x832/81 frames).
Les poids réempaquetés par Comfy-Org fournissent des modèles de diffusion bf16 et int8-convrot, la LoRA lightx2v de distillation d'étapes, les encodeurs de texte, le VAE et la vision CLIP dans des dossiers prêts pour ComfyUI. Le modèle de flux de travail officiel :
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.