Wan-Animate-2:端到端角色动画模型,原生支持 ComfyUI
阿里巴巴通义实验室发布 Wan-Animate-2,这是一款直接消费驱动视频的端到端角色动画模型,支持文本驱动的视角控制与原生 ComfyUI 节点。
阿里巴巴通义实验室于 2026 年 8 月 7 日发布 Wan-Animate-2,这是一个端到端角色动画框架,可在重新设计的 Diffusion Transformer 中直接消费驱动视频。基础模型 和 蒸馏模型 的模型权重、推理脚本 以及 arXiv 论文 均已根据 Apache-2.0 许可证公开。
Wan-Animate-2 双分支 DiT 架构:直接消费驱动视频,通过 Time-Align RoPE 与 Sparse-Ref Attention 融合外观和运动(来源:项目主页)
演示视频
单人高保真角色动画
多角色动画:一对多与多对多动作驱动
使用 Wan-Animate-2-Lite 进行实时流式角色动画
与 Wan-Animate 相比的新特性
- 无需中间动作提取器。 Wan-Animate-2 将驱动视频直接输入重新设计的 Diffusion Transformer,消除了导致身份漂移和动作错误的骨骼/表情提取步骤。
- 文本驱动的视角控制。 输出相机视角与驱动视频解耦,可在保持身份一致性的前提下对同一段动画进行多角度拍摄。
- 多角色动画。 支持一次完成一对多与多对多动作驱动。
- Wan-Animate-2-Lite。 一种高效变体,推理速度达到流式角色动画的实时门槛,面向数字人与直播主播。
工作原理
Wan-Animate-2 使用双分支 DiT 架构,同时以参考图像和参考视频作为生成条件:
- Time-Align RoPE 对齐 denoising 视频 token 与参考 token 之间的时间位置。
- Sparse-Ref Attention 有选择地关注信息丰富的参考特征,而不是每一步都关注完整的参考序列。
蒸馏变体运行 10 步且无分类器引导(Euler scheduler),而基础模型则遵循标准的 40 步采样。
ComfyUI 支持
Wan-Animate-2 已获得 ComfyUI 原生支持,包含两个新的实验性节点:WanAnimate2ToVideo(使用姿态/驱动视频,根据参考图像生成角色动画,支持 pose_strength、pose_start_percent、pose_end_percent 和 reference_image_strength 控制)以及 WanAnimate2Cache(缓存姿态分支各区块的激活值,在 480x832/81 帧设置下,生成时间约缩短一半,但需占用约 12.5 GB 系统内存)。
Comfy-Org 重新打包的权重 以 ComfyUI 可直接使用的文件夹形式提供了 bf16 与 int8-convrot diffusion 模型、lightx2v 步数蒸馏 LoRA、文本编码器、VAE 和 CLIP vision。官方工作流模板:
评论
使用 GitHub 登录后即可参与讨论。