Wan2.2 Dancer:分钟级音乐生成舞蹈视频模型(通义实验室)
Wan2.2 Dancer(Wan-Dancer-14B)是通义实验室(阿里巴巴)基于Wan2.2 MoE架构开发的音乐生成舞蹈视频模型。可从音乐和参考图像生成720p/30fps的舞蹈视频。
Wan2.2 Dancer
视频音乐生成舞蹈图生视频开源通义实验室(阿里巴巴集团)开发的分钟级音乐生成舞蹈视频模型。基于Wan2.2 MoE架构,可从参考图像生成720p/30fps、与音乐同步的舞蹈视频,支持中国古典舞、K-Pop、街舞、踢踏舞和拉丁舞五种舞蹈风格。
| 开发者 | 通义实验室(阿里巴巴集团) |
| 发布日期 | 2026-07-13 |
| 架构 | 基于Wan2.2 MoE的分层框架(全局关键帧规划器 + 局部时序细化器) |
| 许可证 | Apache-2.0 |
| 参数 | 14B(全局+局部分支总计) |
| 能力 | 音乐生成舞蹈、图生视频、5种舞蹈风格、分钟级输出 |
| 输出分辨率 | 720p 30fps,最长60秒以上 |
| 测试硬件 | 8 × NVIDIA A800 80GB |
概述
Wan-Dancer-14B 是通义实验室(阿里巴巴集团旗下AI研究机构,负责Qwen、Wan和通义趣等产品)开发的开源模型,能够从音乐和参考图像生成高质量、节奏同步的舞蹈视频。该模型突破了扩散式视频生成的时长限制,可稳定输出720p 30fps、一分钟以上的视频——现有模型通常难以超过20秒。
模型接受参考图像(显示舞者的外观和姿势)和音频文件(音乐轨道),以及描述所需舞蹈风格的文本提示,然后生成与音乐节奏和结构完全匹配的完整舞蹈视频。
架构
Wan-Dancer 采用分层框架,将生成过程解耦为两个阶段:
阶段一:全局关键帧规划
第一阶段生成5秒关键帧片段,捕获整首音乐的结构,确保整个时长内的全局连贯性。它将完整的音乐轨道作为上下文进行长程规划。
阶段二:局部时序细化
第二阶段将每个片段细化为高分辨率720p帧,添加精细细节的同时保持片段间的时序平滑。
关键技术创新
- 时间映射RoPE嵌入:动态帧率自适应,精确对齐运动时序与音乐节拍和结构,实现音视频精准同步。
- 基于光流的损失函数:通过惩罚抖动和相邻帧间的突变增强运动连续性,使舞蹈动作更流畅。
- 运动速度控制:在快速运动和剧烈切换时保留高保真细节,避免长视频生成中常见的运动模糊和伪影。
- 完整音乐轨道上下文:与仅处理短音频窗口的模型不同,全局阶段使用完整音乐轨道实现跨整段舞蹈的连贯长程规划。
该框架基于Wan2.1工作、DiffSynth-Studio和Wan2.2 MoE架构。
舞蹈风格
Wan-Dancer 支持五种舞蹈风格,均实现完全的音乐同步:
| 风格 | 描述 |
|---|---|
| 中国古典舞 | 优雅流畅的动作,融合中国传统美学 |
| K-Pop舞蹈 | 现代、充满活力的编舞,与流行音乐同步 |
| 街舞 | 受嘻哈影响的都市自由风格动作 |
| 踢踏舞 | 与打击乐同步的有节奏的脚部动作 |
| 拉丁舞 | 激情四射、充满动感的搭档舞蹈风格 |
ComfyUI 集成
Wan-Dancer-14B 在 ComfyUI 0.22.0+ 中获得原生支持。请使用官方 Wan-Dancer 工作流 开始使用。确保已将 ComfyUI 更新到最新版本。
必填模型文件
将以下文件放入 ComfyUI/models/ 目录:
+--- diffusion_models/
| +--- wan2.2_dancer_14b_global_fp8_scaled.safetensors
| +--- wan2.2_dancer_14b_local_fp8_scaled.safetensors
+--- loras/
| +--- lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
+--- text_encoders/
| +--- umt5_xxl_fp16.safetensors
+--- clip_vision/
| +--- clip_vision_h.safetensors
+--- vae/
| +--- Wan2_1_VAE_bf16.safetensors模型文件托管在 Comfy-Org/Wan-Dancer 和 Comfy-Org/Wan_2.1_ComfyUI_repackaged 仓库。
资源
| 资源 | 链接 |
|---|---|
| 论文 | arXiv:2607.09581 |
| 项目页面 | humanaigc.github.io/wan-dancer-project/ |
| GitHub 仓库 | github.com/Wan-Video/Wan-Dancer |
| HuggingFace(原始) | Wan-AI/Wan-Dancer-14B |
| HuggingFace(Comfy-Org) | Comfy-Org/Wan-Dancer |
| ComfyUI 工作流 | video_wan_dancer.json |
| ModelScope | modelscope.cn/models/Wan-AI/Wan-Dancer-14B |
| ModelScope 演示 | modelscope.ai/studios/Wan-AI/Wan-Dancer |
Guides and workflows related to this model series.
评论
使用 GitHub 登录后即可参与讨论。