DreamX-Creator 1.0 发布:开源 7B 联合音视频生成模型,支持 2K 分辨率
高德(AMap)开源 DreamX-Creator 1.0,一款基于 Wan2.2 构建的 7B 联合音视频生成器,具备门控跨模态注意力与 1 步 2K 精炼器,权重可以完整下载。
DreamX-Creator 1.0 的预览图:展示 2K 分辨率下的联合音视频生成效果。
同时生成视频与音频的 7B 生成器
给定首帧图像和文本提示词后,基础生成器会联合建模模态专属的视频流与音频流。双向交互由两种机制驱动:
- 门控跨模态注意力(Gated Cross-Modal Attention):跨注意力权重(
cross_attn_weights.safetensors,2.56 GB)让每种模态都能关注到另一种模态,并通过可学习的门控控制跨模态信息的流动量。 - 渐进式联合训练(Progressive Joint Training):两条流被放在一起训练,让口型动作、画面中的动作与音轨保持同步,而不是在生成结束之后再把两者拼接起来。
在基础生成器之上,**音视频强化学习(Audio-Video Reinforcement Learning)**阶段利用模态感知的多模态反馈,改善视觉质量、音频质量、语义一致性以及细粒度的音视频对齐。
1 步精炼至 2K
系统的另一半是自回归 1 步 2K 精炼器(SR-DiT,5B 参数)。它能在保留内容、运动以及与音频对齐的时序的同时,将已经生成的视频超分到 2K。该精炼器同样支持外部视频,因此你可以喂入任意片段,音频则会原样通过、不做任何改动。
精炼器自带多种速度调节选项:KV 缓存、窗口注意力与 Latent 上采样器变体(默认为 FlashLatentUpsampler,还提供了可选的蒸馏版 LightVAE 快速解码器),可以在质量与延迟之间取舍。
可下载内容
全部权重均已发布在 Hugging Face 与 ModelScope 上,总计约 54 GB:
| 组件 | 内容 |
|---|---|
creator/ | 7B 联合生成器:视频 DiT 分片(约 20 GB)、音频 DiT(5.7 GB)、跨注意力权重(2.6 GB) |
audio_vae/ | CreatorDACVAE 音频 VAE(0.74 GB) |
refiner/ | SR-DiT 5B(10 GB)、FlashLatentUpsampler、可选的因果 2D 上采样器与 LightVAE 解码器 |
wan2.2_ti2v_5b/ | 共享的 Wan2.2-TI2V-5B 依赖项:视频 VAE、UMT5-xxl 文本编码器与 tokenizer |
Wan2.2 目录可以直接复用 Wan-AI/Wan2.2-TI2V-5B 中现有的文件,所以如果你已经在使用 Wan2.2,只需额外下载三个 DreamX 专属文件夹。
推理只需纯 Python 环境:两个阶段各有自己的 requirements.txt 和一条命令即可运行的脚本,CPU 卸载与多 GPU 序列并行选项在各子 README 中有详细说明。
可用性
目前还没有面向 DreamX-Creator 的原生 ComfyUI 节点:权重采用 diffusers 布局,推理需要通过官方仓库运行。路线图已将蒸馏版、更少步数的模型列为下一个里程碑。
评论
使用 GitHub 登录后即可参与讨论。