DreamX-Creator 1.0 发布:开源 7B 联合音视频生成模型,支持 2K 分辨率

ComfyUI Wikinews

高德(AMap)开源 DreamX-Creator 1.0,一款基于 Wan2.2 构建的 7B 联合音视频生成器,具备门控跨模态注意力与 1 步 2K 精炼器,权重可以完整下载。

DreamX-Creator 1.0GitHubHugging Face)是高德(AMap)机器学习团队推出的原生联合音视频生成研究框架,于 9 月 3 日以 Apache-2.0 许可证开源。方案中的 7B 生成器通过门控跨模态注意力同时建模视频流与音频流,再由自回归 1 步精炼器将结果升级到 2K。
DreamX-Creator 预告图

DreamX-Creator 1.0 的预览图:展示 2K 分辨率下的联合音视频生成效果。

同时生成视频与音频的 7B 生成器

给定首帧图像和文本提示词后,基础生成器会联合建模模态专属的视频流与音频流。双向交互由两种机制驱动:

  • 门控跨模态注意力(Gated Cross-Modal Attention):跨注意力权重(cross_attn_weights.safetensors,2.56 GB)让每种模态都能关注到另一种模态,并通过可学习的门控控制跨模态信息的流动量。
  • 渐进式联合训练(Progressive Joint Training):两条流被放在一起训练,让口型动作、画面中的动作与音轨保持同步,而不是在生成结束之后再把两者拼接起来。

在基础生成器之上,**音视频强化学习(Audio-Video Reinforcement Learning)**阶段利用模态感知的多模态反馈,改善视觉质量、音频质量、语义一致性以及细粒度的音视频对齐。

1 步精炼至 2K

系统的另一半是自回归 1 步 2K 精炼器(SR-DiT,5B 参数)。它能在保留内容、运动以及与音频对齐的时序的同时,将已经生成的视频超分到 2K。该精炼器同样支持外部视频,因此你可以喂入任意片段,音频则会原样通过、不做任何改动。

精炼器自带多种速度调节选项:KV 缓存、窗口注意力与 Latent 上采样器变体(默认为 FlashLatentUpsampler,还提供了可选的蒸馏版 LightVAE 快速解码器),可以在质量与延迟之间取舍。

可下载内容

全部权重均已发布在 Hugging FaceModelScope 上,总计约 54 GB:

组件内容
creator/7B 联合生成器:视频 DiT 分片(约 20 GB)、音频 DiT(5.7 GB)、跨注意力权重(2.6 GB)
audio_vae/CreatorDACVAE 音频 VAE(0.74 GB)
refiner/SR-DiT 5B(10 GB)、FlashLatentUpsampler、可选的因果 2D 上采样器与 LightVAE 解码器
wan2.2_ti2v_5b/共享的 Wan2.2-TI2V-5B 依赖项:视频 VAE、UMT5-xxl 文本编码器与 tokenizer

Wan2.2 目录可以直接复用 Wan-AI/Wan2.2-TI2V-5B 中现有的文件,所以如果你已经在使用 Wan2.2,只需额外下载三个 DreamX 专属文件夹。

推理只需纯 Python 环境:两个阶段各有自己的 requirements.txt 和一条命令即可运行的脚本,CPU 卸载与多 GPU 序列并行选项在各子 README 中有详细说明。

可用性

目前还没有面向 DreamX-Creator 的原生 ComfyUI 节点:权重采用 diffusers 布局,推理需要通过官方仓库运行。路线图已将蒸馏版、更少步数的模型列为下一个里程碑。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
DreamX-Creator 1.0 发布:开源 7B 联合音视频生成模型,支持 2K 分辨率 | ComfyUI Wiki