DreamX-Creator 1.0:ComfyUI 安装与模型指南

ComfyUI Wiki

在 ComfyUI 中使用原生节点运行 DreamX-Creator:7B 联合音视频生成、1 步 2K 精修器、约 54 GB 权重包以及生成工作流。

D

DreamX-Creator 1.0

Video GenerationJoint Audio-Video2KComfyUI

DreamX-Creator 1.0 是 AMap 开源的 7B 生成器,一次生成即可输出同步的视频与音频,另配一个自回归 1 步精修器,可将结果超分至 2K。原生 ComfyUI V3 节点已开放已发布的生成器与精修器。

开发者AMap ML (Alibaba)
发布日期2026-09
架构7B 联合音视频生成器 + 5B SR-DiT 精修器
基础依赖关系Wan2.2-TI2V-5B(视频 VAE、UMT5-xxl 文本编码器)
输出同步的视频 + 音频,精修后最高可达 2K
许可证Apache-2.0

给定首帧和文本提示词,DreamX-Creator 通过门控跨模态注意力对模态专用的视频流与音频流进行联合建模:交叉注意力权重让每种模态都能关注另一种模态,并由一个学习得到的门控决定信息跨模态流动的多少。渐进式联合训练让口型、画面中的动作与配乐保持同步,而不是事后拼接。随后,一个自回归 1 步精修器(SR-DiT,5B)在保留内容、运动与音频对齐时序的前提下将片段超分至 2K,也可用于精修外部视频。

安装

DreamX-Creator 通过 DreamX Creator T8 的原生 V3 节点在 ComfyUI 中运行。从 ComfyUI 管理器安装该节点包(搜索 "DreamX Creator T8"),或将其克隆到 ComfyUI/custom_nodes/,并使用启动 ComfyUI 的同一个 Python 安装其依赖项。

将 ComfyUI 可直接使用的权重包下载到共享模型目录:

hf download t8star/DreamX-Creator-Comfy --local-dir ComfyUI/models/dreamx_creator

加载器的 model_root=auto 会搜索仓库的 checkpoints/ 与 ComfyUI/models/dreamx_creator/。该权重包约 54 GB,其根目录必须直接包含 creator/、audio_vae/、refiner/ 和 wan2.2_ti2v_5b/ 文件夹。

工作流

生成画面包含完整的加载器、两个文本编码器、首帧音视频 Latent、AV 流偏移(已发布的预设为 5.0 / 5.0)、多模态引导器,以及在正常调度、20 步和 euler 下运行的 FlowMatch 采样器,之后依次是 AV Latent 拆分、视频与音频 VAE 解码以及视频导出。独立的精修器工作流执行 2× 处理,同时保留音频与 FPS。请求的时长会向下取整为 Wan 兼容的 4N+1 帧数。

该节点包附带可从前端导入的示例(examples/dreamx_creator_ui.json 用于首帧到同步的视频与音频,examples/dreamx_refiner_ui.json 用于 2× 精修处理)。

资源

Guides and workflows related to this model series.

No articles found.

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…