Kandinsky 6.0:ComfyUI 视频与音频生成模型与工作流

ComfyUI Wikinews

适用于 ComfyUI 的 Kandinsky 6.0 开源权重:29B Pro 与 3B Lite 可生成带 44 kHz 同步音频的 5 秒视频,并支持最高 Full HD 的超分辨率。

Kandinsky Lab 于 10 月 6 日开源了 Kandinsky 6.0 Video:一系列用于同步文本生成音频与视频的 diffusion 模型。Kandinsky 6.0 Video Pro(29B) 与 Kandinsky 6.0 Video Lite(3B) 都能生成带 44 kHz 同步音频的 5 秒片段,支持唇形同步,提供文生音视频(T2AV)与图生音视频(TI2AV)模式,另有一个独立的超分辨率模型可将输出提升至 Full HD。ComfyUI 支持同日发布,以第一方扩展形式提供,并附带两个可直接运行的工作流模板。
Kandinsky 6.0 official promo

Kandinsky 6.0 官方宣传图。

Kandinsky 6.0 有哪些新特性

Kandinsky 6.0 Video 是一系列基础 diffusion 模型,能够同时生成视频与音频,而不是事后再行配音。该系列分为两种规模:

  • Kandinsky 6.0 Video Pro:29B 参数,旗舰版本。
  • Kandinsky 6.0 Video Lite:3B 参数,轻量版本。

每个型号都提供三种形式:基础 checkpoint、用于快速迭代的蒸馏 10 步 checkpoint,以及预训练 checkpoint。它们都能生成 5 秒、24 fps 且带 44 kHz 同步音频的片段,覆盖对白、环境音与音乐,并支持两种模式:

  • 文生音视频(T2AV):仅凭一段文本提示即可生成视频片段及其声音。
  • 图生音视频(TI2AV):引用图像作为首帧条件,提示词描述后续发生的内容。

其架构是多模态视频与音频 diffusion transformer(Kandinsky6Transformer3DModel),使用 Qwen2.5-VL 文本编码器生成 token 级文本 embedding 与 CLIP 池化 embedding,视觉部分搭配混元视频 VAE,音频部分则使用 MMAudio VAE 加上 BigVGAN 风格的声码器。调度采用 flow matching,shift = 5.0。

有两个推理开关值得了解。sample_audio=False 仅生成视频;expand_prompts=True 会在编码前让 Qwen2.5-VL 文本编码器把简短的请求改写为详细的描述,这会增加延迟,但不会引入额外权重。

Kandinsky 6.0 官方展示。

超分辨率至 Full HD

上述示例中的生成分辨率为 480x864。第二条 pipeline Kandinsky6SRPipeline 会接收这些帧,在 K-VAE latent 空间中通过分块 diffusion 将其放大 x2、x2.25 或 x4,并使用 Hann 窗把重叠的分块重新融合在一起。flow-matching checkpoint 每个分块运行 4 步,而蒸馏 VSR checkpoint 可将其减少到 2 步。

官方示例片段之一。

在 ComfyUI 中使用 Kandinsky 6.0

Kandinsky Lab 随权重一同发布了第一方 ComfyUI 扩展。它通过 ComfyUI Registry 以 kandinsky6 和 kandinsky6-sr 两个包的形式安装,要求 ComfyUI 0.38.0 或更高版本,以及 Python 3.10+。模型加载与卸载由 ComfyUI 自身处理,因此无需对核心打补丁。

该扩展附带两个可直接运行的模板,默认使用 Pro 蒸馏 PiFlow(10 步,CFG=1) 以及 I2VA 引用人像:

Kandinsky 6.0 text to video and audio template Kandinsky 6.0 image to video and audio template

两个内置模板:文生视频+音频,以及图生视频+音频。

非蒸馏 Pro 与 MagCache 仍受支持,而对于蒸馏模型,MagCache 会被自动跳过。台词直接写在视频 caption 中 <S> 与 <E> 标记之间,而人声与其他声音则在单独的音频 caption 中描述。两个模板都内置原生 Qwen3.5-9B 提示词美化功能,可在节点中关闭;SR 扩展是可选的,但内置工作流需要它。

ComfyUI 还有一个原生集成正在审核中:Comfy-Org/ComfyUI #16825 会向核心添加 Kandinsky 6.0 音视频节点。在它合并之前,上述 Registry 扩展是官方途径。

模型文件

官方 ComfyUI 工作流的大部分文件来自 Kandinsky Lab 仓库,其中共享的文本编码器与视频 VAE 复用了现有的 Comfy-Org 包:

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── Kandinsky-6.0-Pro-distill-5s-Diffusers/transformer/diffusion_pytorch_model.safetensors
    │   └── Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers/
    ├── 📂 text_encoders/
    │   ├── qwen3.5_9b_bf16.safetensors
    │   └── qwen_2.5_vl_7b.safetensors
    └── 📂 audio_vae/
        ├── v1-44.pth
        └── bigvgan_vocoder/bigvgan_generator.pt

扩展中的 Download models 按钮会自动把以上所有文件,以及每个 Diffusers 文件夹所需的配套 JSON 配置,放到正确的 ComfyUI 目录中。

获取方式

权重发布在 Hugging Face 的 kandinskylab 下,代码、ComfyUI 扩展与技术报告位于 kandinskylab/kandinsky-6。Kandinsky 6.0 也可通过 Diffusers(Kandinsky6TI2VAPipeline 与 Kandinsky6SRPipeline)、vLLM-Omni,以及一个运行 Pro 蒸馏 checkpoint 的 Hugging Face 演示 Space 使用。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Kandinsky 6.0:ComfyUI 视频与音频生成模型与工作流 | ComfyUI Wiki