Kandinsky 6.0:ComfyUI 安装配置与模型指南

ComfyUI Wiki

在 ComfyUI 中运行 Kandinsky 6.0:29B Pro 与 3B Lite 可生成带同步 44 kHz 音频的 5 秒视频,另有超分辨率模型可输出全高清。

K

Kandinsky 6.0

视频生成音频视频文生视频图生视频ComfyUI

Kandinsky 6.0 Video 是一系列用于同步文本到音频视频生成的基础扩散模型。Pro(29B)与 Lite(3B)均可生成带同步 44 kHz 音频的 5 秒片段,包括唇形同步,支持文生音频视频与图生音频视频模式,另有一个独立的超分辨率模型可将输出提升至全高清。

开发者Kandinsky Lab
发布日期2026-10-06(开放权重)
架构采用 flow matching 的多模态视频与音频扩散 transformer(29B Pro、3B Lite)
文本编码器Qwen2.5-VL 搭配 CLIP 池化 embedding
音频MMAudio VAE 与 BigVGAN 风格声码器,输出同步的 44 kHz 音频
输出24 fps 的 5 秒片段,经超分辨率后最高可达全高清
生成模式文生音频视频、图生音频视频
许可证MIT

Kandinsky 6.0 Video 在一次生成中同时产出画面与音轨,而不是事后为视频配音。一个多模态视频与音频扩散 transformer 对两路流同时建模,由 Qwen2.5-VL 文本编码器提供 token 级文本 embedding,CLIP 模型提供池化 embedding。视觉部分通过混元视频 VAE 解码,音频部分则运行 MMAudio VAE 加 BigVGAN 风格声码器,输出 44 kHz 波形。采样采用 flow matching,shift = 5.0。

模型

该系列提供两种规模,每种都包含基础版、蒸馏 10 步版和预训练 checkpoint,此外还有一对专用超分辨率模型:

Checkpoint规模说明
Kandinsky 6.0 Pro29B旗舰生成 checkpoint
Kandinsky 6.0 Pro distill29B使用 PiFlow 蒸馏至 10 步,ComfyUI 模板默认使用
Kandinsky 6.0 Pro pretrain29B用于微调的预训练基础模型
Kandinsky 6.0 Lite3B紧凑型生成 checkpoint
Kandinsky 6.0 Lite distill3B蒸馏 10 步变体
Kandinsky 6.0 Lite pretrain3B用于微调的预训练基础模型
Kandinsky 6.0 VSR-超分辨率 pipeline,支持 x2、x2.25 和 x4,每个分块 4 步
Kandinsky 6.0 VSR distill-蒸馏版超分辨率,每个分块 2 步

超分辨率

Kandinsky6SRPipeline 在 K-VAE Latent 空间中通过分块扩散放大已生成帧,并使用 Hann 窗融合重叠的分块。resolution_scale 接受 2、2.25(生成之后默认走此路径)或 4,min_overlap 与 tiles_batch_size 则在分块融合效果、显存占用与速度之间进行权衡。

ComfyUI

官方 ComfyUI 扩展由 kandinskylab 发布在 ComfyUI Registry 上,名为 kandinsky6 和 kandinsky6-sr。通过 ComfyUI Manager 安装这两个扩展,重新启动,然后打开 工作流 → 浏览模板 → kandinsky6,即可找到内置的 文生视频+音频 与 图生视频+音频 模板。模型文件(包括配套的 Diffusers JSON 配置)可通过扩展的 下载模型 按钮获取,并下载到正确的 ComfyUI 文件夹中。

资源

Guides and workflows related to this model series.

No articles found.

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…