Kandinsky 6.0:ComfyUI 安装配置与模型指南
在 ComfyUI 中运行 Kandinsky 6.0:29B Pro 与 3B Lite 可生成带同步 44 kHz 音频的 5 秒视频,另有超分辨率模型可输出全高清。
Kandinsky 6.0
视频生成音频视频文生视频图生视频ComfyUIKandinsky 6.0 Video 是一系列用于同步文本到音频视频生成的基础扩散模型。Pro(29B)与 Lite(3B)均可生成带同步 44 kHz 音频的 5 秒片段,包括唇形同步,支持文生音频视频与图生音频视频模式,另有一个独立的超分辨率模型可将输出提升至全高清。
| 开发者 | Kandinsky Lab |
| 发布日期 | 2026-10-06(开放权重) |
| 架构 | 采用 flow matching 的多模态视频与音频扩散 transformer(29B Pro、3B Lite) |
| 文本编码器 | Qwen2.5-VL 搭配 CLIP 池化 embedding |
| 音频 | MMAudio VAE 与 BigVGAN 风格声码器,输出同步的 44 kHz 音频 |
| 输出 | 24 fps 的 5 秒片段,经超分辨率后最高可达全高清 |
| 生成模式 | 文生音频视频、图生音频视频 |
| 许可证 | MIT |
Kandinsky 6.0 Video 在一次生成中同时产出画面与音轨,而不是事后为视频配音。一个多模态视频与音频扩散 transformer 对两路流同时建模,由 Qwen2.5-VL 文本编码器提供 token 级文本 embedding,CLIP 模型提供池化 embedding。视觉部分通过混元视频 VAE 解码,音频部分则运行 MMAudio VAE 加 BigVGAN 风格声码器,输出 44 kHz 波形。采样采用 flow matching,shift = 5.0。
模型
该系列提供两种规模,每种都包含基础版、蒸馏 10 步版和预训练 checkpoint,此外还有一对专用超分辨率模型:
| Checkpoint | 规模 | 说明 |
|---|---|---|
| Kandinsky 6.0 Pro | 29B | 旗舰生成 checkpoint |
| Kandinsky 6.0 Pro distill | 29B | 使用 PiFlow 蒸馏至 10 步,ComfyUI 模板默认使用 |
| Kandinsky 6.0 Pro pretrain | 29B | 用于微调的预训练基础模型 |
| Kandinsky 6.0 Lite | 3B | 紧凑型生成 checkpoint |
| Kandinsky 6.0 Lite distill | 3B | 蒸馏 10 步变体 |
| Kandinsky 6.0 Lite pretrain | 3B | 用于微调的预训练基础模型 |
| Kandinsky 6.0 VSR | - | 超分辨率 pipeline,支持 x2、x2.25 和 x4,每个分块 4 步 |
| Kandinsky 6.0 VSR distill | - | 蒸馏版超分辨率,每个分块 2 步 |
超分辨率
Kandinsky6SRPipeline 在 K-VAE Latent 空间中通过分块扩散放大已生成帧,并使用 Hann 窗融合重叠的分块。resolution_scale 接受 2、2.25(生成之后默认走此路径)或 4,min_overlap 与 tiles_batch_size 则在分块融合效果、显存占用与速度之间进行权衡。
ComfyUI
官方 ComfyUI 扩展由 kandinskylab 发布在 ComfyUI Registry 上,名为 kandinsky6 和 kandinsky6-sr。通过 ComfyUI Manager 安装这两个扩展,重新启动,然后打开 工作流 → 浏览模板 → kandinsky6,即可找到内置的 文生视频+音频 与 图生视频+音频 模板。模型文件(包括配套的 Diffusers JSON 配置)可通过扩展的 下载模型 按钮获取,并下载到正确的 ComfyUI 文件夹中。
资源
Guides and workflows related to this model series.
评论
使用 GitHub 登录后即可参与讨论。