AuK-Flash:腾讯 4 步蒸馏语音模型,ComfyUI 快速推理指南
ComfyUI Wiki
AuK-Flash 是腾讯 AuK 语音模型的蒸馏版本,以固定 4 步推理、CFG=0 运行,在 ComfyUI 中实现快速生成与编辑。
A
AuK-Flash
TTS蒸馏快速推理语音编辑腾讯 AuK 语音模型的蒸馏版本。采用固定 4 步推理、CFG=0,在提升生成与编辑速度的同时保留完整任务覆盖:TTS、语音克隆、语音编辑、增强与分离。
| 开发者 | 腾讯混元 + 上海交通大学 |
| 发布日期 | 2026-09-09 |
| 架构 | 1.5B diffusion transformer,蒸馏版(NFE=4) |
| 许可证 | MIT |
| 参数 | 1.5B |
| 推理 | 固定 4 步,CFG=0 |
功能特性
AuK-Flash 与 AuK 基础模型 具有相同的任务覆盖范围和指令接口:零样本与指令式 TTS,内容、声学与副语言编辑,语音增强以及音源分离。其取舍在于以速度优先于最高质量。
ComfyUI 使用方法
在 AuK Model Loader 中加载 auk_flash.safetensors,并设置:
nfe_steps=4cfg_strength=0sway_sampling_coef=-1
同样使用 Qwen2.5-Omni-3B 编码器,并沿用 30 秒的源音频加目标音频总时长限制。详情请参阅官方 ComfyUI 指南。
相关链接
Guides and workflows related to this model series.
No articles found.
评论
使用 GitHub 登录后即可参与讨论。