AuK-Flash:腾讯 4 步蒸馏语音模型,ComfyUI 快速推理指南

ComfyUI Wiki

AuK-Flash 是腾讯 AuK 语音模型的蒸馏版本,以固定 4 步推理、CFG=0 运行,在 ComfyUI 中实现快速生成与编辑。

A

AuK-Flash

TTS蒸馏快速推理语音编辑

腾讯 AuK 语音模型的蒸馏版本。采用固定 4 步推理、CFG=0,在提升生成与编辑速度的同时保留完整任务覆盖:TTS、语音克隆、语音编辑、增强与分离。

开发者腾讯混元 + 上海交通大学
发布日期2026-09-09
架构1.5B diffusion transformer,蒸馏版(NFE=4)
许可证MIT
参数1.5B
推理固定 4 步,CFG=0

功能特性

AuK-Flash 与 AuK 基础模型 具有相同的任务覆盖范围和指令接口:零样本与指令式 TTS,内容、声学与副语言编辑,语音增强以及音源分离。其取舍在于以速度优先于最高质量。

ComfyUI 使用方法

在 AuK Model Loader 中加载 auk_flash.safetensors,并设置:

  • nfe_steps=4
  • cfg_strength=0
  • sway_sampling_coef=-1

同样使用 Qwen2.5-Omni-3B 编码器,并沿用 30 秒的源音频加目标音频总时长限制。详情请参阅官方 ComfyUI 指南。

相关链接

Guides and workflows related to this model series.

No articles found.

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…