AuK:腾讯开源语音生成与编辑模型系列

ComfyUI Wiki

AuK 是腾讯混元开源的 1.5B 语音模型系列:TTS、声音克隆、内容与声学编辑、副语言编辑、语音增强、音源分离,并附带官方 ComfyUI 节点。

A

AuK

音频TTS声音克隆语音编辑音源分离

由腾讯混元、上海交通大学和上海创智学院联合开源 1.5B 语音基础模型。单一自然语言指令接口即可覆盖零样本与指令 TTS、歌词与内容编辑、音高、语速、情感与音色编辑、语音增强以及音源分离。随附官方 ComfyUI 节点与工作流。

开发者腾讯混元 + 上海交通大学
发布日期2026-09-09
架构1.5B diffusion transformer + Qwen2.5-Omni-3B MLLM 编码器
许可证MIT
输出每次运行最多生成 30 秒音频

模型

模型描述许可证发布日期
AuK用于高质量生成的基础模型,可配置 NFE 与 CFGMIT2026-09-09
AuK-Flash蒸馏版本,固定 4 步推理,CFG=0MIT2026-09-09

选择上方的模型,可查看精选权重下载、教程及相关信息。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…