腾讯 AuK:一个 1.5B 模型搞定语音生成与编辑,附官方 ComfyUI 节点
ComfyUI Wikinews
腾讯混元开源 AuK,一个 1.5B 语音模型,覆盖 TTS、声音克隆、歌词编辑、语音增强与音源分离,并提供官方 ComfyUI 节点与工作流。
腾讯混元 联合上海交通大学和上海创智学院,开源了 AuK,一个用于语音生成与编辑的 1.5B 基础模型。单一的 自然语言指令接口即可覆盖零样本 TTS 和指令式 TTS、内容与声学编辑、副语言编辑、语音增强以及音源分离。此次发布附带官方 ComfyUI 节点(
ComfyUI-AuK)和一套开箱即用的工作流,还提供了蒸馏版 AuK-Flash 以支持 4 步快速推理。代码和权重以 MIT 许可发布于 GitHub 和 Hugging Face。
概览
AuK 在数百万小时的多样音频上训练而成。AuK 没有把语音任务拆散到不同工具中(一个模型做 TTS、另一个做降噪、第三个做分轨),而是把所有任务都放在同一个基于消息的接口之后:你以自然语言传入指令,可选地附带一段音频,剩下的交给模型。项目的技术报告描述了生成、编辑、增强和分离等方面的基准测试。
AuK 所支持的五大任务类别的基准测试结果。
提供两个变体:
支持的任务
所有任务都使用相同的自然语言指令格式。重点包括:
- 零样本 TTS:用参考音频中的音色朗读目标文本,或完全不提供参考音频、仅通过描述来指定音色(指令式 TTS)
- 内容编辑:改写所说内容,替换、插入或删除词语;甚至可以在保留旋律和音色的前提下改写演唱录音中的歌词
- 声学编辑:以半音为单位调整音高、语速和音量
- 副语言编辑:改变情绪或音色、去除口音、添加或去除呼吸声与笑声、在正常语音与耳语之间转换
- 增强与分离:降噪和去混响、从混音中保留某一位说话人、从音乐中提取人声,或按说话内容分离出目标说话人
AuK 架构。扩散 transformer 与 layer-fusion 权重包含在 checkpoint 中;MLLM 编码器(Qwen2.5-Omni-3B)和 VAE 作为独立文件加载。
ComfyUI 支持
官方仓库包含 ComfyUI 集成,提供两个核心节点 AuK Model Loader 和 AuK Generate / Edit,覆盖生成、编辑、增强和分离。可选的 Prompt Enhancer 可通过 OpenAI 兼容的 LLM 把自由形式的请求转换为可直接运行的指令。
安装步骤遵循仓库的 ComfyUI 指南:
- 在运行 ComfyUI 的 Python 环境中安装
comfyui附加项:pip install -e ".[comfyui]" - 将
comfyui/ComfyUI-AuK链接到ComfyUI/custom_nodes - 下载权重:
AuK(或AuK-Flash)加上Qwen2.5-Omni-3B编码器 - 打开随附的
auk.json工作流,并在 AuK Model Loader 中设置路径
运行前须知:
- 30 秒限制:来源/参考音频加上生成的目标音频必须在 30 秒以内;该节点不会自动切分长音频
- Flash 设置:AuK-Flash 需在加载器中设置
nfe_steps=4、cfg_strength=0、sway_sampling_coef=-1 - 内存:模型会常驻在所选设备上;这些节点不支持 ComfyUI 的自动显存卸载
- PE 凭据:Prompt Enhancer 会读取 OpenAI 兼容的
.env文件,该文件必须在启动 ComfyUI 之前加载
获取方式
AuK 和 AuK-Flash 的权重以 MIT 许可发布于 Hugging Face 和 ModelScope,代码位于 Tencent-Hunyuan/AuK。交互式演示运行在 Hugging Face Space 和 ModelScope Space 上。SGLang-Omni 在发布首日即宣布为两个变体提供推理服务支持。
评论
使用 GitHub 登录后即可参与讨论。