IndexTTS-2.5:支持 5 种语言的零样本 TTS 模型,带情感控制
ComfyUI Wikinews
哔哩哔哩 IndexTeam 发布 IndexTTS-2.5:支持中文、英语、日语、西班牙语和阿拉伯语的零样本声音克隆,并具备情感和语速控制功能。
IndexTTS-2.5(HuggingFace | GitHub | Demo)是哔哩哔哩 IndexTeam 的最新发布:一款仅凭一段参考音频即可克隆声音的零样本文本转语音模型,现已支持中文、英语、日语、西班牙语和阿拉伯语,并具备跨语言音色迁移和情感控制功能。
概述
IndexTTS-2.5 是一款基于 GPT 主干网络的自回归零样本 TTS 模型,采用流匹配(flow-matching)语音到梅尔频谱解码器和 BigVGAN 声码器(GPT 主干网络约 0.8B 参数)。它可根据参考语音提示和文本合成 22.05 kHz 的语音,在保持克隆音色的同时独立控制情感。
与 IndexTTS-2 相比,新版本新增了日语、西班牙语和阿拉伯语(在中文和英语之外),推理速度更快,新增语速控制功能,并提升了发音的可控性。
主要特性
- 零样本声音克隆 — 只需一段参考音频即可克隆声音,无需微调。
- 5 种语言 — 中文、英语、日语、西班牙语和阿拉伯语,支持跨语言音色迁移(可用克隆的声音说任意受支持的语言)。
- 情感控制 — 一个由 8 个浮点数组成的情感向量
[happy, angry, sad, afraid, disgusted, melancholic, surprised, calm],与音色解耦,用于调整语音的情感表达。 - 语速控制 — 调整合成语音的快慢。
- 发音控制 — 可通过
<word|reading>内联标注指定中文拼音、英语 CMU 音素和日语假名,实现精确发音。 - 约 6 GB 显存 — 采用 bf16 推理,可在消费级 GPU 上运行。
ComfyUI 支持
IndexTTS-2.5 未内置到 ComfyUI 核心中,但可通过社区自定义节点使用:
- BSAI_ComfyUI_IndexTTS-2.5 — 安装到
ComfyUI/custom_nodes/后,即可在 ComfyUI 节点图中运行 IndexTTS-2.5。 - ComfyUI_JR_IndexTTS25 — 另一个社区节点包,自带 WebUI。
可用性
该模型已在 HuggingFace 上发布,附带推理库和配置文件,官方 IndexTTS-2.5 Demo 空间(Gradio)提供了零代码界面。代码仓库还支持通过 vLLM recipes 进行生产部署。
git clone https://github.com/index-tts/index-tts.git && cd index-tts
pip install -U uv && uv sync --all-extras
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpoints辅助模型(w2v-bert-2.0、MaskGCT 语义编解码器、CAMPPlus、BigVGAN)会在首次运行时自动下载。论文可在 arXiv:2601.03888 查看。
评论
使用 GitHub 登录后即可参与讨论。