IndexTTS-2.5:支持 5 种语言的零样本 TTS 模型,带情感控制

ComfyUI Wikinews

哔哩哔哩 IndexTeam 发布 IndexTTS-2.5:支持中文、英语、日语、西班牙语和阿拉伯语的零样本声音克隆,并具备情感和语速控制功能。

IndexTTS-2.5HuggingFace | GitHub | Demo)是哔哩哔哩 IndexTeam 的最新发布:一款仅凭一段参考音频即可克隆声音的零样本文本转语音模型,现已支持中文、英语、日语、西班牙语和阿拉伯语,并具备跨语言音色迁移和情感控制功能。

概述

IndexTTS-2.5 是一款基于 GPT 主干网络的自回归零样本 TTS 模型,采用流匹配(flow-matching)语音到梅尔频谱解码器和 BigVGAN 声码器(GPT 主干网络约 0.8B 参数)。它可根据参考语音提示和文本合成 22.05 kHz 的语音,在保持克隆音色的同时独立控制情感。

与 IndexTTS-2 相比,新版本新增了日语、西班牙语和阿拉伯语(在中文和英语之外),推理速度更快,新增语速控制功能,并提升了发音的可控性。

IndexTTS-2.5 演示视频

主要特性

  • 零样本声音克隆 — 只需一段参考音频即可克隆声音,无需微调。
  • 5 种语言 — 中文、英语、日语、西班牙语和阿拉伯语,支持跨语言音色迁移(可用克隆的声音说任意受支持的语言)。
  • 情感控制 — 一个由 8 个浮点数组成的情感向量 [happy, angry, sad, afraid, disgusted, melancholic, surprised, calm],与音色解耦,用于调整语音的情感表达。
  • 语速控制 — 调整合成语音的快慢。
  • 发音控制 — 可通过 <word|reading> 内联标注指定中文拼音、英语 CMU 音素和日语假名,实现精确发音。
  • 约 6 GB 显存 — 采用 bf16 推理,可在消费级 GPU 上运行。

ComfyUI 支持

IndexTTS-2.5 未内置到 ComfyUI 核心中,但可通过社区自定义节点使用:

可用性

该模型已在 HuggingFace 上发布,附带推理库和配置文件,官方 IndexTTS-2.5 Demo 空间(Gradio)提供了零代码界面。代码仓库还支持通过 vLLM recipes 进行生产部署。

git clone https://github.com/index-tts/index-tts.git && cd index-tts
pip install -U uv && uv sync --all-extras
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpoints

辅助模型(w2v-bert-2.0、MaskGCT 语义编解码器、CAMPPlus、BigVGAN)会在首次运行时自动下载。论文可在 arXiv:2601.03888 查看。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
IndexTTS-2.5:支持 5 种语言的零样本 TTS 模型,带情感控制 | ComfyUI Wiki