IndexTTS-2.5 : clonage vocal zero-shot en 5 langues avec émotions
L'IndexTeam de Bilibili publie IndexTTS-2.5 : clonage vocal zero-shot en chinois, anglais, japonais, espagnol et arabe, avec contrôle des émotions et de la vitesse.
Aperçu
IndexTTS-2.5 est un modèle TTS zero-shot autoregressif reposant sur un backbone GPT, avec un décodeur speech-to-mel par flow-matching et un vocodeur BigVGAN (~0,8 milliard de paramètres dans le backbone GPT). Il synthétise de la parole à 22,05 kHz à partir d'une voix de référence et d'un texte, en conservant le timbre cloné tout en contrôlant l'émotion de manière indépendante.
Par rapport à IndexTTS-2, la nouvelle version ajoute le japonais, l'espagnol et l'arabe (en plus du chinois et de l'anglais), propose une inférence plus rapide, intègre le contrôle de la vitesse de parole et améliore le contrôle de la prononciation.
Fonctionnalités clés
- Clonage vocal zero-shot : clonez une voix à partir d'un seul extrait audio de référence, sans fine-tuning requis.
- 5 langues : chinois, anglais, japonais, espagnol et arabe, avec transfert de voix interlingue (parlez n'importe quelle langue prise en charge avec la voix clonée).
- Contrôle des émotions : un vecteur d'émotion de 8 floats
[happy, angry, sad, afraid, disgusted, melancholic, surprised, calm], dissocié du timbre, ajuste l'expression émotionnelle de la parole. - Contrôle de la vitesse de parole : ajustez le débit de la parole synthétisée.
- Contrôle de la prononciation : le pinyin chinois, les phonèmes CMU anglais et le kana japonais peuvent être spécifiés en ligne avec la notation
<mot|lecture>pour une prononciation précise. - ~6 Go de VRAM : fonctionne sur les GPU grand public avec une inférence bf16.
Prise en charge de ComfyUI
IndexTTS-2.5 n'est pas intégré au cœur de ComfyUI, mais des nœuds personnalisés de la communauté sont disponibles :
- BSAI_ComfyUI_IndexTTS-2.5 : installez-le dans
ComfyUI/custom_nodes/pour exécuter IndexTTS-2.5 depuis le graphique ComfyUI. - ComfyUI_JR_IndexTTS25 : un pack de nœuds communautaire alternatif avec sa propre interface WebUI.
Disponibilité
Le modèle est publié sur HuggingFace avec une bibliothèque d'inférence et une configuration. L'espace officiel IndexTTS-2.5 Demo (Gradio) fournit une interface sans code. Le référentiel de code prend également en charge le déploiement en production via les recettes vLLM.
git clone https://github.com/index-tts/index-tts.git && cd index-tts
pip install -U uv && uv sync --all-extras
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpointsLes modèles auxiliaires (w2v-bert-2.0, codec sémantique MaskGCT, CAMPPlus, BigVGAN) sont téléchargés automatiquement lors de la première exécution. L'article est disponible sur arXiv:2601.03888.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.