IndexTTS-2.5 : clonage vocal zero-shot en 5 langues avec émotions

ComfyUI Wikinews

L'IndexTeam de Bilibili publie IndexTTS-2.5 : clonage vocal zero-shot en chinois, anglais, japonais, espagnol et arabe, avec contrôle des émotions et de la vitesse.

IndexTTS-2.5 (HuggingFace | GitHub | Démo) est la nouvelle version de l'IndexTeam de Bilibili : un modèle de synthèse vocale (text-to-speech) zero-shot qui clone une voix à partir d'un seul extrait audio de référence, prenant désormais en charge le chinois, l'anglais, le japonais, l'espagnol et l'arabe avec un transfert de voix interlingue et un contrôle des émotions.

Aperçu

IndexTTS-2.5 est un modèle TTS zero-shot autoregressif reposant sur un backbone GPT, avec un décodeur speech-to-mel par flow-matching et un vocodeur BigVGAN (~0,8 milliard de paramètres dans le backbone GPT). Il synthétise de la parole à 22,05 kHz à partir d'une voix de référence et d'un texte, en conservant le timbre cloné tout en contrôlant l'émotion de manière indépendante.

Par rapport à IndexTTS-2, la nouvelle version ajoute le japonais, l'espagnol et l'arabe (en plus du chinois et de l'anglais), propose une inférence plus rapide, intègre le contrôle de la vitesse de parole et améliore le contrôle de la prononciation.

Vidéo de démonstration IndexTTS-2.5

Fonctionnalités clés

  • Clonage vocal zero-shot : clonez une voix à partir d'un seul extrait audio de référence, sans fine-tuning requis.
  • 5 langues : chinois, anglais, japonais, espagnol et arabe, avec transfert de voix interlingue (parlez n'importe quelle langue prise en charge avec la voix clonée).
  • Contrôle des émotions : un vecteur d'émotion de 8 floats [happy, angry, sad, afraid, disgusted, melancholic, surprised, calm], dissocié du timbre, ajuste l'expression émotionnelle de la parole.
  • Contrôle de la vitesse de parole : ajustez le débit de la parole synthétisée.
  • Contrôle de la prononciation : le pinyin chinois, les phonèmes CMU anglais et le kana japonais peuvent être spécifiés en ligne avec la notation <mot|lecture> pour une prononciation précise.
  • ~6 Go de VRAM : fonctionne sur les GPU grand public avec une inférence bf16.

Prise en charge de ComfyUI

IndexTTS-2.5 n'est pas intégré au cœur de ComfyUI, mais des nœuds personnalisés de la communauté sont disponibles :

Disponibilité

Le modèle est publié sur HuggingFace avec une bibliothèque d'inférence et une configuration. L'espace officiel IndexTTS-2.5 Demo (Gradio) fournit une interface sans code. Le référentiel de code prend également en charge le déploiement en production via les recettes vLLM.

git clone https://github.com/index-tts/index-tts.git && cd index-tts
pip install -U uv && uv sync --all-extras
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpoints

Les modèles auxiliaires (w2v-bert-2.0, codec sémantique MaskGCT, CAMPPlus, BigVGAN) sont téléchargés automatiquement lors de la première exécution. L'article est disponible sur arXiv:2601.03888.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
IndexTTS-2.5 : clonage vocal zero-shot en 5 langues avec émotions | ComfyUI Wiki