IndexTTS-2.5: TTS Zero-Shot en 5 Idiomas con Control de Emociones

ComfyUI Wikinews

Bilibili IndexTeam lanza IndexTTS-2.5: clonación de voz zero-shot en chino, inglés, japonés, español y árabe, con control de emociones y velocidad.

IndexTTS-2.5 (HuggingFace | GitHub | Demo) es el nuevo lanzamiento del IndexTeam de Bilibili: un modelo de texto a voz zero-shot que clona una voz a partir de un único clip de audio de referencia, ahora compatible con chino, inglés, japonés, español y árabe, con transferencia de voz entre idiomas y control de emociones.

Resumen

IndexTTS-2.5 es un modelo TTS zero-shot autoregresivo construido sobre un backbone GPT con un decodificador de voz a mel basado en flow-matching y un vocoder BigVGAN (~0.8B de parámetros en el backbone GPT). Sintetiza habla de 22.05 kHz a partir de una muestra de voz de referencia más el texto, conservando el timbre clonado mientras controla la emoción de forma independiente.

En comparación con IndexTTS-2, la nueva versión añade japonés, español y árabe (además de chino e inglés), infiere más rápido, añade control de velocidad del habla y mejora el control de la pronunciación.

Vídeo de demostración de IndexTTS-2.5

Características principales

  • Clonación de voz zero-shot — clona una voz a partir de un único clip de audio de referencia, sin necesidad de ajuste fino.
  • 5 idiomas — chino, inglés, japonés, español y árabe, con transferencia de voz entre idiomas (habla en cualquier idioma compatible con la voz clonada).
  • Control de emociones — un vector de emociones de 8 flotantes [happy, angry, sad, afraid, disgusted, melancholic, surprised, calm], desacoplado del timbre, ajusta la entrega emocional del habla.
  • Control de velocidad del habla — ajusta el ritmo del habla sintetizada.
  • Control de pronunciación — el pinyin chino, los fonemas CMU del inglés y el kana japonés se pueden especificar en línea con la notación <word|reading> para una pronunciación precisa.
  • ~6 GB de VRAM — se ejecuta en GPU de consumo con inferencia bf16.

Soporte en ComfyUI

IndexTTS-2.5 no está integrado en el núcleo de ComfyUI, pero hay Nodos Personalizados de la Comunidad disponibles:

Disponibilidad

El modelo se publica en HuggingFace con una biblioteca de inferencia y configuración, y el espacio oficial IndexTTS-2.5 Demo (Gradio) ofrece una interfaz sin código. El repositorio de código también admite el despliegue en producción mediante recetas de vLLM.

git clone https://github.com/index-tts/index-tts.git && cd index-tts
pip install -U uv && uv sync --all-extras
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpoints

Los Modelos auxiliares (w2v-bert-2.0, códec semántico MaskGCT, CAMPPlus, BigVGAN) se descargan automáticamente en la primera ejecución. El artículo está disponible en arXiv:2601.03888.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
IndexTTS-2.5: TTS Zero-Shot en 5 Idiomas con Control de Emociones | ComfyUI Wiki