IndexTTS-2.5: 감정 제어를 지원하는 5개 언어 제로샷 TTS 모델

ComfyUI Wikinews

Bilibili IndexTeam이 IndexTTS-2.5를 출시했습니다. 중국어, 영어, 일본어, 스페인어, 아랍어를 지원하는 제로샷 음성 복제와 감정 및 속도 제어 기능을 제공합니다.

IndexTTS-2.5 (HuggingFace | GitHub | 데모)는 Bilibili IndexTeam의 새로운 릴리스로, 단일 참조 오디오 클립에서 음성을 복제하는 제로샷 텍스트 음성 변환(TTS) 모델입니다. 이제 중국어, 영어, 일본어, 스페인어, 아랍어를 지원하며, 교차 언어 음성 전송과 감정 제어 기능을 제공합니다.

개요

IndexTTS-2.5는 GPT 백본을 기반으로 한 오토리그레시브 제로샷 TTS 모델로, 플로우 매칭 음성-멜 디코더와 BigVGAN 보코더를 사용합니다(GPT 백본에 약 0.8B 파라미터). 참조 음성 프롬프트와 텍스트를 입력받아 22.05kHz 음성을 합성하며, 복제된 음색을 유지하면서 감정을 독립적으로 제어할 수 있습니다.

IndexTTS-2와 비교하면, 새 버전은 중국어와 영어 외에 일본어, 스페인어, 아랍어가 추가되었고, 추론 속도가 빨라졌으며, 말하기 속도 제어가 추가되고 발음 제어 기능이 개선되었습니다.

IndexTTS-2.5 데모 비디오

주요 기능

  • 제로샷 음성 복제: 단일 참조 오디오 클립으로 음성을 복제하며, 파인튜닝이 필요 없습니다.
  • 5개 언어: 중국어, 영어, 일본어, 스페인어, 아랍어를 지원하며, 교차 언어 음성 전송이 가능합니다(복제된 음성으로 지원되는 모든 언어를 말할 수 있습니다).
  • 감정 제어: 음색과 분리된 8개 실수 값으로 구성된 감정 벡터 [happy, angry, sad, afraid, disgusted, melancholic, surprised, calm]로 음성의 감정 표현을 조절합니다.
  • 말하기 속도 제어: 합성 음성의 속도를 조절할 수 있습니다.
  • 발음 제어: <word|reading> 표기법으로 중국어 병음, 영어 CMU 음소, 일본어 가나를 인라인으로 지정하여 정확한 발음을 구현할 수 있습니다.
  • 약 6GB VRAM: bf16 추론으로 소비자용 GPU에서 실행할 수 있습니다.

ComfyUI 지원

IndexTTS-2.5는 ComfyUI 코어에 내장되어 있지 않지만, 다음과 같은 커뮤니티 커스텀 노드를 사용할 수 있습니다:

이용 방법

이 모델은 추론 라이브러리 및 설정과 함께 HuggingFace에 공개되었으며, 공식 IndexTTS-2.5 데모 스페이스(Gradio)에서 코드 없이 사용할 수 있는 인터페이스를 제공합니다. 또한 코드 저장소는 vLLM 레시피를 통한 프로덕션 배포도 지원합니다.

git clone https://github.com/index-tts/index-tts.git && cd index-tts
pip install -U uv && uv sync --all-extras
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpoints

보조 모델(w2v-bert-2.0, MaskGCT semantic codec, CAMPPlus, BigVGAN)은 첫 실행 시 자동으로 다운로드됩니다. 논문은 arXiv:2601.03888에서 확인할 수 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
IndexTTS-2.5: 감정 제어를 지원하는 5개 언어 제로샷 TTS 모델 | ComfyUI Wiki