Tencent AuK: 음성 생성과 편집을 위한 1.5B 단일 모델

ComfyUI Wikinews

Tencent Hunyuan이 TTS, 음성 복제, 가사 편집, 음성 향상, 음원 분리를 아우르는 1.5B 음성 모델 AuK를 오픈소스로 공개했습니다. 공식 ComfyUI 노드와 워크플로가 함께 제공됩니다.

Tencent Hunyuan이 상하이 자오퉁 대학 및 상하이 혁신 연구원(Shanghai Innovation Institute)과 함께 음성 생성 및 편집을 위한 1.5B 파운데이션 모델 AuK를 오픈소스로 공개했습니다. 하나의 자연어 명령 인터페이스로 제로샷 및 명령 기반 TTS, 콘텐츠 및 음향 편집, 준언어적 편집, 음성 향상, 음원 분리를 모두 처리합니다. 이번 릴리스에는 공식 ComfyUI 노드(ComfyUI-AuK)와 바로 실행 가능한 워크플로, 그리고 4스텝 고속 추론을 위한 증류 모델 AuK-Flash 변형이 포함됩니다. 코드와 가중치는 MIT 라이선스로 GitHubHugging Face에서 확인할 수 있습니다.

개요

AuK는 수백만 시간의 다양한 오디오로 학습되었습니다. 음성 작업을 여러 도구로 나누는 대신(TTS용 모델 하나, 정리용 모델 하나, 스템 분리용 모델 하나), AuK는 모든 작업을 동일한 메시지 기반 인터페이스 뒤에 배치합니다. 평범한 문장으로 명령을 전달하고, 필요하면 오디오 클립을 첨부하면 나머지는 모델이 처리합니다. 프로젝트의 기술 보고서에서는 생성, 편집, 향상, 분리 전반의 벤치마크를 설명합니다.

음성 생성, 편집, 향상, 분리 벤치마크 전반에 걸친 AuK 성능

AuK가 지원하는 다섯 가지 작업군에 대한 벤치마크 결과.

두 가지 변형을 사용할 수 있습니다.

모델설명
AuK고품질 생성을 위한 베이스 모델, NFE와 CFG 구성 가능
AuK-Flash증류 모델, CFG=0으로 4스텝 추론 고정

지원 작업

모든 작업은 동일한 자연어 명령 형식을 공유합니다. 주요 내용은 다음과 같습니다.

  • 제로샷 TTS: 참조 클립의 목소리로 대상 텍스트를 말하거나, 참조 오디오 없이 목소리를 설명만으로 지정(instruct TTS)
  • 콘텐츠 편집: 말하는 내용을 다시 쓰고, 단어를 교체, 삽입, 제거하며, 노래 녹음에서는 멜로디와 목소리를 유지한 채 가사를 다시 쓸 수도 있습니다
  • 음향 편집: 반음 단위로 피치를 조정하고, 말하기 속도와 볼륨을 변경
  • 준언어적 편집: 감정이나 음색을 바꾸고, 억양을 제거하고, 숨소리와 웃음소리를 추가하거나 제거하고, 일반 음성과 속삭임 사이를 변환
  • 향상 및 분리: 노이즈 제거와 잔향 제거, 믹스에서 한 명의 화자만 유지, 음악에서 보컬 추출, 말하는 내용을 기준으로 대상 화자 분리
AuK 모델 아키텍처

AuK 아키텍처. diffusion transformer와 레이어 융합 가중치는 checkpoint에 포함되어 제공되며, MLLM 인코더(Qwen2.5-Omni-3B)와 VAE는 별도 파일로 로드됩니다.

ComfyUI 지원

공식 저장소에는 두 개의 핵심 노드인 AuK Model LoaderAuK Generate / Edit를 포함한 ComfyUI 통합이 있으며, 생성, 편집, 향상, 분리를 모두 다룹니다. 선택 사항인 Prompt Enhancer는 OpenAI 호환 LLM을 사용해 자유 형식 요청을 바로 실행 가능한 명령으로 변환합니다.

설치 방법은 저장소의 ComfyUI 문서를 따릅니다.

  1. ComfyUI를 실행하는 Python 환경에 comfyui extra를 설치합니다: pip install -e ".[comfyui]"
  2. comfyui/ComfyUI-AuKComfyUI/custom_nodes에 링크합니다
  3. 가중치를 다운로드합니다: AuK(또는 AuK-Flash)와 Qwen2.5-Omni-3B 인코더
  4. 함께 제공되는 auk.json 워크플로를 열고 AuK Model Loader에서 경로를 설정합니다

실행 전에 알아둘 점:

  • 30초 제한: 소스/참조 오디오와 생성된 대상 오디오를 합쳐 30초 이내여야 하며, 노드가 긴 오디오를 자동으로 분할하지 않습니다
  • Flash 설정: AuK-Flash의 경우 로더에서 nfe_steps=4, cfg_strength=0, sway_sampling_coef=-1로 설정합니다
  • 메모리: 모델은 선택된 장치에 계속 상주하며, 이 노드들은 ComfyUI의 자동 VRAM 오프로드를 지원하지 않습니다
  • PE 자격 증명: Prompt Enhancer는 OpenAI 호환 .env를 읽으며, ComfyUI를 시작하기 전에 이를 로드해야 합니다

사용 가능 여부

AuK와 AuK-Flash 가중치는 MIT 라이선스로 Hugging FaceModelScope에서 제공되며, 코드는 Tencent-Hunyuan/AuK에 있습니다. 대화형 데모는 Hugging Face SpaceModelScope Space에서 실행됩니다. SGLang-Omni는 두 변형 모두에 대한 day-0 서빙 지원을 발표했습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Tencent AuK: 음성 생성과 편집을 위한 1.5B 단일 모델 | ComfyUI Wiki