AuK: Tencent의 오픈 음성 생성 및 편집 모델 패밀리 (ComfyUI 노드 포함)

ComfyUI Wiki

AuK는 Tencent Hunyuan의 오픈 1.5B 음성 모델 패밀리입니다. TTS, 음성 복제, 콘텐츠 및 음향 편집, 준언어적 편집, 음성 향상, 음원 분리를 지원하며 공식 ComfyUI 노드를 제공합니다.

A

AuK

오디오TTS음성 복제음성 편집음원 분리

Tencent Hunyuan, 상하이 자오퉁 대학, 상하이 혁신 연구원이 공개한 1.5B 음성 파운데이션 모델입니다. 하나의 자연어 명령 인터페이스로 제로샷 및 인스트럭트 TTS, 가사와 콘텐츠 편집, 피치, 속도, 감정, 음색 편집, 음성 향상, 음원 분리를 모두 처리합니다. 공식 ComfyUI 노드와 워크플로가 포함되어 있습니다.

개발사Tencent Hunyuan + 상하이 자오퉁 대학
출시일2026-09-09
아키텍처1.5B diffusion transformer + Qwen2.5-Omni-3B MLLM 인코더
라이선스MIT
출력실행당 최대 30초 오디오

모델

모델설명라이선스출시일
AuK고품질 생성을 위한 베이스 모델, NFE와 CFG 구성 가능MIT2026-09-09
AuK-Flash증류된 변형 모델, CFG=0으로 4단계 고정 추론MIT2026-09-09

위에서 모델을 선택하면 엄선된 가중치 다운로드, 튜토리얼, 관련 정보를 확인할 수 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…