AuK-Flash: Tencent의 4단계 증류 음성 모델

ComfyUI Wiki

AuK-Flash는 Tencent의 AuK 음성 모델을 증류한 버전으로, CFG=0으로 고정 4단계 추론을 실행하여 ComfyUI에서 빠른 생성과 편집을 제공합니다.

A

AuK-Flash

TTS증류빠른 추론음성 편집

Tencent의 AuK 음성 모델을 증류한 버전입니다. CFG=0과 고정 4단계 추론을 사용해 생성과 편집 속도를 높이면서 TTS, 음성 복제, 음성 편집, 음성 향상, 음성 분리까지 모든 작업 범위를 그대로 유지합니다.

개발자Tencent Hunyuan + Shanghai Jiao Tong University
출시일2026-09-09
아키텍처1.5B diffusion transformer, 증류 (NFE=4)
라이선스MIT
파라미터1.5B
추론고정 4단계, CFG=0

기능

AuK-Flash는 AuK 베이스 모델과 동일한 작업 범위와 명령 인터페이스를 공유합니다: 제로샷 및 instruct TTS, 콘텐츠·음향·준언어적 편집, 음성 향상, 소스 분리. 차이점은 최대 품질보다 속도를 우선한다는 것입니다.

ComfyUI 사용법

AuK Model Loader에서 auk_flash.safetensors를 로드하고 다음을 설정하세요:

  • nfe_steps=4
  • cfg_strength=0
  • sway_sampling_coef=-1

동일한 Qwen2.5-Omni-3B 인코더와 30초 소스+대상 제한이 적용됩니다. 세부 정보는 공식 ComfyUI 가이드를 참고하세요.

관련 항목

Guides and workflows related to this model series.

No articles found.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…