AuK-Flash: Tencent의 4단계 증류 음성 모델
ComfyUI Wiki
AuK-Flash는 Tencent의 AuK 음성 모델을 증류한 버전으로, CFG=0으로 고정 4단계 추론을 실행하여 ComfyUI에서 빠른 생성과 편집을 제공합니다.
A
AuK-Flash
TTS증류빠른 추론음성 편집Tencent의 AuK 음성 모델을 증류한 버전입니다. CFG=0과 고정 4단계 추론을 사용해 생성과 편집 속도를 높이면서 TTS, 음성 복제, 음성 편집, 음성 향상, 음성 분리까지 모든 작업 범위를 그대로 유지합니다.
| 개발자 | Tencent Hunyuan + Shanghai Jiao Tong University |
| 출시일 | 2026-09-09 |
| 아키텍처 | 1.5B diffusion transformer, 증류 (NFE=4) |
| 라이선스 | MIT |
| 파라미터 | 1.5B |
| 추론 | 고정 4단계, CFG=0 |
기능
AuK-Flash는 AuK 베이스 모델과 동일한 작업 범위와 명령 인터페이스를 공유합니다: 제로샷 및 instruct TTS, 콘텐츠·음향·준언어적 편집, 음성 향상, 소스 분리. 차이점은 최대 품질보다 속도를 우선한다는 것입니다.
ComfyUI 사용법
AuK Model Loader에서 auk_flash.safetensors를 로드하고 다음을 설정하세요:
nfe_steps=4cfg_strength=0sway_sampling_coef=-1
동일한 Qwen2.5-Omni-3B 인코더와 30초 소스+대상 제한이 적용됩니다. 세부 정보는 공식 ComfyUI 가이드를 참고하세요.
관련 항목
Guides and workflows related to this model series.
No articles found.
댓글
GitHub로 로그인하고 토론에 참여하세요.