AuK-Flash: modelo de voz destilado de 4 pasos de Tencent
AuK-Flash es la variante destilada del modelo de voz AuK de Tencent; usa inferencia fija de 4 pasos con CFG=0 para generación y edición rápidas en ComfyUI.
AuK-Flash
TTSDestiladoInferencia rápidaEdición de vozVariante destilada del modelo de voz AuK de Tencent. Usa inferencia fija de 4 pasos con CFG=0 para una generación y edición más rápidas, manteniendo la cobertura completa de tareas: TTS, clonación de voz, edición de voz, mejora y separación.
| Desarrollador | Tencent Hunyuan + Universidad Jiao Tong de Shanghái |
| Fecha de lanzamiento | 2026-09-09 |
| Arquitectura | Transformer de difusión de 1.5B, destilado (NFE=4) |
| Licencia | MIT |
| Parámetros | 1.5B |
| Inferencia | 4 pasos fijos, CFG=0 |
Capacidades
AuK-Flash comparte la misma cobertura de tareas y la misma interfaz de instrucciones que el modelo base AuK: TTS zero-shot y con instrucciones, edición de contenido, acústica y paralingüística, mejora de voz y separación de fuentes. La contrapartida es la velocidad frente a la máxima calidad.
Uso en ComfyUI
Carga auk_flash.safetensors en AuK Model Loader y configura:
nfe_steps=4cfg_strength=0sway_sampling_coef=-1
Se aplican el mismo codificador Qwen2.5-Omni-3B y el límite de 30 segundos para fuente más objetivo. Consulta la guía oficial de ComfyUI para más detalles.
Relacionado
Guides and workflows related to this model series.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.