AuK-Flash: modelo de voz destilado de 4 pasos de Tencent

ComfyUI Wiki

AuK-Flash es la variante destilada del modelo de voz AuK de Tencent; usa inferencia fija de 4 pasos con CFG=0 para generación y edición rápidas en ComfyUI.

A

AuK-Flash

TTSDestiladoInferencia rápidaEdición de voz

Variante destilada del modelo de voz AuK de Tencent. Usa inferencia fija de 4 pasos con CFG=0 para una generación y edición más rápidas, manteniendo la cobertura completa de tareas: TTS, clonación de voz, edición de voz, mejora y separación.

DesarrolladorTencent Hunyuan + Universidad Jiao Tong de Shanghái
Fecha de lanzamiento2026-09-09
ArquitecturaTransformer de difusión de 1.5B, destilado (NFE=4)
LicenciaMIT
Parámetros1.5B
Inferencia4 pasos fijos, CFG=0

Capacidades

AuK-Flash comparte la misma cobertura de tareas y la misma interfaz de instrucciones que el modelo base AuK: TTS zero-shot y con instrucciones, edición de contenido, acústica y paralingüística, mejora de voz y separación de fuentes. La contrapartida es la velocidad frente a la máxima calidad.

Uso en ComfyUI

Carga auk_flash.safetensors en AuK Model Loader y configura:

  • nfe_steps=4
  • cfg_strength=0
  • sway_sampling_coef=-1

Se aplican el mismo codificador Qwen2.5-Omni-3B y el límite de 30 segundos para fuente más objetivo. Consulta la guía oficial de ComfyUI para más detalles.

Relacionado

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…