AuK-Flash : modèle vocal distillé en 4 étapes par Tencent
AuK-Flash est la variante distillée du modèle vocal AuK de Tencent, avec une inférence fixe en 4 étapes et CFG=0 pour une génération et une édition rapides dans ComfyUI.
AuK-Flash
TTSDistilléInférence rapideÉdition de la paroleVariante distillée du modèle vocal AuK de Tencent. Utilise une inférence fixe en 4 étapes avec CFG=0 pour une génération et une édition plus rapides, tout en conservant l'ensemble des tâches : TTS, clonage vocal, édition de la parole, amélioration et séparation.
| Développeur | Tencent Hunyuan + Université Jiao Tong de Shanghai |
| Date de sortie | 2026-09-09 |
| Architecture | Transformer de diffusion 1.5B, distillé (NFE=4) |
| Licence | MIT |
| Paramètres | 1.5B |
| Inférence | 4 étapes fixes, CFG=0 |
Fonctionnalités
AuK-Flash partage la même couverture de tâches et la même interface d'instructions que le modèle de base AuK : TTS zero-shot et instruct, édition de contenu, acoustique et paralinguistique, amélioration de la parole et séparation des sources. Le compromis : la vitesse plutôt que la qualité maximale.
Utilisation avec ComfyUI
Chargez auk_flash.safetensors dans AuK Model Loader et définissez :
nfe_steps=4cfg_strength=0sway_sampling_coef=-1
Le même encodeur Qwen2.5-Omni-3B et la limite de 30 secondes pour source plus cible s'appliquent. Consultez le guide ComfyUI officiel pour plus de détails.
Voir aussi
Guides and workflows related to this model series.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.