AuK-Flash : modèle vocal distillé en 4 étapes par Tencent

ComfyUI Wiki

AuK-Flash est la variante distillée du modèle vocal AuK de Tencent, avec une inférence fixe en 4 étapes et CFG=0 pour une génération et une édition rapides dans ComfyUI.

A

AuK-Flash

TTSDistilléInférence rapideÉdition de la parole

Variante distillée du modèle vocal AuK de Tencent. Utilise une inférence fixe en 4 étapes avec CFG=0 pour une génération et une édition plus rapides, tout en conservant l'ensemble des tâches : TTS, clonage vocal, édition de la parole, amélioration et séparation.

DéveloppeurTencent Hunyuan + Université Jiao Tong de Shanghai
Date de sortie2026-09-09
ArchitectureTransformer de diffusion 1.5B, distillé (NFE=4)
LicenceMIT
Paramètres1.5B
Inférence4 étapes fixes, CFG=0

Fonctionnalités

AuK-Flash partage la même couverture de tâches et la même interface d'instructions que le modèle de base AuK : TTS zero-shot et instruct, édition de contenu, acoustique et paralinguistique, amélioration de la parole et séparation des sources. Le compromis : la vitesse plutôt que la qualité maximale.

Utilisation avec ComfyUI

Chargez auk_flash.safetensors dans AuK Model Loader et définissez :

  • nfe_steps=4
  • cfg_strength=0
  • sway_sampling_coef=-1

Le même encodeur Qwen2.5-Omni-3B et la limite de 30 secondes pour source plus cible s'appliquent. Consultez le guide ComfyUI officiel pour plus de détails.

Voir aussi

Guides and workflows related to this model series.

No articles found.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…