Tencent AuK : un modèle 1,5B pour la génération et l'édition vocales
Tencent Hunyuan publie AuK, un modèle vocal de 1,5B : TTS, clonage vocal, édition de paroles, amélioration et séparation, avec des nœuds ComfyUI officiels.
ComfyUI-AuK) et un flux de travail prêt à l'emploi, ainsi qu'une variante distillée AuK-Flash pour une inférence rapide en 4 étapes. Le code et les poids sont disponibles sous licence MIT sur GitHub et Hugging Face.
Présentation
AuK est entraîné sur des millions d'heures d'audio divers. Au lieu de répartir le travail vocal entre des outils séparés (un modèle pour le TTS, un autre pour le nettoyage, un troisième pour la séparation des pistes), AuK place chaque tâche derrière la même interface à base de messages : vous transmettez une instruction en langage naturel, joignez éventuellement un extrait audio, et le modèle fait le reste. Le rapport technique du projet décrit les benchmarks couvrant la génération, l'édition, l'amélioration et la séparation.
Résultats de benchmark sur les cinq familles de tâches prises en charge par AuK.
Deux variantes sont disponibles :
| Modèle | Description |
|---|---|
| AuK | Modèle de base pour une génération de haute qualité, NFE et CFG configurables |
| AuK-Flash | Modèle distillé, inférence fixe en 4 étapes avec CFG=0 |
Tâches prises en charge
Toutes les tâches partagent le même format d'instruction en langage naturel. Points forts :
- TTS zero-shot : prononcer le texte cible avec la voix d'un extrait de référence, ou décrire une voix sans aucun audio de référence (TTS par instruction)
- Édition de contenu : réécrire ce qui est dit, remplacer, insérer ou supprimer des mots ; réécrire même les paroles d'un enregistrement chanté tout en conservant la mélodie et la voix
- Édition acoustique : ajuster la hauteur en demi-tons, la vitesse de parole et le volume
- Édition paralinguistique : modifier l'émotion ou le timbre, supprimer un accent, ajouter ou retirer des respirations et des rires, convertir entre parole normale et chuchotement
- Amélioration et séparation : débruiter et déreverbérer, conserver un locuteur dans un mixage, extraire les voix de la musique, ou isoler un locuteur cible d'après ce qu'il dit
Architecture d'AuK. Le transformer de diffusion et les poids de fusion de couches sont fournis dans le checkpoint ; l'encodeur MLLM (Qwen2.5-Omni-3B) et le VAE se chargent en fichiers séparés.
Prise en charge de ComfyUI
Le référentiel officiel inclut une intégration ComfyUI avec deux nœuds principaux, AuK Model Loader et AuK Generate / Edit, couvrant la génération, l'édition, l'amélioration et la séparation. Un Prompt Enhancer optionnel transforme les requêtes libres en instructions prêtes à l'emploi à l'aide d'un LLM compatible OpenAI.
L'installation suit le guide ComfyUI du référentiel :
- Installer l'extra
comfyuidans l'environnement Python qui exécute ComfyUI :pip install -e ".[comfyui]" - Lier
comfyui/ComfyUI-AuKdansComfyUI/custom_nodes - Télécharger les poids :
AuK(ouAuK-Flash) plus l'encodeurQwen2.5-Omni-3B - Ouvrir le flux de travail
auk.jsonfourni et définir les chemins dans AuK Model Loader
À savoir avant de lancer :
- Limite de 30 secondes : l'audio source/de référence plus la cible générée doivent tenir dans 30 secondes ; le nœud ne découpe pas automatiquement les audios longs
- Paramètres Flash : pour AuK-Flash, définissez
nfe_steps=4,cfg_strength=0etsway_sampling_coef=-1dans le loader - Mémoire : les modèles restent résidents sur le périphérique sélectionné ; le déchargement automatique de la VRAM de ComfyUI n'est pas pris en charge pour ces nœuds
- Identifiants PE : le Prompt Enhancer lit un fichier
.envcompatible OpenAI qui doit être chargé avant de démarrer ComfyUI
Disponibilité
Les poids d'AuK et d'AuK-Flash sont sur Hugging Face et ModelScope sous licence MIT, avec le code sur Tencent-Hunyuan/AuK. Des démos interactives sont disponibles sur le Hugging Face Space et le ModelScope Space. SGLang-Omni a annoncé la prise en charge du serving day-0 pour les deux variantes.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.