Tencent AuK : un modèle 1,5B pour la génération et l'édition vocales

ComfyUI Wikinews

Tencent Hunyuan publie AuK, un modèle vocal de 1,5B : TTS, clonage vocal, édition de paroles, amélioration et séparation, avec des nœuds ComfyUI officiels.

Tencent Hunyuan, avec l'Université Jiao Tong de Shanghai et le Shanghai Innovation Institute, a publié en open source AuK, un modèle de base de 1,5B pour la génération et l'édition vocales. Une interface unique d'instructions en langage naturel couvre le TTS zero-shot et basé sur instructions, l'édition de contenu et acoustique, l'édition paralinguistique, l'amélioration de la parole et la séparation des sources. Cette publication inclut des nœuds ComfyUI officiels (ComfyUI-AuK) et un flux de travail prêt à l'emploi, ainsi qu'une variante distillée AuK-Flash pour une inférence rapide en 4 étapes. Le code et les poids sont disponibles sous licence MIT sur GitHub et Hugging Face.

Présentation

AuK est entraîné sur des millions d'heures d'audio divers. Au lieu de répartir le travail vocal entre des outils séparés (un modèle pour le TTS, un autre pour le nettoyage, un troisième pour la séparation des pistes), AuK place chaque tâche derrière la même interface à base de messages : vous transmettez une instruction en langage naturel, joignez éventuellement un extrait audio, et le modèle fait le reste. Le rapport technique du projet décrit les benchmarks couvrant la génération, l'édition, l'amélioration et la séparation.

Performances d'AuK sur les benchmarks de génération, d'édition, d'amélioration et de séparation de la parole

Résultats de benchmark sur les cinq familles de tâches prises en charge par AuK.

Deux variantes sont disponibles :

ModèleDescription
AuKModèle de base pour une génération de haute qualité, NFE et CFG configurables
AuK-FlashModèle distillé, inférence fixe en 4 étapes avec CFG=0

Tâches prises en charge

Toutes les tâches partagent le même format d'instruction en langage naturel. Points forts :

  • TTS zero-shot : prononcer le texte cible avec la voix d'un extrait de référence, ou décrire une voix sans aucun audio de référence (TTS par instruction)
  • Édition de contenu : réécrire ce qui est dit, remplacer, insérer ou supprimer des mots ; réécrire même les paroles d'un enregistrement chanté tout en conservant la mélodie et la voix
  • Édition acoustique : ajuster la hauteur en demi-tons, la vitesse de parole et le volume
  • Édition paralinguistique : modifier l'émotion ou le timbre, supprimer un accent, ajouter ou retirer des respirations et des rires, convertir entre parole normale et chuchotement
  • Amélioration et séparation : débruiter et déreverbérer, conserver un locuteur dans un mixage, extraire les voix de la musique, ou isoler un locuteur cible d'après ce qu'il dit
Architecture du modèle AuK

Architecture d'AuK. Le transformer de diffusion et les poids de fusion de couches sont fournis dans le checkpoint ; l'encodeur MLLM (Qwen2.5-Omni-3B) et le VAE se chargent en fichiers séparés.

Prise en charge de ComfyUI

Le référentiel officiel inclut une intégration ComfyUI avec deux nœuds principaux, AuK Model Loader et AuK Generate / Edit, couvrant la génération, l'édition, l'amélioration et la séparation. Un Prompt Enhancer optionnel transforme les requêtes libres en instructions prêtes à l'emploi à l'aide d'un LLM compatible OpenAI.

L'installation suit le guide ComfyUI du référentiel :

  1. Installer l'extra comfyui dans l'environnement Python qui exécute ComfyUI : pip install -e ".[comfyui]"
  2. Lier comfyui/ComfyUI-AuK dans ComfyUI/custom_nodes
  3. Télécharger les poids : AuK (ou AuK-Flash) plus l'encodeur Qwen2.5-Omni-3B
  4. Ouvrir le flux de travail auk.json fourni et définir les chemins dans AuK Model Loader

À savoir avant de lancer :

  • Limite de 30 secondes : l'audio source/de référence plus la cible générée doivent tenir dans 30 secondes ; le nœud ne découpe pas automatiquement les audios longs
  • Paramètres Flash : pour AuK-Flash, définissez nfe_steps=4, cfg_strength=0 et sway_sampling_coef=-1 dans le loader
  • Mémoire : les modèles restent résidents sur le périphérique sélectionné ; le déchargement automatique de la VRAM de ComfyUI n'est pas pris en charge pour ces nœuds
  • Identifiants PE : le Prompt Enhancer lit un fichier .env compatible OpenAI qui doit être chargé avant de démarrer ComfyUI

Disponibilité

Les poids d'AuK et d'AuK-Flash sont sur Hugging Face et ModelScope sous licence MIT, avec le code sur Tencent-Hunyuan/AuK. Des démos interactives sont disponibles sur le Hugging Face Space et le ModelScope Space. SGLang-Omni a annoncé la prise en charge du serving day-0 pour les deux variantes.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Tencent AuK : un modèle 1,5B pour la génération et l'édition vocales | ComfyUI Wiki