Entraînez vos propres LoRA YuE2 directement dans ComfyUI
ComfyUI-YuE2-Trainer entraîne des LoRA YuE2-3B dans des nœuds ComfyUI : fournissez vos mp3 ou wav, choisissez un mot déclencheur, obtenez un LoRA prêt pour le loader standard.
safetensors standard qui se charge avec le loader LoRA natif sur le checkpoint YuE2 natif. Aucun fichier de légende, aucun script d'entraînement externe, sans quitter ComfyUI.
Ce qu'il entraîne et comment
YuE2-3B génère des chansons complètes à partir d'un prompt de style et de paroles, et se compose en interne de trois parties : un modèle de langue AR de 2,2B qui planifie la chanson et écrit les tokens sémantiques, une branche NAR flow-matching de 1,5B qui transforme les latents VAE à 64 canaux en son, et un VAE stéréo 48 kHz. L'entraîneur gèle la branche AR « compositrice » (m-a-p n'a pas publié d'encodeur audio-vers-token ni son code d'entraînement) et entraîne des adaptateurs LoRA uniquement sur la branche NAR, en utilisant l'objectif flow-matching publié.
Le résultat est donc un LoRA de style, d'instrumentation et de timbre vocal plutôt qu'un clone vocal. L'entraînement se fait sans légende : les fichiers audio sont encodés une fois en latents VAE et mis en cache sur le disque, et le mot déclencheur est injecté via le préfixe textuel natif au checkpoint de YuE2 ([Tags] your_trigger_word, caption ...). Un fichier de légende .txt optionnel portant le même nom que chaque fichier est pris en charge si vous souhaitez un contrôle plus fin.
Le LoRA enregistré est un *.safetensors standard au format natif de ComfyUI, placé dans models/loras/ et chargé avec le nœud standard LoraLoaderModelOnly sur le checkpoint YuE2 natif. Aucune étape de conversion.
Exigences
- Le checkpoint YuE2 natif en un seul fichier :
yue2_3b_bf16.safetensors(~7,8 Go) depuis Comfy-Org/YuE2, le même fichier que celui utilisé par les nœuds de génération natifs. Utilisez le fichier bf16 ; le repack INT8 ne peut pas être entraîné. - 24 Go de VRAM RECOMMANDÉS (testé sur un RTX 5090 Laptop 24 Go).
- Le pack de nœuds est autonome : le code officiel du modèle YuE2 (
yue2_inferde m-a-p, Apache-2.0, non modifié) est inclus, donc aucun autre nœud personnalisé n'est nécessaire.
Paramètres de l'auteur et premiers commentaires
La recette recommandée par l'auteur est 5000 étapes avec un poids de 2.0, et le LoRA fonctionne mieux avec le modèle FP16 qu'avec la variante convrot. Les premiers commentaires de la communauté sont mitigés : le premier problème signale qu'un LoRA entraîné n'a aucun effet audible, et le clonage vocal est explicitement indiqué comme ne fonctionnant pas. Considérez donc cet outil comme expérimental, encore en cours de développement à ciel ouvert. Le projet compte déjà des forks explorant une couverture d'entraînement plus large, dont un qui entraîne le modèle acoustique en plus du planner CLIP.
Disponibilité
L'entraîneur est gratuit sur GitHub : Starnodes2024/ComfyUI-YuE2-Trainer (51 étoiles au moment de la rédaction). Installez-le via ComfyUI-Manager ou par git clone dans custom_nodes.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.