Encodeur Real-Audio YuE2 : intégrez votre propre musique dans YuE2
L'encodeur audio communautaire transforme vos enregistrements en tokens sémantiques pour l'entraînement de LoRA sur YuE2-3B, plus un LoRA instrumental avec prompts de sections.
La pièce manquante que YuE2 n'a jamais livrée
YuE2-3B génère des chansons complètes à partir d'un prompt de style et de paroles. En interne, il écrit des « tokens sémantiques » qui se décodent en audio, mais l'encodeur qui reconvertit un enregistrement existant en ces tokens n'a jamais été publié. Sans lui, impossible d'intégrer sa propre musique dans le modèle pour l'affiner.
L'astuce derrière la nouvelle publication yue2-mothersuperior-realaudio-tokenizer-v4 : le modèle s'enseigne lui-même. Chaque chanson générée par YuE2 est accompagnée des tokens exacts qui l'ont produite, soit un exemple étiqueté que personne n'a eu à étiqueter à la main. L'auteur a généré quelques milliers de chansons dans de nombreux genres, entraîné un petit encodeur sur ces paires, puis l'a adapté à de vrais enregistrements en laissant le propre décodeur de YuE2 noter l'encodeur : si les tokens reconstruisaient l'audio réel, ils étaient corrects. Aucune étiquette de token pour de la musique réelle n'a jamais été nécessaire.
Ce que contient la publication
Le dépôt du tokenizer livre trois éléments :
- Tête de tokenizer : un transformer de 8 couches (d=512) qui mappe les caractéristiques de la couche 20 de MERT-v2-FullSong vers les 32 768 codes sémantiques de YuE2 à 25 Hz. La correspondance exacte sur les chansons de YuE2 mises de côté est de 16,1 % en top-1, les codes proches produisant un rendu presque identique, et les tests d'écoute en aller-retour NAR se situent autour de 95 %.
- LoRA de branche NAR (
nar_lora_joint_v4) : un LoRA de rang 32 sur les projections self-attention et MLP du NAR, entraîné conjointement avec la tête sur de l'audio réel afin que le décodeur produise des latents de production réelle. - Scripts d'entraînement et d'inférence, pour que chacun puisse reproduire ou étendre le pipeline.
Le LoRA instrumental
Un LoRA instrumental a ensuite été publié (ar_lora_inst_v3abc), entraîné sur environ 2 700 pistes instrumentales réparties sur plus de 100 genres, associées à des partitions ABC annotées en accords. Il amène YuE2 à écrire de la musique instrumentale avec un plan de sections, et il est conçu pour fonctionner avec le chain-of-thought activé (cot="full"), où le modèle écrit d'abord sa propre partition ABC, puis les tokens musicaux conditionnés sur cette partition.
Le champ paroles accepte trois styles de prompt structurel, entraînés à parts égales :
- Nu : juste
[instrumental], en laissant le modèle choisir la structure et la longueur. - Balises sans durée : vous choisissez l'ordre des sections, le modèle choisit le timing, par exemple
[intro]/[verse]/[chorus]/[bridge]/[chorus]/[outro]. - Balises avec durée : chaque section reçoit aussi une heure de début et de fin comme
[verse 0:15-0:45], le guidage structurel le plus fort, bien que le modèle respecte mieux l'ordre et les proportions des sections que les heures de fin absolues.
Utilisation dans ComfyUI
Les deux LoRA sont livrés avec une variante *_comfyui.safetensors empaquetée pour la disposition YuE2 native de ComfyUI (clés qkv / gate_up fusionnées) :
nar_lora_joint_v4_comfyui.safetensorsse charge dans un LoraLoader standard sur la sortie MODEL du chargeur de checkpoint YuE2.ar_lora_inst_v3abc_comfyui.safetensorsse charge sur la sortie CLIP, car le planificateur AR réside dans l'emplacement CLIP, et nécessite que lemodedes nœuds YuE2 Generate soit réglé sur full avec un nœud ABC connecté.
La première version Reddit du LoRA instrumental ne se déclenchait pas dans ComfyUI à cause des conventions de nommage des couches de ComfyUI ; l'auteur a publié le fichier compatible en quelques minutes, et les utilisateurs du fil ont confirmé la correction avec des réactions comme « C'est vraiment, vraiment bon. Tu es un magicien ».
L'effet sur l'écosystème
L'encodeur débloque une vague de travaux dérivés jusque-là bloqués : l'adaptateur Hum-to-Song de l'auteur lui-même (fredonnez une mélodie, YuE2 produit la chanson complète), un pack de nœuds d'entraînement LoRA communautaire, et des LoRA de genre ou d'artiste entraînés sur de vrais enregistrements. L'auteur note que l'entraînement LoRA pour YuE2 « va commencer à apparaître partout maintenant », puisque chacun peut entraîner sa propre musique dans un LoRA grâce à ces scripts.
Disponibilité
Les poids sont gratuits sur Hugging Face : le tokenizer audio réel v4, le LoRA instrumental, et l'adaptateur hum-to-song. Dans ComfyUI, associez-les aux nœuds du pipeline YuE2 natif ; les fichiers LoRA compatibles ComfyUI se chargent directement avec les chargeurs LoRA standard, sans conversion nécessaire.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.