YuE2-3B : musique ouverte avec partitions éditables
MAP publie YuE2-3B, un modèle musical ouvert qui dépasse Suno v5 avec des partitions éditables. Le support natif ComfyUI est sur la branche yue2.
yue2 (PR #16250).
Aperçu
YuE2-3B est le successeur du modèle original YuE de conversion paroles → chanson. L'équipe le positionne comme une génération musicale ouverte de qualité de pointe : sur 192 prompts WildSongBench, YuE2 avec un échantillonnage best-of-8 atteint une moyenne SongBench de 6,9632, contre 6,8721 pour Suno v5, le score le plus élevé parmi tous les modèles ouverts et propriétaires évalués.
Qualité de chanson et alignement du texte de pointe sur 192 prompts WildSongBench. YuE2 utilise une planification symbolique ; Bo8 signifie best-of-8.
La fonctionnalité phare est la planification symbolique avec une partition éditable. Au lieu de passer directement du texte à l'audio, YuE2 écrit d'abord un plan contenant la mélodie et les accords (en notation ABC), puis génère l'audio à partir de celui-ci. Comme le plan est explicite, vous pouvez :
- Composer et éditer : mélodie complète plus accords, mélodie seule, ou génération directe sans partition
- Apporter votre propre partition : fournir une partition ABC existante et laisser YuE2 la chanter
- Éditer avec un agent : convertir des commentaires musicaux en révisions de partition, de style et de paroles, puis laisser le modèle générer la version suivante. L'équipe présente une chaîne d'édition de 14 versions qui fait passer une chanson de la pop mandarine au jazz anglais.
Architecture
Un seul backbone AR–NAR Mixture-of-Transformers écrit la partition et les tokens sémantiques, puis génère les latents acoustiques par flow matching. Le VAE les convertit en audio stéréo.
YuE2 utilise un backbone AR–NAR Mixture-of-Transformers. L'étape autoregressive planifie la partition et les tokens sémantiques ; l'étape non autoregressive produit les latents acoustiques via flow matching, et un VAE dédié les décode en audio stéréo 48 kHz. Les API de planification et de synthèse sont exposées séparément, ce qui permet aux développeurs d'inspecter ou de remplacer le plan symbolique.
Exemple de sortie
La carte du modèle fournit des démos complètes couvrant des compositions originales et des reprises :
| Exemple | Style | Durée |
|---|---|---|
| Cyber Metal | Cyber metal anglais | 5:00 |
| 今晚不眠 | Funk mandarin / nu-disco | 3:24 |
| Passion | Rock anglais | 3:55 |
| Auld Lang Syne | Reprise jazz-funk | 3:10 |
| 最炫民族风 | Reprise ballade | 4:45 |
| Jingle Bells | Reprise heavy metal | 1:09 |
Les exemples de reprises montrent le modèle réimaginant une chanson existante dans un genre complètement différent, et la démo d'édition agentique déroule 9 étapes de planification et 14 versions générées d'une même chanson.
Exécution
YuE2-3B s'exécute en local sur un GPU NVIDIA de 24 Go (Linux, Python 3.10+) sans quantification. L'équipe distribue un wheel d'inférence aux côtés du checkpoint de 7,3 Go sur Hugging Face :
python -m pip install huggingface-hub==0.36.2
hf download m-a-p/YuE2-3B yue2_infer-0.1.5-py3-none-any.whl --local-dir .
python -m pip install ./yue2_infer-0.1.5-py3-none-any.whlLe pipeline expose le chargement Hugging Face, le guidage textuel (CFG) et des API distinctes de planification et de synthèse. Les notebooks complets ainsi que les recettes de reprises et d'édition se trouvent dans le README.
Disponibilité
Aucun support natif ComfyUI n'existe pour l'instant. Le nœud communautaire de longue date ComfyUI_YuE encapsule la série YuE dans ComfyUI ; il n'a pas été mis à jour pour YuE2 au moment de la rédaction, donc exécuter YuE2-3B aujourd'hui nécessite le package d'inférence Python officiel. Une démo hébergée est disponible sur la page du projet.
Le support natif ComfyUI est arrivé sur la branche yue2
Le 11 septembre, le cœur de ComfyUI a intégré le support natif de YuE2 dans la PR #16250. Au moment de la rédaction, il se trouve sur une branche yue2 distincte plutôt que sur master, vous devez donc basculer sur cette branche (commit d87e12ad) pour l'essayer. Un checkpoint tout-en-un prêt à l'emploi (yue2.safetensors, 7,8 Go) est publié sur le compte Hugging Face Comfy-Org, et un flux de travail de test est joint à la pull request.
Les premiers rendus depuis la branche native sonnent correctement, mais l'intégration est encore toute fraîche :
- YuE2 impose des versions exactes de PyTorch, Transformers et d'autres packages partagés, donc installer les Exigences autonomes de YuE2 peut écraser des packages dont ComfyUI a besoin. La branche native évite le problème des multi-venv, mais vérifiez votre environnement après l'installation.
- Des packs de nœuds communautaires comme EmeraldApple-AI/ComfyUI-YuE2 et un fork de ScryptHunter qui isole le wheel YuE2 sont également apparus en l'espace d'une journée ; ce sont pour l'instant des projets expérimentaux menés par une seule personne.
- Le VAE propre à YuE2 ne convertit l'audio que depuis et vers des latents acoustiques continus, ce qui signifie que l'entraînement de LoRA pour YuE2 n'est pas encore possible : les tokens musicaux sémantiques discrets et un pipeline d'entraînement spécifique à YuE2 n'ont pas été publiés.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.