YuE2-3B: Generación musical abierta con partituras editables de MAP
MAP lanza YuE2-3B, un modelo de música abierto que supera a Suno v5 con partituras editables. El soporte nativo de ComfyUI ya está en la rama yue2.
yue2 (PR #16250).
Descripción general
YuE2-3B es el sucesor del modelo original de letra a canción YuE. El equipo lo posiciona como generación musical abierta de calidad frontera: en 192 prompts de WildSongBench, YuE2 con muestreo best-of-8 alcanza un promedio de SongBench de 6.9632, frente a 6.8721 de Suno v5, el más alto entre todos los modelos abiertos y propietarios evaluados.
Calidad de canción y alineación de texto de nivel frontera en 192 prompts de WildSongBench. YuE2 usa planificación simbólica; Bo8 significa best-of-8.
La característica principal es la planificación simbólica con una partitura editable. En lugar de pasar directamente del texto al audio, YuE2 primero escribe un plan que contiene melodía y acordes (en notación ABC) y después renderiza el audio a partir de él. Como el plan es explícito, puedes:
- Componer y editar: melodía completa más acordes, solo melodía, o generación directa sin partitura
- Aporta tu propia partitura: introduce una partitura ABC existente y haz que YuE2 la cante
- Editar con un agente: convierte la retroalimentación musical en revisiones de partitura, estilo y letra, y deja que el modelo renderice la siguiente versión. El equipo demuestra una cadena de edición de 14 versiones que lleva una canción del pop mandarín al jazz en inglés.
Arquitectura
Un backbone AR–NAR Mixture-of-Transformers escribe la partitura y los tokens semánticos, y luego genera latentes acústicos mediante flow matching. El VAE los convierte en audio estéreo.
YuE2 usa un backbone AR–NAR Mixture-of-Transformers. La etapa autoregresiva planifica la partitura y los tokens semánticos; la etapa no autoregresiva produce latentes acústicos mediante flow matching, y un VAE dedicado los decodifica en audio estéreo de 48 kHz. Tanto la API de planificación como la de síntesis se exponen por separado, de modo que los desarrolladores pueden inspeccionar o reemplazar el plan simbólico.
Salida de ejemplo
La model card incluye demos de duración completa que abarcan composiciones originales y covers:
| Ejemplo | Estilo | Duración |
|---|---|---|
| Cyber Metal | Cyber metal en inglés | 5:00 |
| 今晚不眠 | Funk / nu-disco en mandarín | 3:24 |
| Passion | Rock en inglés | 3:55 |
| Auld Lang Syne | Cover de jazz-funk | 3:10 |
| 最炫民族风 | Cover de balada | 4:45 |
| Jingle Bells | Cover de heavy metal | 1:09 |
Los ejemplos de covers muestran cómo el modelo reimagina una canción existente en un género completamente distinto, y la demo de edición agéntica recorre 9 pasos de planificación y 14 versiones renderizadas de una misma canción.
Cómo ejecutarlo
YuE2-3B se ejecuta localmente en una GPU NVIDIA de 24 GB (Linux, Python 3.10+) sin cuantización. El equipo distribuye un wheel de inferencia junto con el checkpoint de 7.3 GB en Hugging Face:
python -m pip install huggingface-hub==0.36.2
hf download m-a-p/YuE2-3B yue2_infer-0.1.5-py3-none-any.whl --local-dir .
python -m pip install ./yue2_infer-0.1.5-py3-none-any.whlEl pipeline expone la carga desde Hugging Face, la orientación de texto (CFG) y APIs separadas de planificación y síntesis. Los notebooks completos y las recetas de covers y edición están en el README.
Disponibilidad
Todavía no hay soporte nativo en ComfyUI. El nodo de la comunidad de larga trayectoria ComfyUI_YuE envuelve la serie YuE en ComfyUI; no se ha actualizado para YuE2 en el momento de escribir esto, por lo que ejecutar YuE2-3B hoy requiere el paquete oficial de inferencia en Python. Hay una demo alojada disponible en la página del proyecto.
El soporte nativo de ComfyUI ha llegado a la rama yue2
El 11 de septiembre, el core de ComfyUI incorporó el soporte nativo para YuE2 en el PR #16250. En el momento de escribir esto se encuentra en una rama yue2 separada en lugar de master, así que necesitas hacer checkout de esa rama (commit d87e12ad) para probarlo. Un checkpoint todo en uno listo para usar (yue2.safetensors, 7.8 GB) está publicado en la cuenta de Hugging Face de Comfy-Org, y se adjunta un flujo de trabajo de prueba a la pull request.
Las primeras renderizaciones de la rama nativa suenan razonables, pero la integración todavía está recién salida del horno:
- YuE2 fija versiones exactas de PyTorch, Transformers y otros paquetes compartidos, por lo que instalar los requisitos independientes de YuE2 puede sobrescribir paquetes que ComfyUI necesita. La rama nativa evita el problema de los múltiples venv, pero verifica tu entorno después de la instalación.
- Paquetes de nodos de la comunidad como EmeraldApple-AI/ComfyUI-YuE2 y un fork de ScryptHunter que aísla el wheel de YuE2 también aparecieron en un día; por ahora son proyectos experimentales de una sola persona.
- El VAE propio de YuE2 solo convierte audio hacia y desde latentes acústicos continuos, lo que significa que el entrenamiento de LoRA para YuE2 aún no es viable: los tokens musicales semánticos discretos y un pipeline de entrenamiento específico para YuE2 no se han publicado.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.