YuE2-3B: Generación musical abierta con partituras editables de MAP

ComfyUI Wikinews

MAP lanza YuE2-3B, un modelo de música abierto que supera a Suno v5 con partituras editables. El soporte nativo de ComfyUI ya está en la rama yue2.

El equipo de Multimodal Art Projection (m-a-p) ha publicado como código abierto YuE2-3B, un modelo de generación musical de 3B que convierte una letra y un prompt de estilo en canciones completas con voces y acompañamiento. A diferencia de los sistemas típicos de letra a canción, YuE2 expone una capa de partitura editable: la melodía y los acordes se escriben como planes simbólicos que puedes revisar antes de renderizar. En la evaluación WildSongBench del equipo supera a Suno v5. ComfyUI ahora cuenta con soporte nativo para YuE2 en la rama yue2 (PR #16250).

Descripción general

YuE2-3B es el sucesor del modelo original de letra a canción YuE. El equipo lo posiciona como generación musical abierta de calidad frontera: en 192 prompts de WildSongBench, YuE2 con muestreo best-of-8 alcanza un promedio de SongBench de 6.9632, frente a 6.8721 de Suno v5, el más alto entre todos los modelos abiertos y propietarios evaluados.

Calidad de canción y alineación de texto de YuE2 en WildSongBench

Calidad de canción y alineación de texto de nivel frontera en 192 prompts de WildSongBench. YuE2 usa planificación simbólica; Bo8 significa best-of-8.

La característica principal es la planificación simbólica con una partitura editable. En lugar de pasar directamente del texto al audio, YuE2 primero escribe un plan que contiene melodía y acordes (en notación ABC) y después renderiza el audio a partir de él. Como el plan es explícito, puedes:

  • Componer y editar: melodía completa más acordes, solo melodía, o generación directa sin partitura
  • Aporta tu propia partitura: introduce una partitura ABC existente y haz que YuE2 la cante
  • Editar con un agente: convierte la retroalimentación musical en revisiones de partitura, estilo y letra, y deja que el modelo renderice la siguiente versión. El equipo demuestra una cadena de edición de 14 versiones que lleva una canción del pop mandarín al jazz en inglés.

Arquitectura

Arquitectura de YuE2

Un backbone AR–NAR Mixture-of-Transformers escribe la partitura y los tokens semánticos, y luego genera latentes acústicos mediante flow matching. El VAE los convierte en audio estéreo.

YuE2 usa un backbone AR–NAR Mixture-of-Transformers. La etapa autoregresiva planifica la partitura y los tokens semánticos; la etapa no autoregresiva produce latentes acústicos mediante flow matching, y un VAE dedicado los decodifica en audio estéreo de 48 kHz. Tanto la API de planificación como la de síntesis se exponen por separado, de modo que los desarrolladores pueden inspeccionar o reemplazar el plan simbólico.

Salida de ejemplo

La model card incluye demos de duración completa que abarcan composiciones originales y covers:

EjemploEstiloDuración
Cyber MetalCyber metal en inglés5:00
今晚不眠Funk / nu-disco en mandarín3:24
PassionRock en inglés3:55
Auld Lang SyneCover de jazz-funk3:10
最炫民族风Cover de balada4:45
Jingle BellsCover de heavy metal1:09

Los ejemplos de covers muestran cómo el modelo reimagina una canción existente en un género completamente distinto, y la demo de edición agéntica recorre 9 pasos de planificación y 14 versiones renderizadas de una misma canción.

Cómo ejecutarlo

YuE2-3B se ejecuta localmente en una GPU NVIDIA de 24 GB (Linux, Python 3.10+) sin cuantización. El equipo distribuye un wheel de inferencia junto con el checkpoint de 7.3 GB en Hugging Face:

python -m pip install huggingface-hub==0.36.2
hf download m-a-p/YuE2-3B yue2_infer-0.1.5-py3-none-any.whl --local-dir .
python -m pip install ./yue2_infer-0.1.5-py3-none-any.whl

El pipeline expone la carga desde Hugging Face, la orientación de texto (CFG) y APIs separadas de planificación y síntesis. Los notebooks completos y las recetas de covers y edición están en el README.

Disponibilidad

Todavía no hay soporte nativo en ComfyUI. El nodo de la comunidad de larga trayectoria ComfyUI_YuE envuelve la serie YuE en ComfyUI; no se ha actualizado para YuE2 en el momento de escribir esto, por lo que ejecutar YuE2-3B hoy requiere el paquete oficial de inferencia en Python. Hay una demo alojada disponible en la página del proyecto.

El soporte nativo de ComfyUI ha llegado a la rama yue2

El 11 de septiembre, el core de ComfyUI incorporó el soporte nativo para YuE2 en el PR #16250. En el momento de escribir esto se encuentra en una rama yue2 separada en lugar de master, así que necesitas hacer checkout de esa rama (commit d87e12ad) para probarlo. Un checkpoint todo en uno listo para usar (yue2.safetensors, 7.8 GB) está publicado en la cuenta de Hugging Face de Comfy-Org, y se adjunta un flujo de trabajo de prueba a la pull request.

Las primeras renderizaciones de la rama nativa suenan razonables, pero la integración todavía está recién salida del horno:

  • YuE2 fija versiones exactas de PyTorch, Transformers y otros paquetes compartidos, por lo que instalar los requisitos independientes de YuE2 puede sobrescribir paquetes que ComfyUI necesita. La rama nativa evita el problema de los múltiples venv, pero verifica tu entorno después de la instalación.
  • Paquetes de nodos de la comunidad como EmeraldApple-AI/ComfyUI-YuE2 y un fork de ScryptHunter que aísla el wheel de YuE2 también aparecieron en un día; por ahora son proyectos experimentales de una sola persona.
  • El VAE propio de YuE2 solo convierte audio hacia y desde latentes acústicos continuos, lo que significa que el entrenamiento de LoRA para YuE2 aún no es viable: los tokens musicales semánticos discretos y un pipeline de entrenamiento específico para YuE2 no se han publicado.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
YuE2-3B: Generación musical abierta con partituras editables de MAP | ComfyUI Wiki