Codificador de audio real YuE2: trae tu propia música a YuE2
El codificador de audio creado por la comunidad convierte tus grabaciones en tokens semánticos para entrenar LoRA en YuE2-3B, más un LoRA instrumental con prompts de sección.
La pieza faltante que YuE2 nunca lanzó
YuE2-3B genera canciones completas a partir de un prompt de estilo y una letra. Internamente escribe "tokens semánticos" que se decodifican en audio, pero el codificador que mapea una grabación existente de vuelta a esos tokens nunca se publicó. Sin él, no había forma de llevar tu propia música al modelo para hacer ajuste fino.
El truco detrás del nuevo lanzamiento yue2-mothersuperior-realaudio-tokenizer-v4: el modelo se enseña a sí mismo. Cada canción que genera YuE2 viene con los tokens exactos que la produjeron, lo que constituye un ejemplo etiquetado que nadie tuvo que etiquetar a mano. El autor generó unos miles de canciones de muchos géneros, entrenó un codificador pequeño con esos pares y luego lo adaptó a grabaciones reales dejando que el propio decodificador de YuE2 calificara al codificador: si los tokens reconstruían el audio real, eran correctos. Nunca se necesitaron etiquetas de tokens para música real.
Qué incluye el lanzamiento
El repositorio del tokenizer trae tres piezas:
- Cabeza del tokenizer: un transformer de 8 capas (d=512) que mapea las características de la capa 20 de MERT-v2-FullSong a los 32.768 códigos semánticos de YuE2 a 25 Hz. La coincidencia exacta en datos reservados de las propias canciones de YuE2 es del 16,1% top-1, con códigos casi coincidentes que se renderizan de forma casi idéntica, y pruebas de oído round-trip con NAR en torno al 95%.
- LoRA de la rama NAR (
nar_lora_joint_v4): un LoRA de rango 32 sobre las proyecciones de self-attention y MLP del NAR, entrenado conjuntamente con la cabeza sobre audio real para que el decodificador renderice latentes de producción real. - Scripts de entrenamiento e inferencia para que cualquiera pueda repetir o ampliar el pipeline.
El LoRA instrumental
Un LoRA instrumental posterior (ar_lora_inst_v3abc) se entrenó con aproximadamente 2.700 pistas instrumentales de más de 100 géneros, emparejadas con partituras ABC anotadas con acordes. Hace que YuE2 escriba música instrumental con un plan de secciones, y está pensado para ejecutarse con chain-of-thought activado (cot="full"), donde el modelo escribe primero su propia partitura ABC y después los tokens musicales condicionados por esa partitura.
El campo de letra acepta tres estilos de prompting estructural, entrenados a partes iguales:
- Simple: solo
[instrumental], dejando que el modelo elija la estructura y la duración. - Etiquetas sin tiempo: tú eliges el orden de las secciones y el modelo elige la temporización, por ejemplo
[intro]/[verse]/[chorus]/[bridge]/[chorus]/[outro]. - Etiquetas con tiempo: cada sección también recibe una hora de inicio y de fin, como
[verse 0:15-0:45], la indicación estructural más fuerte, aunque el modelo sigue mejor el orden y las proporciones de las secciones que los tiempos de fin absolutos.
Cómo usarlo en ComfyUI
Ambos LoRA incluyen una variante *_comfyui.safetensors empaquetada para el diseño nativo de YuE2 en ComfyUI (claves qkv / gate_up fusionadas):
nar_lora_joint_v4_comfyui.safetensorsse carga en un LoraLoader estándar sobre la salida MODEL del cargador de checkpoint de YuE2.ar_lora_inst_v3abc_comfyui.safetensorsse carga sobre la salida CLIP, porque el planificador AR vive en el slot CLIP, y requiere que elmodede los nodos YuE2 Generate esté en full con un nodo ABC conectado.
La primera versión del LoRA instrumental en Reddit no se activaba en ComfyUI debido a las convenciones de nombres de capas de ComfyUI; el autor publicó el archivo compatible en cuestión de minutos, y los usuarios del hilo confirmaron la corrección con reacciones como "Es tan, tan bueno. Eres un mago".
El efecto en el ecosistema
El codificador desbloquea una oleada de trabajo derivado que antes estaba bloqueado: el propio adaptador Hum-to-Song del autor (tarareas una melodía y YuE2 produce la canción completa), un paquete de nodos de entrenamiento de LoRA hecho por la comunidad, y LoRAs de género o de artista entrenados con grabaciones reales. El autor señala que el entrenamiento de LoRA para YuE2 "empezará a aparecer por todas partes ahora", ya que cualquiera puede entrenar su propia música en un LoRA usando estos scripts.
Disponibilidad
Los pesos son gratis en Hugging Face: el tokenizer de audio real v4, el LoRA instrumental y el adaptador hum-to-song. En ComfyUI, emparéjalos con los nodos nativos del pipeline YuE2; los archivos LoRA compatibles con ComfyUI se cargan directamente con los cargadores de LoRA estándar, sin necesidad de conversión.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.