Codificador de audio real YuE2: trae tu propia música a YuE2

ComfyUI Wikinews

El codificador de audio creado por la comunidad convierte tus grabaciones en tokens semánticos para entrenar LoRA en YuE2-3B, más un LoRA instrumental con prompts de sección.

El usuario de Reddit thatisnotmychapstick (que publica los pesos como Mothersuperior en Hugging Face) entrenó el codificador de audio a tokens faltante para YuE2-3B: el componente que m-a-p nunca lanzó y que convierte grabaciones existentes en los tokens semánticos que YuE2 genera. Junto con un LoRA NAR entrenado de forma conjunta y un nuevo LoRA instrumental, cierra el ciclo para entrenar YuE2 con música real y generar pistas instrumentales, todo cargable con los cargadores de LoRA estándar de ComfyUI. El hilo del lanzamiento reunió alrededor de 50 comentarios, con usuarios reproduciendo los resultados en cuestión de horas.
La publicación del lanzamiento del LoRA instrumental de YuE2 con ejemplos de prompts

La pieza faltante que YuE2 nunca lanzó

YuE2-3B genera canciones completas a partir de un prompt de estilo y una letra. Internamente escribe "tokens semánticos" que se decodifican en audio, pero el codificador que mapea una grabación existente de vuelta a esos tokens nunca se publicó. Sin él, no había forma de llevar tu propia música al modelo para hacer ajuste fino.

El truco detrás del nuevo lanzamiento yue2-mothersuperior-realaudio-tokenizer-v4: el modelo se enseña a sí mismo. Cada canción que genera YuE2 viene con los tokens exactos que la produjeron, lo que constituye un ejemplo etiquetado que nadie tuvo que etiquetar a mano. El autor generó unos miles de canciones de muchos géneros, entrenó un codificador pequeño con esos pares y luego lo adaptó a grabaciones reales dejando que el propio decodificador de YuE2 calificara al codificador: si los tokens reconstruían el audio real, eran correctos. Nunca se necesitaron etiquetas de tokens para música real.

El hilo del lanzamiento del codificador

Qué incluye el lanzamiento

El repositorio del tokenizer trae tres piezas:

  • Cabeza del tokenizer: un transformer de 8 capas (d=512) que mapea las características de la capa 20 de MERT-v2-FullSong a los 32.768 códigos semánticos de YuE2 a 25 Hz. La coincidencia exacta en datos reservados de las propias canciones de YuE2 es del 16,1% top-1, con códigos casi coincidentes que se renderizan de forma casi idéntica, y pruebas de oído round-trip con NAR en torno al 95%.
  • LoRA de la rama NAR (nar_lora_joint_v4): un LoRA de rango 32 sobre las proyecciones de self-attention y MLP del NAR, entrenado conjuntamente con la cabeza sobre audio real para que el decodificador renderice latentes de producción real.
  • Scripts de entrenamiento e inferencia para que cualquiera pueda repetir o ampliar el pipeline.

El LoRA instrumental

Un LoRA instrumental posterior (ar_lora_inst_v3abc) se entrenó con aproximadamente 2.700 pistas instrumentales de más de 100 géneros, emparejadas con partituras ABC anotadas con acordes. Hace que YuE2 escriba música instrumental con un plan de secciones, y está pensado para ejecutarse con chain-of-thought activado (cot="full"), donde el modelo escribe primero su propia partitura ABC y después los tokens musicales condicionados por esa partitura.

El campo de letra acepta tres estilos de prompting estructural, entrenados a partes iguales:

  1. Simple: solo [instrumental], dejando que el modelo elija la estructura y la duración.
  2. Etiquetas sin tiempo: tú eliges el orden de las secciones y el modelo elige la temporización, por ejemplo [intro] / [verse] / [chorus] / [bridge] / [chorus] / [outro].
  3. Etiquetas con tiempo: cada sección también recibe una hora de inicio y de fin, como [verse 0:15-0:45], la indicación estructural más fuerte, aunque el modelo sigue mejor el orden y las proporciones de las secciones que los tiempos de fin absolutos.

Cómo usarlo en ComfyUI

Ambos LoRA incluyen una variante *_comfyui.safetensors empaquetada para el diseño nativo de YuE2 en ComfyUI (claves qkv / gate_up fusionadas):

  • nar_lora_joint_v4_comfyui.safetensors se carga en un LoraLoader estándar sobre la salida MODEL del cargador de checkpoint de YuE2.
  • ar_lora_inst_v3abc_comfyui.safetensors se carga sobre la salida CLIP, porque el planificador AR vive en el slot CLIP, y requiere que el mode de los nodos YuE2 Generate esté en full con un nodo ABC conectado.

La primera versión del LoRA instrumental en Reddit no se activaba en ComfyUI debido a las convenciones de nombres de capas de ComfyUI; el autor publicó el archivo compatible en cuestión de minutos, y los usuarios del hilo confirmaron la corrección con reacciones como "Es tan, tan bueno. Eres un mago".

El efecto en el ecosistema

El codificador desbloquea una oleada de trabajo derivado que antes estaba bloqueado: el propio adaptador Hum-to-Song del autor (tarareas una melodía y YuE2 produce la canción completa), un paquete de nodos de entrenamiento de LoRA hecho por la comunidad, y LoRAs de género o de artista entrenados con grabaciones reales. El autor señala que el entrenamiento de LoRA para YuE2 "empezará a aparecer por todas partes ahora", ya que cualquiera puede entrenar su propia música en un LoRA usando estos scripts.

Disponibilidad

Los pesos son gratis en Hugging Face: el tokenizer de audio real v4, el LoRA instrumental y el adaptador hum-to-song. En ComfyUI, emparéjalos con los nodos nativos del pipeline YuE2; los archivos LoRA compatibles con ComfyUI se cargan directamente con los cargadores de LoRA estándar, sin necesidad de conversión.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Codificador de audio real YuE2: trae tu propia música a YuE2 | ComfyUI Wiki