YuE2 실제 오디오 인코더: 직접 만든 음악을 YuE2로 가져오기
커뮤니티가 만든 YuE2-3B용 누락된 오디오 인코더로, 자신의 녹음을 LoRA 학습용 시맨틱 토큰으로 변환합니다. 섹션 프롬프트를 지원하는 인스트루멘탈 LoRA도 함께 제공됩니다.
YuE2가 끝내 제공하지 않은 퍼즐 조각
YuE2-3B는 스타일 프롬프트와 가사로 완성된 곡을 생성합니다. 내부적으로는 오디오로 디코딩되는 "시맨틱 토큰"을 작성하지만, 기존 녹음을 그 토큰으로 되돌리는 인코더는 공개되지 않았습니다. 그것이 없으면 자신의 음악을 모델에 가져와 파인튜닝할 방법이 없었습니다.
새로운 yue2-mothersuperior-realaudio-tokenizer-v4 공개 뒤에 숨은 비결은 모델이 스스로를 가르친다는 점입니다. YuE2가 생성한 모든 곡에는 그것을 만들어낸 정확한 토큰이 함께 제공되며, 이는 누구도 수작업으로 라벨링할 필요가 없는 레이블된 예시입니다. 작성자는 여러 장르에 걸쳐 수천 곡을 생성하고 그 쌍으로 작은 인코더를 학습시킨 뒤, YuE2 자체 디코더가 인코더를 평가하도록 하여 실제 녹음에 적응시켰습니다. 즉 토큰이 실제 오디오를 재구성해냈다면 그것이 정답인 셈입니다. 실제 음악에 대한 토큰 레이블은 전혀 필요하지 않았습니다.
공개된 구성
tokenizer 저장소는 세 가지를 제공합니다:
- Tokenizer head: MERT-v2-FullSong 레이어-20 특징을 YuE2의 32,768개 시맨틱 코드(25 Hz)로 매핑하는 8층 트랜스포머(d=512)입니다. YuE2 자체 곡에 대한 홀드아웃 정확 일치율은 top-1 기준 16.1%이고, 근접 코드는 거의 동일하게 렌더링되며, NAR 왕복 청취 테스트는 약 95% 수준입니다.
- NAR 브랜치 LoRA (
nar_lora_joint_v4): NAR self-attention과 MLP 프로젝션에 적용된 rank-32 LoRA로, head와 함께 실제 오디오에서 공동 학습되어 디코더가 실제 프로덕션 latent를 렌더링하도록 합니다. - 학습 및 추론 스크립트: 누구나 파이프라인을 반복하거나 확장할 수 있습니다.
인스트루멘탈 LoRA
후속 인스트루멘탈 LoRA(ar_lora_inst_v3abc)는 100개 이상의 장르에 걸친 약 2,700개 인스트루멘탈 트랙을 코드가 주석된 ABC 악보와 짝지어 학습되었습니다. 이 LoRA는 YuE2가 섹션 계획을 세워 인스트루멘탈 음악을 작성하도록 하며, chain-of-thought를 켠 상태(cot="full")로 실행하도록 설계되었습니다. 이 모드에서는 모델이 먼저 자체적으로 ABC 악보를 작성한 뒤, 그 악보를 조건으로 음악 토큰을 생성합니다.
가사 필드는 세 가지 구조 프롬프트 방식을 받아들이며, 각각 동일한 비중으로 학습되었습니다:
- Bare:
[instrumental]만 사용하고, 구조와 길이는 모델이 선택합니다. - 무시간 태그(Untimed tags): 섹션 순서는 사용자가 정하고 타이밍은 모델이 정합니다. 예를 들어
[intro]/[verse]/[chorus]/[bridge]/[chorus]/[outro]와 같습니다. - 시간 지정 태그(Timed tags): 각 섹션에
[verse 0:15-0:45]처럼 시작과 끝 시간을 함께 지정합니다. 가장 강력한 구조 제어 방식이지만, 모델은 절대적인 종료 시간보다 섹션 순서와 비율을 더 잘 따릅니다.
ComfyUI에서 사용하기
두 LoRA 모두 ComfyUI 네이티브 YuE2 레이아웃(qkv / gate_up 키 퓨즈)에 맞게 패킹된 *_comfyui.safetensors 변형을 제공합니다:
nar_lora_joint_v4_comfyui.safetensors는 YuE2 checkpoint 로더의 MODEL 출력에 연결된 표준 LoraLoader에 로드합니다.ar_lora_inst_v3abc_comfyui.safetensors는 AR 플래너가 CLIP 슬롯에 있기 때문에 CLIP 출력에 로드하며, YuE2 Generate 노드의mode를 full로 설정하고 ABC 노드를 연결해야 합니다.
인스트루멘탈 LoRA의 첫 Reddit 버전은 ComfyUI의 레이어 명명 규칙 때문에 ComfyUI에서 작동하지 않았습니다. 작성자는 몇 분 만에 호환 파일을 공개했고, 스레드의 사용자들은 "It's so, so good. You're a wizard"와 같은 반응으로 수정을 확인했습니다.
생태계에 미친 영향
이 인코더는 이전까지 막혀 있던 후속 작업의 물결을 열었습니다: 작성자 자신의 Hum-to-Song 어댑터(멜로디를 흥얼거리면 YuE2가 완곡을 생성), 커뮤니티 LoRA 학습기 노드 팩, 그리고 실제 녹음으로 학습된 장르 또는 아티스트 LoRA 등입니다. 작성자는 이제 누구나 이 스크립트를 사용해 자신의 음악을 LoRA로 학습할 수 있기 때문에 YuE2용 LoRA 학습이 "이제 어디서나 등장하기 시작할 것"이라고 언급했습니다.
사용 가능 여부
가중치는 Hugging Face에서 무료로 제공됩니다: real-audio tokenizer v4, 인스트루멘탈 LoRA, 그리고 hum-to-song 어댑터입니다. ComfyUI에서는 네이티브 YuE2 파이프라인 노드와 함께 사용하세요. ComfyUI 호환 LoRA 파일은 별도 변환 없이 기본 LoRA 로더로 바로 로드됩니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.