YuE2 실제 오디오 인코더: 직접 만든 음악을 YuE2로 가져오기

ComfyUI Wikinews

커뮤니티가 만든 YuE2-3B용 누락된 오디오 인코더로, 자신의 녹음을 LoRA 학습용 시맨틱 토큰으로 변환합니다. 섹션 프롬프트를 지원하는 인스트루멘탈 LoRA도 함께 제공됩니다.

Reddit 사용자 thatisnotmychapstick(Hugging Face에 Mothersuperior로 가중치 공개)이 YuE2-3B누락된 오디오-투-토큰 인코더를 학습시켰습니다. m-a-p가 공개하지 않은 이 구성 요소는 기존 녹음을 YuE2가 생성하는 시맨틱 토큰으로 변환합니다. 함께 학습된 NAR LoRA와 새로운 인스트루멘탈 LoRA를 더하면 실제 음악으로 YuE2를 학습하고 인스트루멘탈 트랙을 생성하는 전체 흐름이 완성되며, 모두 ComfyUI 기본 LoRA 로더로 불러올 수 있습니다. 이 공개 스레드는 약 50개의 댓글을 받았고, 사용자들은 몇 시간 안에 결과를 재현했습니다.
프롬프트 예시와 함께 공개된 YuE2 인스트루멘탈 LoRA 게시물

YuE2가 끝내 제공하지 않은 퍼즐 조각

YuE2-3B는 스타일 프롬프트와 가사로 완성된 곡을 생성합니다. 내부적으로는 오디오로 디코딩되는 "시맨틱 토큰"을 작성하지만, 기존 녹음을 그 토큰으로 되돌리는 인코더는 공개되지 않았습니다. 그것이 없으면 자신의 음악을 모델에 가져와 파인튜닝할 방법이 없었습니다.

새로운 yue2-mothersuperior-realaudio-tokenizer-v4 공개 뒤에 숨은 비결은 모델이 스스로를 가르친다는 점입니다. YuE2가 생성한 모든 곡에는 그것을 만들어낸 정확한 토큰이 함께 제공되며, 이는 누구도 수작업으로 라벨링할 필요가 없는 레이블된 예시입니다. 작성자는 여러 장르에 걸쳐 수천 곡을 생성하고 그 쌍으로 작은 인코더를 학습시킨 뒤, YuE2 자체 디코더가 인코더를 평가하도록 하여 실제 녹음에 적응시켰습니다. 즉 토큰이 실제 오디오를 재구성해냈다면 그것이 정답인 셈입니다. 실제 음악에 대한 토큰 레이블은 전혀 필요하지 않았습니다.

인코더 공개 스레드

공개된 구성

tokenizer 저장소는 세 가지를 제공합니다:

  • Tokenizer head: MERT-v2-FullSong 레이어-20 특징을 YuE2의 32,768개 시맨틱 코드(25 Hz)로 매핑하는 8층 트랜스포머(d=512)입니다. YuE2 자체 곡에 대한 홀드아웃 정확 일치율은 top-1 기준 16.1%이고, 근접 코드는 거의 동일하게 렌더링되며, NAR 왕복 청취 테스트는 약 95% 수준입니다.
  • NAR 브랜치 LoRA (nar_lora_joint_v4): NAR self-attention과 MLP 프로젝션에 적용된 rank-32 LoRA로, head와 함께 실제 오디오에서 공동 학습되어 디코더가 실제 프로덕션 latent를 렌더링하도록 합니다.
  • 학습 및 추론 스크립트: 누구나 파이프라인을 반복하거나 확장할 수 있습니다.

인스트루멘탈 LoRA

후속 인스트루멘탈 LoRA(ar_lora_inst_v3abc)는 100개 이상의 장르에 걸친 약 2,700개 인스트루멘탈 트랙을 코드가 주석된 ABC 악보와 짝지어 학습되었습니다. 이 LoRA는 YuE2가 섹션 계획을 세워 인스트루멘탈 음악을 작성하도록 하며, chain-of-thought를 켠 상태(cot="full")로 실행하도록 설계되었습니다. 이 모드에서는 모델이 먼저 자체적으로 ABC 악보를 작성한 뒤, 그 악보를 조건으로 음악 토큰을 생성합니다.

가사 필드는 세 가지 구조 프롬프트 방식을 받아들이며, 각각 동일한 비중으로 학습되었습니다:

  1. Bare: [instrumental]만 사용하고, 구조와 길이는 모델이 선택합니다.
  2. 무시간 태그(Untimed tags): 섹션 순서는 사용자가 정하고 타이밍은 모델이 정합니다. 예를 들어 [intro] / [verse] / [chorus] / [bridge] / [chorus] / [outro]와 같습니다.
  3. 시간 지정 태그(Timed tags): 각 섹션에 [verse 0:15-0:45]처럼 시작과 끝 시간을 함께 지정합니다. 가장 강력한 구조 제어 방식이지만, 모델은 절대적인 종료 시간보다 섹션 순서와 비율을 더 잘 따릅니다.

ComfyUI에서 사용하기

두 LoRA 모두 ComfyUI 네이티브 YuE2 레이아웃(qkv / gate_up 키 퓨즈)에 맞게 패킹된 *_comfyui.safetensors 변형을 제공합니다:

  • nar_lora_joint_v4_comfyui.safetensors는 YuE2 checkpoint 로더의 MODEL 출력에 연결된 표준 LoraLoader에 로드합니다.
  • ar_lora_inst_v3abc_comfyui.safetensors는 AR 플래너가 CLIP 슬롯에 있기 때문에 CLIP 출력에 로드하며, YuE2 Generate 노드의 modefull로 설정하고 ABC 노드를 연결해야 합니다.

인스트루멘탈 LoRA의 첫 Reddit 버전은 ComfyUI의 레이어 명명 규칙 때문에 ComfyUI에서 작동하지 않았습니다. 작성자는 몇 분 만에 호환 파일을 공개했고, 스레드의 사용자들은 "It's so, so good. You're a wizard"와 같은 반응으로 수정을 확인했습니다.

생태계에 미친 영향

이 인코더는 이전까지 막혀 있던 후속 작업의 물결을 열었습니다: 작성자 자신의 Hum-to-Song 어댑터(멜로디를 흥얼거리면 YuE2가 완곡을 생성), 커뮤니티 LoRA 학습기 노드 팩, 그리고 실제 녹음으로 학습된 장르 또는 아티스트 LoRA 등입니다. 작성자는 이제 누구나 이 스크립트를 사용해 자신의 음악을 LoRA로 학습할 수 있기 때문에 YuE2용 LoRA 학습이 "이제 어디서나 등장하기 시작할 것"이라고 언급했습니다.

사용 가능 여부

가중치는 Hugging Face에서 무료로 제공됩니다: real-audio tokenizer v4, 인스트루멘탈 LoRA, 그리고 hum-to-song 어댑터입니다. ComfyUI에서는 네이티브 YuE2 파이프라인 노드와 함께 사용하세요. ComfyUI 호환 LoRA 파일은 별도 변환 없이 기본 LoRA 로더로 바로 로드됩니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
YuE2 실제 오디오 인코더: 직접 만든 음악을 YuE2로 가져오기 | ComfyUI Wiki