ComfyUI에서 직접 나만의 YuE2 LoRA 학습하기

ComfyUI Wikinews

ComfyUI-YuE2-Trainer는 YuE2-3B 음악 모델의 LoRA 학습을 ComfyUI 노드로 가져옵니다. mp3 또는 wav 파일을 넣고 트리거 단어를 지정하면 기본 로더에서 바로 쓸 수 있는 LoRA가 나옵니다.

ComfyUI-YuE2-TrainerYuE2-3B용 LoRA 학습을 ComfyUI 노드 그래프 안으로 가져옵니다. mp3, wav, flac 파일이 담긴 폴더를 넣고 트리거 단어를 설정한 뒤 실행 대기열에 넣으면, 네이티브 YuE2 checkpoint에서 기본 LoRA 로더로 로드되는 표준 safetensors LoRA가 만들어집니다. 캡션 파일도, 외부 학습 스크립트도 필요 없고 ComfyUI를 벗어날 일도 없습니다.
ComfyUI의 YuE2 LoRA Trainer 노드 그래프

무엇을 어떻게 학습하는가

YuE2-3B는 스타일 프롬프트와 가사로 완성된 곡을 생성하며, 내부적으로 세 부분으로 구성됩니다. 곡을 설계하고 의미 토큰을 작성하는 2.2B AR 언어 모델, 64채널 VAE latent를 사운드로 렌더링하는 1.5B NAR flow-matching 분기, 그리고 48 kHz 스테레오 VAE입니다. 트레이너는 AR "작곡" 분기를 고정하고(m-a-p는 audio-to-token 인코더나 그 학습 코드를 공개하지 않았습니다) 공개된 flow-matching 목적 함수를 사용해 NAR 분기에만 LoRA 어댑터를 학습합니다.

따라서 결과물은 음성 복제가 아니라 스타일, 악기 구성, 보컬 음색 LoRA입니다. 학습은 캡션 없이 진행됩니다. 오디오 파일은 한 번 VAE latent로 인코딩되어 디스크에 캐시되고, 트리거 단어는 YuE2의 checkpoint 네이티브 텍스트 접두사([Tags] your_trigger_word, caption ...)를 통해 주입됩니다. 더 세밀한 제어를 원한다면 파일마다 같은 이름의 .txt 캡션을 선택적으로 지원합니다.

저장된 LoRA는 네이티브 ComfyUI 형식의 표준 *.safetensors이며, models/loras/에 넣고 네이티브 YuE2 checkpoint에서 기본 LoraLoaderModelOnly 노드로 로드하면 됩니다. 변환 단계는 없습니다.

요구 사항

  • 단일 파일 네이티브 YuE2 checkpoint: Comfy-Org/YuE2yue2_3b_bf16.safetensors(~7.8 GB)이며, 네이티브 생성 노드가 사용하는 것과 같은 파일입니다. bf16 파일을 사용하세요. INT8로 재패키징된 버전은 학습할 수 없습니다.
  • 24 GB VRAM 권장 (RTX 5090 Laptop 24 GB에서 테스트).
  • 이 노드 팩은 독립 실행형입니다. 공식 YuE2 모델 코드(m-a-p의 yue2_infer, Apache-2.0, 수정 없음)가 함께 포함되어 있어 다른 커스텀 노드가 필요하지 않습니다.

작성자 설정과 초기 피드백

작성자가 권장하는 레시피는 weight 2.0으로 5000 스텝이며, LoRA는 convrot 변형보다 FP16 모델에서 더 잘 작동합니다. 초기 커뮤니티 피드백은 엇갈립니다. 첫 번째 이슈에서는 학습된 LoRA가 귀에 들리는 효과가 없다고 보고하고, 음성 복제는 작동하지 않는 것으로 명시되어 있으므로, 아직 공개적으로 개선 중인 실험적 도구로 취급하세요. 이 프로젝트에는 이미 더 넓은 학습 범위를 탐색하는 포크가 있으며, 그중 하나는 음향 모델과 플래너 CLIP을 함께 학습합니다.

사용 가능 여부

트레이너는 GitHub의 Starnodes2024/ComfyUI-YuE2-Trainer에서 무료로 제공됩니다(작성 시점 기준 스타 51개). ComfyUI-Manager로 설치하거나 custom_nodes에 git clone 하세요.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
ComfyUI에서 직접 나만의 YuE2 LoRA 학습하기 | ComfyUI Wiki