MiniMax Music 3: ComfyUI 지원 오픈 음악 생성 모델
MiniMax가 최대 5분 길이의 완성된 곡을 표현력 있는 보컬, 구조화된 캡션과 가사로 생성하는 오픈 음악 모델 Music 3를 출시합니다. ComfyUI를 기본 지원합니다.
개요
MiniMax Music 3는 MiniMax의 오픈 음악 생성 모델로, 공식 데모 페이지와 함께 출시되었습니다. 구조적으로 일관된 곡을 표현력 있는 보컬, 변화하는 편곡, 안정적인 장시간 오디오 품질로 생성하며, 32kHz 16비트 스테레오 WAV 오디오를 출력합니다.
MiniMax Music 3 공식 배너
이 모델은 전역 음악 모델링과 로컬 음향 모델링을 분리하는 계층적 오토리그레시브(Hybrid-LM) 아키텍처를 사용합니다.
- **글로벌 LLM(8B)**은 첫 번째 RVQ 코드북을 프레임 단위로 예측하며 곡의 장기적인 의미 및 구조적 전개를 모델링합니다. Qwen3-8B에서 초기화되었습니다.
- **로컬 LLM(0.6B)**은 각 프레임 내의 나머지 음향 코드북을 예측하고 세밀한 음향 디테일을 복원합니다.
- Flow Matching(2.4B) 기반의 연속 숨김 상태 합성 시스템과 Flow-VAE 디코더(123M)가 융합된 숨김 상태를 파형 오디오로 변환하여 보컬 발음과 악기 질감을 보존합니다.
MiniMax Music 3 아키텍처: Flow Matching 및 Flow-VAE 합성을 갖춘 Hybrid-LM
주요 기능
최대 5분 길이의 완성된 곡. 이 모델은 인트로, 벌스, 프리코러스, 코러스, 브리지, 인스트루멘탈 브레이크, 아웃트로 등의 구조를 갖춘 풀 송 생성을 기본 지원하며, 긴 시퀀스 전반에 걸쳐 음악적 테마, 리듬, 보컬 정체성, 편곡 전개를 유지합니다.
두 가지 입력 제어. MiniMax Music 3는 상호 보완적인 두 가지 입력을 받습니다.
- 가사는 노래할 단어를 정의하며
[Intro],[Verse],[Pre-Chorus],[Chorus],[Bridge],[Instrumental],[Solo],[Outro]와 같은 명시적 섹션 태그를 포함할 수 있습니다. - 음악 설명은 음악 스타일, 감정의 전개, 보컬 퍼포먼스, 악기 구성, 편곡, 프로덕션 프로필을 정의합니다. 세 개의 섹션(전역 메타데이터, 보컬 세부 정보, 편곡)으로 구성된 **구조화된 캡션(Structured Caption)**은 곡의 음악적 전개를 시간에 따라 정밀하게 제어할 수 있게 해줍니다.
표현력 있는 보컬. 멜로디, 발음, 레이어드 하모니를 제어할 수 있는 자연스러운 보컬 합성.
뮤직 토크나이저. 학습에는 Residual Vector Quantization(RVQ)의 8개 레이어가 사용됩니다. 16,384개 항목의 시맨틱 코드북 1개와 각각 1,024개 항목의 음향 코드북 7개로 구성됩니다.
ComfyUI 지원
ComfyUI는 공식 예제 워크플로인 MiniMax Music 3 Text to Music을 통해 MiniMax Music 3를 기본 지원합니다. 이 워크플로는 템플릿 라이브러리(Audio 카테고리)나 공식 ComfyUI 튜토리얼에서 찾을 수 있습니다.
MiniMax Music 3 Text to Music 공식 워크플로 템플릿
ComfyUI에서 바로 사용할 수 있는 모델 파일(리패키징된 diffusion 모델, 텍스트 인코더, VAE)은 Comfy-Org/MiniMax-Music-3 저장소에 있으며, 원본 가중치는 MiniMaxAI/MiniMax-Music3에 있습니다.
가중치 및 변형
| 파일 | 폴더 | 크기 |
|---|---|---|
minimax_music3_dit_fp16.safetensors | diffusion_models | 4.9 GB |
minimax_music3_dit_fp32.safetensors | diffusion_models | 9.8 GB |
minimax_music3_dit_int8_convrot.safetensors | diffusion_models | 2.5 GB |
minimax_music3_text_encoder_bf16.safetensors | text_encoders | 18.5 GB |
minimax_music3_text_encoder_pruned_bf16.safetensors | text_encoders | 16.7 GB |
minimax_music3_text_encoder_pruned_int8_convrot.safetensors | text_encoders | 9.2 GB |
minimax_music3_dav.safetensors | vae | 217 MB |
풀 프리시전 모델은 24GB 미만의 VRAM에 맞습니다. 자동 CPU 오프로딩을 사용하면 생성 시 약 22GB가 필요하며, 언어 모델을 레이어 단위로 스트리밍하면 8GB VRAM 카드에서도 실행할 수 있습니다.
사용 가능 환경
이 모델은 서빙을 위해 SGLang-Omni를 지원하며, diffusers 파이프라인이 모듈형 파이프라인으로 제공됩니다. ComfyUI에서 최신 버전으로 업데이트한 후 템플릿 라이브러리를 열고 MiniMax Music 3 Text to Music 워크플로를 선택하면 필수 모델 파일 다운로드를 안내합니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.