MiniMax Music 3: ComfyUI対応のオープンな音楽生成モデル
MiniMaxがMusic 3を公開:表現力豊かなボーカル、構造化キャプション、歌詞から最大5分の完全な楽曲を生成するオープンな音楽生成モデル。ComfyUIをネイティブサポート。
概要
MiniMax Music 3 はMiniMaxのオープンな音楽生成モデルで、公式デモページとともに公開されました。表現力豊かなボーカル、展開していくアレンジ、安定した長時間音声品質を備えた構造的に一貫性のある楽曲を生成し、32 kHz・16ビット・ステレオのWAV音声を出力します。
MiniMax Music 3公式バナー
このモデルは、グローバルな音楽モデリングとローカルな音響モデリングを分離する階層的自己回帰(Hybrid-LM)アーキテクチャを採用しています:
- グローバルLLM(8B) は最初のRVQコードブックをフレーム単位で予測し、楽曲の長期的な意味的・構造的進行をモデリングします。Qwen3-8Bから初期化されています。
- ローカルLLM(0.6B) は各フレーム内の残りの音響コードブックを予測し、細かい音響の詳細を復元します。
- Flow Matching(2.4B) に基づく連続隠れ状態合成システムとFlow-VAEデコーダー(123M)が、融合された隠れ状態を波形音声に変換し、ボーカルの明瞭な発音と楽器の質感を保持します。
MiniMax Music 3アーキテクチャ:Flow MatchingとFlow-VAE合成によるHybrid-LM
主な特徴
最大5分の完全な楽曲。 このモデルは、イントロ、バース、プレコーラス、コーラス、ブリッジ、インストゥルメンタルブレイク、アウトロなどの構造を持つ全曲生成をネイティブにサポートし、長いシーケンスにわたって音楽テーマ、リズム、ボーカルの個性、アレンジの進行を維持します。
2つの入力による制御。 MiniMax Music 3は、補完的な2つの入力を受け付けます:
- 歌詞 は歌われる言葉を定義し、
[Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Bridge]、[Instrumental]、[Solo]、[Outro]などの明示的なセクションタグを含めることができます。 - 音楽の説明 は、音楽スタイル、感情の展開、ボーカルのパフォーマンス、楽器編成、アレンジ、プロダクションプロフィールを定義します。構造化キャプション(グローバルメタデータ、ボーカルの詳細、アレンジの3つのセクション)により、楽曲の時間的な音楽的発展を正確かつ細かく制御できます。
表現力豊かなボーカル。 メロディ、発音、重層的なハーモニーを制御できる自然なボーカル合成を実現します。
音楽トークナイザー。 トレーニングでは、8レイヤーのResidual Vector Quantization(RVQ)を使用します:16,384エントリのセマンティックコードブック1つと、それぞれ1,024エントリの音響コードブック7つです。
ComfyUIサポート
ComfyUIは、テンプレートライブラリ(Audioカテゴリ)または公式ComfyUIチュートリアルから利用できる公式サンプルワークフロー MiniMax Music 3 Text to Music により、MiniMax Music 3をネイティブにサポートしています。
MiniMax Music 3 Text to Music公式ワークフローテンプレート
ComfyUI対応のモデルファイル(再パックされたdiffusionモデル、テキストエンコーダー、VAE)は Comfy-Org/MiniMax-Music-3 リポジトリにホストされており、オリジナルのウェイトは MiniMaxAI/MiniMax-Music3 にあります。
ウェイトとバリアント
| ファイル | フォルダー | サイズ |
|---|---|---|
minimax_music3_dit_fp16.safetensors | diffusion_models | 4.9 GB |
minimax_music3_dit_fp32.safetensors | diffusion_models | 9.8 GB |
minimax_music3_dit_int8_convrot.safetensors | diffusion_models | 2.5 GB |
minimax_music3_text_encoder_bf16.safetensors | text_encoders | 18.5 GB |
minimax_music3_text_encoder_pruned_bf16.safetensors | text_encoders | 16.7 GB |
minimax_music3_text_encoder_pruned_int8_convrot.safetensors | text_encoders | 9.2 GB |
minimax_music3_dav.safetensors | vae | 217 MB |
フル精度モデルは24 GB未満のVRAMに収まります。自動CPUオフロードによる生成には約22 GBが必要で、言語モデルをレイヤー単位でストリーミングすれば8 GBのGPUでも実行可能です。
利用方法
このモデルはサービング用に SGLang-Omni をサポートしており、diffusersパイプラインがモジュラーパイプラインとして利用できます。ComfyUIでは、最新バージョンに更新してテンプレートライブラリを開き、MiniMax Music 3 Text to Music ワークフローを選択すると、必要なモデルファイルのダウンロードが促されます。
コメント
GitHubでサインインしてディスカッションに参加しましょう。