MiniMax H3: オープンなオムニモーダルビデオ生成モデル

ComfyUI Wiki

MiniMax H3は、ネイティブ32kHzステレオオーディオ、768p出力、2Kインコンテキスト再生成を備えたオープンなオムニモーダルビデオ生成モデルです。ComfyUIをネイティブサポートしています。

M

MiniMax H3

ビデオ生成ネイティブオーディオオムニモーダルテキストから動画へ画像から動画へ

MiniMax H3は、テキスト、画像、ビデオ、オーディオを同時に理解し、ネイティブ32kHzステレオオーディオ付きの最大15秒のビデオをワンパスで生成する、オープンな汎用オムニモーダル生成モデルです。Qwen3-VL-32Bテキストエンコーダを搭載した33.1B denseシングルストリーム・オムニトランスフォーマーを採用した、MiniMaxのHailuoビデオシリーズ最新モデルです。

開発者MiniMax
リリース日2026-08
アーキテクチャ33.1B denseシングルストリーム・オムニトランスフォーマー(13B adaLNブランチ)
テキストエンコーダQwen3-VL-32B(レイヤー50の隠れ状態)
ビデオVAETemporal causal VAE、f16t4d24
オーディオVAE32kHzステレオから40Hz潜在トークンへ
ライセンスMiniMax H3コミュニティライセンス

MiniMax H3は、11言語のいずれでも、ネイティブ32kHzステレオオーディオ付きの最大15秒・24FPSのビデオを生成できます。出力はデフォルトで短辺768pxで、H3-Regenerate-2Kモジュールが2K解像度でインコンテキスト再生成を行います。このモデルは2026年8月3日にMiniMax H3コミュニティライセンス契約のもと正式にオープンソース化され、同日にComfyUIのネイティブサポートがマージされました(Comfy-Org/ComfyUI #15224)。

チェックポイント

チェックポイントモード
FL2VAテキストから動画へ、先頭フレーム、最終フレーム、先頭+最終フレーム
Ref2VA参照ベース: 最大9枚の画像、3本のビデオ、3つのオーディオクリップ(最大12ファイルまで混在可能)

リソース

Guides and workflows related to this model series.

No articles found.

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…