MiniMax H3: オープンなオムニモーダルビデオ生成モデル
ComfyUI Wiki
MiniMax H3は、ネイティブ32kHzステレオオーディオ、768p出力、2Kインコンテキスト再生成を備えたオープンなオムニモーダルビデオ生成モデルです。ComfyUIをネイティブサポートしています。
M
MiniMax H3
ビデオ生成ネイティブオーディオオムニモーダルテキストから動画へ画像から動画へMiniMax H3は、テキスト、画像、ビデオ、オーディオを同時に理解し、ネイティブ32kHzステレオオーディオ付きの最大15秒のビデオをワンパスで生成する、オープンな汎用オムニモーダル生成モデルです。Qwen3-VL-32Bテキストエンコーダを搭載した33.1B denseシングルストリーム・オムニトランスフォーマーを採用した、MiniMaxのHailuoビデオシリーズ最新モデルです。
| 開発者 | MiniMax |
| リリース日 | 2026-08 |
| アーキテクチャ | 33.1B denseシングルストリーム・オムニトランスフォーマー(13B adaLNブランチ) |
| テキストエンコーダ | Qwen3-VL-32B(レイヤー50の隠れ状態) |
| ビデオVAE | Temporal causal VAE、f16t4d24 |
| オーディオVAE | 32kHzステレオから40Hz潜在トークンへ |
| ライセンス | MiniMax H3コミュニティライセンス |
MiniMax H3は、11言語のいずれでも、ネイティブ32kHzステレオオーディオ付きの最大15秒・24FPSのビデオを生成できます。出力はデフォルトで短辺768pxで、H3-Regenerate-2Kモジュールが2K解像度でインコンテキスト再生成を行います。このモデルは2026年8月3日にMiniMax H3コミュニティライセンス契約のもと正式にオープンソース化され、同日にComfyUIのネイティブサポートがマージされました(Comfy-Org/ComfyUI #15224)。
チェックポイント
| チェックポイント | モード |
|---|---|
| FL2VA | テキストから動画へ、先頭フレーム、最終フレーム、先頭+最終フレーム |
| Ref2VA | 参照ベース: 最大9枚の画像、3本のビデオ、3つのオーディオクリップ(最大12ファイルまで混在可能) |
リソース
Guides and workflows related to this model series.
No articles found.
コメント
GitHubでサインインしてディスカッションに参加しましょう。