NVIDIA H3 スーパー加速:MiniMax H3 動画が最大 27.7 倍高速化
NVIDIA Sol Engine は MiniMax H3 を 4 ステップのドラフトと 3 ステップの LTX リファインメントとして実行します:GB200 1 台で 5 秒 768p 動画が 6.85 秒、SGLang より最大 27.7 倍高速。
NVIDIA ページに掲載されているスタンドアロンの 1440p 結果の一つ(10 秒、2560×1440):2 ステージ加速、1440p に対応するベースラインは記録されていません。
仕組み
フル解像度で多くの H3 denoising ステップを実行する代わりに、H3 スーパー加速は短い低解像度のドラフトで生成作業の大部分を行い、軽量なリファインメントパスで高解像度の詳細を復元します。各ステージは 1 つのジョブであり、2 つのステージは 1 つの GB200 で順次実行されます:
| ステージ | モデル | 解像度 | FPS | ステップ数 | 出力 |
|---|---|---|---|---|---|
| ステージ 1・ドラフト | MiniMax-H3 + 速度 LoRA | 896×512 | 24 | 4 | ドラフト動画 |
| ステージ 2・リファイン | LTX-2.5 + Sol-Attn | 768p / 1080p / 2K | 24 | 3 | 最終動画 |
ステージ 1 では、LightX2V MiniMax-H3 Turbo LoRA を使用して、4 つの denoising ステップで 896×512 の初期動画を生成します。ステージ 2 では、ドラフトを要求された出力解像度にアップサンプリングし、高解像度の詳細と一貫性を復元する 3 ステップの Sol-Attn パスを実行します。この pipeline は SGLang ベースラインとビット単位で正確ではありません:サンプリングパスが変更されるため、詳細、テクスチャ、動き、または音声に違いが生じる可能性があります。NVIDIA ページのペア動画でそのトレードオフを直接判断できます。
測定されたレイテンシ
最新の Sol-Super 結果(Sol-Attn を使用してステージ 2 サービス全体を行う)に基づく、単一の NVIDIA GB200 でのエンドツーエンドレイテンシ:
| 解像度 | 再生時間 | Diffusers | SGLang | Sol Engine | Sol-Super E2E | vs. SGLang |
|---|---|---|---|---|---|---|
| 1344×768 | 5 s | 167.8 s | 152.3 s | 45.4 s | 6.852 s | 22.2× |
| 1344×768 | 10 s | 468.2 s | 414.1 s | 132.5 s | 14.931 s | 27.7× |
この 2 つの高速化は異なる箇所から来ています。ステージ 1 では公式 H3 VAE デコード(3.427 秒)を TAEH3 軽量デコーダー(0.028 秒)に置き換え、ステージ 2 では密な LTX-2.5 Video VAE デコーダー(一致した 121 フレームデコードで 6.404 秒)を Sol-Attn リファイナーと LTX TAEHV 最終デコードに置き換えます。ステージ 2 エンコーダーは意図的に変更されていません:リファイナーはオリジナルの LTX-2.5 VAE latent 分布でトレーニングされています。
768p 出力の場合、測定されたスループットは、完全に稼働している GB200 1 台あたり約 525 本の 5 秒動画/時間で、SGLang ベースラインの 23.6 と比較されます。
ビジュアル比較
NVIDIA ページでは、各 768p および 1080p サンプルを、同じ生成入力を使用した対応する SGLang ベースライン実行とペアにしています:
| SGLang ベースライン | H3 スーパー加速 |
|---|---|
![]() | ![]() |
| 混雑した日本の街角で男女が緊張したやり取りをする(1344×768、5 秒) | 同じ入力、22.2 倍高速 |
| SGLang ベースライン | H3 スーパー加速 |
|---|---|
![]() | ![]() |
| 竹林で二人の武術家が向かい合っている(1080p、5 秒) | 同じ入力、加速済み |
2 つのスタンドアロン 1440p 結果(10 秒、2560×1440)も、対応するベースラインなしで公開されました:
利用可能性
この pipeline は公開コンポーネントで構築されています:公式 MiniMax-H3 チェックポイント、ドラフトに使用される LightX2V MiniMax-H3 Turbo 4 ステップ LoRA、LTX-2.5 pre-trained チェックポイント、および TAEH3 と LTX TAEHV 軽量デコーダーです。これは GB200 ハードウェア上の NVIDIA Sol Engine で Sol-Attn を使用して実行され、ComfyUI ノードパックではなく、測定されたベンチマークを持つ生産向け参照例として提示されています。執筆時点では、この pipeline に対する NVIDIA からの公式 ComfyUI ワークフローはありませんが、個別の Sol Engine コンポーネント(Sol-Attn パッチなど)のコミュニティポートが登場し始めています。




コメント
GitHubでサインインしてディスカッションに参加しましょう。