NVIDIA H3 スーパー加速:MiniMax H3 動画が最大 27.7 倍高速化

ComfyUI Wikinews

NVIDIA Sol Engine は MiniMax H3 を 4 ステップのドラフトと 3 ステップの LTX リファインメントとして実行します:GB200 1 台で 5 秒 768p 動画が 6.85 秒、SGLang より最大 27.7 倍高速。

MiniMax H3 スーパー加速 (公式ページ) は、NVIDIA SANA チームによる NVIDIA Sol Engine パイプラインで、MiniMax H3 動画生成を 2 つのステージジョブに変換します:速度用 LoRA を備えた H3 の 4 ステップ 896×512 ドラフト、その後ターゲット解像度での 3 ステップ LTX リファインメントパス(Sol-Attn 使用)。単一の NVIDIA GB200 で測定した結果、5 秒 1344×768 動画は 6.85 秒、10 秒動画は 14.93 秒でレンダリングされ、公開された SGLang ベースラインよりそれぞれ 22.2 倍、27.7 倍高速です。
NVIDIA H3 スーパー加速:10 秒 1440p 都市群衆の結果

NVIDIA ページに掲載されているスタンドアロンの 1440p 結果の一つ(10 秒、2560×1440):2 ステージ加速、1440p に対応するベースラインは記録されていません。

仕組み

フル解像度で多くの H3 denoising ステップを実行する代わりに、H3 スーパー加速は短い低解像度のドラフトで生成作業の大部分を行い、軽量なリファインメントパスで高解像度の詳細を復元します。各ステージは 1 つのジョブであり、2 つのステージは 1 つの GB200 で順次実行されます:

ステージモデル解像度FPSステップ数出力
ステージ 1・ドラフトMiniMax-H3 + 速度 LoRA896×512244ドラフト動画
ステージ 2・リファインLTX-2.5 + Sol-Attn768p / 1080p / 2K243最終動画

ステージ 1 では、LightX2V MiniMax-H3 Turbo LoRA を使用して、4 つの denoising ステップで 896×512 の初期動画を生成します。ステージ 2 では、ドラフトを要求された出力解像度にアップサンプリングし、高解像度の詳細と一貫性を復元する 3 ステップの Sol-Attn パスを実行します。この pipeline は SGLang ベースラインとビット単位で正確ではありません:サンプリングパスが変更されるため、詳細、テクスチャ、動き、または音声に違いが生じる可能性があります。NVIDIA ページのペア動画でそのトレードオフを直接判断できます。

測定されたレイテンシ

最新の Sol-Super 結果(Sol-Attn を使用してステージ 2 サービス全体を行う)に基づく、単一の NVIDIA GB200 でのエンドツーエンドレイテンシ:

解像度再生時間DiffusersSGLangSol EngineSol-Super E2Evs. SGLang
1344×7685 s167.8 s152.3 s45.4 s6.852 s22.2×
1344×76810 s468.2 s414.1 s132.5 s14.931 s27.7×

この 2 つの高速化は異なる箇所から来ています。ステージ 1 では公式 H3 VAE デコード(3.427 秒)を TAEH3 軽量デコーダー(0.028 秒)に置き換え、ステージ 2 では密な LTX-2.5 Video VAE デコーダー(一致した 121 フレームデコードで 6.404 秒)を Sol-Attn リファイナーと LTX TAEHV 最終デコードに置き換えます。ステージ 2 エンコーダーは意図的に変更されていません:リファイナーはオリジナルの LTX-2.5 VAE latent 分布でトレーニングされています。

768p 出力の場合、測定されたスループットは、完全に稼働している GB200 1 台あたり約 525 本の 5 秒動画/時間で、SGLang ベースラインの 23.6 と比較されます。

ビジュアル比較

NVIDIA ページでは、各 768p および 1080p サンプルを、同じ生成入力を使用した対応する SGLang ベースライン実行とペアにしています:

SGLang ベースラインH3 スーパー加速
768p 5 秒 日本街、SGLang ベースライン768p 5 秒 日本街、加速済み
混雑した日本の街角で男女が緊張したやり取りをする(1344×768、5 秒)同じ入力、22.2 倍高速
SGLang ベースラインH3 スーパー加速
1080p 5 秒 竹林、SGLang ベースライン1080p 5 秒 竹林、加速済み
竹林で二人の武術家が向かい合っている(1080p、5 秒)同じ入力、加速済み

2 つのスタンドアロン 1440p 結果(10 秒、2560×1440)も、対応するベースラインなしで公開されました:

利用可能性

この pipeline は公開コンポーネントで構築されています:公式 MiniMax-H3 チェックポイント、ドラフトに使用される LightX2V MiniMax-H3 Turbo 4 ステップ LoRA、LTX-2.5 pre-trained チェックポイント、および TAEH3 と LTX TAEHV 軽量デコーダーです。これは GB200 ハードウェア上の NVIDIA Sol Engine で Sol-Attn を使用して実行され、ComfyUI ノードパックではなく、測定されたベンチマークを持つ生産向け参照例として提示されています。執筆時点では、この pipeline に対する NVIDIA からの公式 ComfyUI ワークフローはありませんが、個別の Sol Engine コンポーネント(Sol-Attn パッチなど)のコミュニティポートが登場し始めています。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
NVIDIA H3 スーパー加速:MiniMax H3 動画が最大 27.7 倍高速化 | ComfyUI Wiki