MiniMax H3 Acc LoRA: ComfyUI での公式 8 ステップ PDD 蒸留

ComfyUI Wikinews

Alibaba PAI が MiniMax H3 用の PDD 加速 LoRA を提供:CFG なしで 8 または 4 サンプラーステップの完全音声・動画生成、およびネイティブ ComfyUI ノードパック付き。

MiniMax-H3-Acc-LoRAs (Hugging Face | VideoX-Fun | arXiv) は、Alibaba PAI から公式リリースされたもので、MiniMax H3 に並列デコーディング蒸留(PDD)を適用したものです。2 つの加速アダプターは、分類器フリーガイダンスなしで 8 または 4 サンプラーステップ で統合動画と同期音声をレンダリングし、専用の ComfyUI ノードパックにより、このリリースをネイティブな ComfyUI ワークフローに持ち込みます。
モデルカードからの Ref2VA テストケース

概要

2 つの -Acc-8Step ファイルは通常の LoRA ではありません。ランク 64 のトランク LoRA(network_alpha = 64、BF16)に加えて、各チェックポイントは 並列デコーディング蒸留ヘッドバンク を搭載しています:これは各間隔ごとの最終層の動画および音声投影の 32 コピーであり、各サンプラーステップで単一の平均ブロック速度ヘッドに融合されます。通常の LoRA ローダーではこれらのファイルを読み取れず、ヘッドバンクを削除すると蒸留が静かに失われます。

  • 8 ステップ、CFG なし — 生成は guidance_scale = 1.0 で実行され、ステップあたり 1 つの順方向パスのみで動作します;ガイダンスはアダプターに蒸留されています。
  • 1 つのパスで音声+動画 — 蒸留は視覚的なフレームだけでなく、統合音声ストリームをカバーします。
  • 2 つのトランク — 1 つのアダプターは FL2VA(テキスト/初末フレーム条件付き)チェックポイントを対象とし、もう 1 つは Ref2VA(参照条件付き)チェックポイントを対象とします。
  • 公式リリース — Shaul らの PDD 方法に従い(arXiv 2607.26004)、2026 年 8 月 26 日に Alibaba PAI によって公開されました。

ウェイト

ファイルサイズターゲットベースリンク
MiniMax-H3-FL2VA-Acc-8Step.safetensors1.4 GBMiniMax-H3 (FL2VA)HF
MiniMax-H3-Ref2VA-Acc-8Step.safetensors1.4 GBMiniMax-H3 (Ref2VA)HF

各ファイルは BF16 で 1.4 GB、ランク 64 であり、ベース H3 トランスフォーマーに対して強度 1.0 で適用されます。FL2VA アダプターを FL2VA U-Net とペアにし、Ref2VA アダプターを Ref2VA U-Net とペアにします(bf16 オリジナルまたは int8 convrot ビルドの両方が動作します)。

結果

Acc-8Step アダプター(LoRA 重み 1.0)で生成された公式デモサンプル:

FL2VA

FL2VA Acc-8Step アダプターによるテキストから動画へ

Ref2VA

Ref2VA Acc-8Step アダプターによる参照から動画へ

モデルカードには、非蒸留ベースラインおよびコミュニティ製 Minimax-h3-Turbo 4 ステップ LoRA との並列比較も同梱されています。

ComfyUI サポート

Jalen-Brunson による ComfyUI-MiniMax-H3-PDD-Acc は、このリリース用のネイティブ ComfyUI ノードを追加します。MiniMaxH3PDDAccApply ノードはトランク LoRA を適用し、最終層に PDD ヘッドバンクをインストールします。sigma でステップごとに設定されるため、ループおよびチャンク化されたサンプラーが同期状態を維持します。コンパニオン scheduler ノードは、部分デノイズワークフロー用の訓練済みの sigma グリッドを出力します。

訓練レシピは厳格です:

  • サンプラー — Euler; 各ステップは 1 つの平均ブロック速度を消費するため、マルチステージサンプラーはグリッド外で評価されます。
  • ステップ — 8(デフォルト、訓練済みブロックサイズ)、4(公式承認の再グループ化)、または 6(不均一 8,8,4,4,4,4 パーティション)。他のステップ数はノードによって拒否され、静かに劣化することはありません。
  • ガイダンスBasicGuider とともに CFG 1.0。
  • シフトシグマ — 正確に 12.0 / 3.0。
  • 剪定済みチェックポイント — 剪定済み(カーブテーブル)H3 U-Net では、50 の高密度 adaLN LoRA モジュールが自動的にモデルのカーブ基底に再ベースされます。

これらのアダプターを使用する際は、他の蒸留 LoRA(lightx2v turbo など)を削除してください — 蒸留はスタックしません。キャラクター LoRA は通常スタックします。

2 つの形式がサポートされています:元の Alibaba ファイル(ノードによりメモリ内で変換)または aptech0081/MiniMax-H3-Acc-LoRAs-ComfyUI による事前変換された ComfyUI キー再配布(ファイルあたり 1.7 GB)。

利用可能性

ComfyUI 以外では、アダプターは VideoX-Fun 推論パイプラインを通じて実行されます。VideoX-Funpredict_t2v.py (FL2VA) または predict_ref2v.py (Ref2VA) 例スクリプトで model_path および pdd_lora_path を設定します。これらは Diffusers の MiniMax-H3 ModularPipeline を使用し、diffusers >= 0.40.0 が必要です。各例は apply_pdd_lora でチェックポイントをロードし、構成から必要な推論ステップ数を導出します。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
MiniMax H3 Acc LoRA: ComfyUI での公式 8 ステップ PDD 蒸留 | ComfyUI Wiki