MiniMax H3 Acc LoRA: ComfyUI での公式 8 ステップ PDD 蒸留
Alibaba PAI が MiniMax H3 用の PDD 加速 LoRA を提供:CFG なしで 8 または 4 サンプラーステップの完全音声・動画生成、およびネイティブ ComfyUI ノードパック付き。
概要
2 つの -Acc-8Step ファイルは通常の LoRA ではありません。ランク 64 のトランク LoRA(network_alpha = 64、BF16)に加えて、各チェックポイントは 並列デコーディング蒸留ヘッドバンク を搭載しています:これは各間隔ごとの最終層の動画および音声投影の 32 コピーであり、各サンプラーステップで単一の平均ブロック速度ヘッドに融合されます。通常の LoRA ローダーではこれらのファイルを読み取れず、ヘッドバンクを削除すると蒸留が静かに失われます。
- 8 ステップ、CFG なし — 生成は
guidance_scale = 1.0で実行され、ステップあたり 1 つの順方向パスのみで動作します;ガイダンスはアダプターに蒸留されています。 - 1 つのパスで音声+動画 — 蒸留は視覚的なフレームだけでなく、統合音声ストリームをカバーします。
- 2 つのトランク — 1 つのアダプターは FL2VA(テキスト/初末フレーム条件付き)チェックポイントを対象とし、もう 1 つは Ref2VA(参照条件付き)チェックポイントを対象とします。
- 公式リリース — Shaul らの PDD 方法に従い(arXiv 2607.26004)、2026 年 8 月 26 日に Alibaba PAI によって公開されました。
ウェイト
| ファイル | サイズ | ターゲットベース | リンク |
|---|---|---|---|
MiniMax-H3-FL2VA-Acc-8Step.safetensors | 1.4 GB | MiniMax-H3 (FL2VA) | HF |
MiniMax-H3-Ref2VA-Acc-8Step.safetensors | 1.4 GB | MiniMax-H3 (Ref2VA) | HF |
各ファイルは BF16 で 1.4 GB、ランク 64 であり、ベース H3 トランスフォーマーに対して強度 1.0 で適用されます。FL2VA アダプターを FL2VA U-Net とペアにし、Ref2VA アダプターを Ref2VA U-Net とペアにします(bf16 オリジナルまたは int8 convrot ビルドの両方が動作します)。
結果
Acc-8Step アダプター(LoRA 重み 1.0)で生成された公式デモサンプル:
FL2VA
FL2VA Acc-8Step アダプターによるテキストから動画へ
Ref2VA
Ref2VA Acc-8Step アダプターによる参照から動画へ
モデルカードには、非蒸留ベースラインおよびコミュニティ製 Minimax-h3-Turbo 4 ステップ LoRA との並列比較も同梱されています。
ComfyUI サポート
Jalen-Brunson による ComfyUI-MiniMax-H3-PDD-Acc は、このリリース用のネイティブ ComfyUI ノードを追加します。MiniMaxH3PDDAccApply ノードはトランク LoRA を適用し、最終層に PDD ヘッドバンクをインストールします。sigma でステップごとに設定されるため、ループおよびチャンク化されたサンプラーが同期状態を維持します。コンパニオン scheduler ノードは、部分デノイズワークフロー用の訓練済みの sigma グリッドを出力します。
訓練レシピは厳格です:
- サンプラー — Euler; 各ステップは 1 つの平均ブロック速度を消費するため、マルチステージサンプラーはグリッド外で評価されます。
- ステップ — 8(デフォルト、訓練済みブロックサイズ)、4(公式承認の再グループ化)、または 6(不均一
8,8,4,4,4,4パーティション)。他のステップ数はノードによって拒否され、静かに劣化することはありません。 - ガイダンス —
BasicGuiderとともに CFG 1.0。 - シフトシグマ — 正確に 12.0 / 3.0。
- 剪定済みチェックポイント — 剪定済み(カーブテーブル)H3 U-Net では、50 の高密度 adaLN LoRA モジュールが自動的にモデルのカーブ基底に再ベースされます。
これらのアダプターを使用する際は、他の蒸留 LoRA(lightx2v turbo など)を削除してください — 蒸留はスタックしません。キャラクター LoRA は通常スタックします。
2 つの形式がサポートされています:元の Alibaba ファイル(ノードによりメモリ内で変換)または aptech0081/MiniMax-H3-Acc-LoRAs-ComfyUI による事前変換された ComfyUI キー再配布(ファイルあたり 1.7 GB)。
利用可能性
ComfyUI 以外では、アダプターは VideoX-Fun 推論パイプラインを通じて実行されます。VideoX-Fun の predict_t2v.py (FL2VA) または predict_ref2v.py (Ref2VA) 例スクリプトで model_path および pdd_lora_path を設定します。これらは Diffusers の MiniMax-H3 ModularPipeline を使用し、diffusers >= 0.40.0 が必要です。各例は apply_pdd_lora でチェックポイントをロードし、構成から必要な推論ステップ数を導出します。
コメント
GitHubでサインインしてディスカッションに参加しましょう。