MiniMax H3 Fun ControlNet Union:Canny・Depth・Poseなど多彩な制御を1つのチェックポイントで
Alibaba PAIがMiniMax H3向けControlNet-Unionを公開:6.8 GBの単一チェックポイントでCanny・Depth・HED・MLSD・Poseのビデオ制御とインペイントをVideoX-Fun経由で実現。
概要
このチェックポイントは制御ブランチのみ(control_proj_in と5つの control_blocks、約6.8 GB)を保持し、ベースの MiniMax H3 Transformer の上にロードされます。制御信号は50個のTransformerブロックのうち5箇所(第0、10、20、30、40層)に注入され、各制御スキップはゼロゲート投影を通じてメインブランチに加算されます。
- Union制御 — 1つのチェックポイントで Canny・Depth・HED・MLSD・Pose の制御ビデオによるビデオ間生成を処理します。
- ガイダンス蒸留 —
guidance_scale = 1.0、1ステップあたり1回のフォワードパスで動作。classifier-free guidanceは不要です。 - インペイント — 制御入力は49チャンネル(latent + マスク済みlatent + mask)に拡張されます。専用の
predict_v2v_control_inpaint.pyサンプルを使用します。 - 制御の強さ —
control_context_scaleが各制御スキップをメインブランチに加算する前にスケーリングします:1.0で最も強く、値が小さいほど制御ビデオの誘導が弱まり、0.0で制御ブランチはオフになります。
生成は制御ビデオに追従します:フレーム数はビデオVAEがデコードできる最大の 17 × n + 5(長さは最大15秒)に切り詰められ、キャンバスは height × width のピクセル予算内で制御ビデオのアスペクト比を維持し、24 fps固定です。シーン・被写体・カメラを詳しく記述したプロンプトが最も安定した結果をもたらします。
生成結果
以下のサンプルはすべて40ステップ、guidance_scale = 1.0、control_context_scale = 1.00 で生成されています。最初のビデオが制御入力、2番目が生成出力です。
Canny
Canny制御入力(東京の街並み)
Canny構造に追従した生成出力
Pose
Pose制御入力(ダンス)
ダンスのポーズに追従した生成出力
利用方法
このチェックポイントは現在 VideoX-Fun 推論パイプラインで実行します。VideoX-Fun リポジトリをクローンし、ベースの MiniMax-H3 モデルとこのチェックポイントを models/Diffusion_Transformer/ に配置してから、examples/minimax_h3_fun/predict_v2v_control.py 冒頭の設定を編集して実行します:
model_name = "models/Diffusion_Transformer/MiniMax-H3"
config_path = "config/minimax_h3/minimax_h3_control.yaml"
transformer_path = "models/Diffusion_Transformer/MiniMax-H3-Fun-Controlnet-Union/MiniMax-H3-Fun-Controlnet-Union.safetensors"
control_video = "your_control_video.mp4"
prompt = "your prompt"python examples/minimax_h3_fun/predict_v2v_control.pyモデルカード記載の重要な設定メモ:
- 設定は学習時と完全に同じ構成で制御ブランチを構築する必要があります(
control_blocks_places: [0, 10, 20, 30, 40]、control_in_dim: 49、control_apply_audio: false)。レイアウトが一致しないとチェックポイントのロードに失敗します。 - ガイダンス蒸留済みのため
guidance_scale = 1.0を維持してください。1より大きい値はガイダンスを二重に適用し、出力を劣化させます。 - 制御チェックポイントは制御ブランチのみを含むため、ベースの MiniMax-H3 ウェイトが必須です。
- Transformer(約62 GB)と Qwen3-VL テキストエンコーダ(約62 GB)は1枚の80 GB GPUに完全には収まりません。
model_group_offloadまたはmodel_cpu_offload_and_qfloat8を使用してください。
現時点では H3 ControlNet 用のネイティブな ComfyUI ローダーはなく、今回のリリースは VideoX-Fun パイプラインを対象としています。Gradio デモ Space では、公開された5組の結果ビデオ付きでモデルを試せます。
コメント
GitHubでサインインしてディスカッションに参加しましょう。