MiniMax H3 X2 Detail VAE: 2-in-1のアップスケールとディテール強化リリース

ComfyUI Wikinews

MiniMax H3向けの実験的な2-in-1リリース。2XビデオVAEと参照ディテール強調ノードを収録し、検証済みのComfyUIワークフローとネガティブな結果についての解説を添えています。

MiniMax-H3-X2-Detail-VAE は MiniMax H3 向けのコミュニティリリースで、2つのものを1つの5.2 GBチェックポイントにまとめています。H3の潜在を2倍の解像度でデコードする 2XビデオVAE と、参照から動画へ変換する前に入力画像の微細構造を再構築するオプションの 参照ディテール強調ノード です。作者は9月30日に、重み、検証済みのカスタムノード、サンプルワークフローを公開するとともに、本来の目標であったドロップインでより高ディテールなVAEにはなぜ到達できなかったのかを長文で解説しました。
MiniMax H3 X2 Detail VAEの比較フレーム

リリースの比較クリップからのフレーム。片側は通常の2X VAEデコード、もう片側は同じ潜在にディテール強調パスを適用したものです。

1つのファイルに2つのツール

このwikiにおけるH3 VAEの取り組みのほとんどは、デコードを より高速にする ことに関するものでした。今回のリリースは逆方向に進み、デコードを よりシャープに できるかを問いかけ、その探求を生き残ったものを公開しています。同じチェックポイント MiniMax-H3-X2-Detail-v1.safetensors が、2つの異なる方法で使われます。

モード入力動作カスタムノードが必要か
2X VAEH3ビデオ潜在パックされた12チャンネル出力とPixelShuffleにより、2倍の空間解像度でデコード高速デコードノードのみ必要
ディテールエンハンサーRGB参照画像参照から動画へ変換する前に、エンコーダの初期タップから追加の空間構造を再構築必要(リリースに含まれる)

この2つのモードは互換ではありません。2Xパスは生成済み潜在に対して動作し、参照画像は不要です。ディテールパスには既存のRGB画像が必要です。そこで使われる追加情報は、通常の潜在ボトルネック より前 のH3エンコーダから取り出されるからです。

モード1: 2X VAEデコード

チェックポイントを ComfyUI/models/vae/ に置き、スタンダードな Load VAE ノードで選択します。実際のデコードでは、ComfyUIの通常の VAE Decode ノードを、TripleHeadedMonkey/ComfyUI-MiniMaxH3_LatentUpscaler の MiniMax H3 VAE Decode (fast) に置き換えます。これがパックされた出力をフル解像度のRGBに変換するものです。

H3 video latent
   ↓
MiniMax H3 VAE Decode (fast)   ← MiniMax-H3-X2-Detail-v1
   ↓
packed 12-channel X2 decode
   ↓
PixelShuffle ×2
   ↓
2X RGB / video frames

ワークフローには検証済みの開始設定が付属しています: tiling = true、tile_size = 256、tile_overlap = 64、output_device = cpu、temporal_tiling = false。

2Xワークフローに必要なMiniMax H3 VAE Decode (fast)ノード

リリースのREADMEに示されている、必須の MiniMax H3 VAE Decode (fast) ノード。

モード2: 参照ディテール強調

画像参照ワークフローでは、同じチェックポイントが MiniMax H3 VAE 2X (Detailed Upscale) の中で2度目に読み込まれます。これは ComfyUI-H3-X2-Detailed.zip として同梱される小さなカスタムノードです。ソース画像と MiniMax H3 リファレンスから動画へ の間に配置し、detail_strength = 1.0 が検証済みのベースラインです。最終的なビデオデコードは、同じX2 VAEを使う MiniMax H3 VAE Decode (fast) を通して実行されます。

サンプルワークフロー

このリリースには、両方の役割を同時に示す2-in-1グラフが含まれています。ディテールノードが参照から動画へ変換する前にRGB参照を強調し、生成されたH3潜在は最後に MiniMax H3 VAE Decode (fast) でデコードされます。

2-in-1のH3 X2 Detail VAEワークフロー

モデルカードに掲載されている、完全な2-in-1ワークフローのスクリーンショット。

直接比較

以下の2つのクリップはどちらも、同じモデルのリリースされた2つのモード を同一の生成設定で実行したものです。左側は2X VAE単体、右側は2X VAEにディテールパスを加えたもので、参照はまずB32ディテールブランチを通して処理されます。

比較01: 2X VAEデコードと、ディテール強調パスを加えた2X VAE。

比較02: 2つ目のクリップで同じ2つのモードを比較。

「HQ VAE」が存在しない理由

その解説は、結果について異例なほど率直です。出発点はすでに動作していたH3 2X VAEでしたが、その大きな出力は比例して多くの実際のディテールを伴うものではありませんでした。そこでプロジェクトは、増えたピクセルに意味を持たせることを目指しました。デコーダ側のブロック、ディテールターゲット損失、潜在の「ディテール方向」、より強力なプログレッシブデコーダはすべて失敗し、そのうちのいくつかは数値的な損失を改善しつつも、エッジのハロー、彫刻画のような構造、あるいは何も見えない結果を生み出しました。

明確に機能した唯一のブランチは、凍結されたH3エンコーダの down.1.block.1 からコンパクトな32チャンネル表現を取り出し、10枚のホールドアウトフレームすべてでRMSE、HP3、勾配メトリクスを改善しました。またそれは 潜在ボトルネック前のオリジナルRGB画像 から得られたものであり、これはH3がテキストから動画への生成中に新しい潜在を生成するときには存在しない情報そのものです。作者の結論は限定的で、率直に述べられています。ディテールの向上はスタンダードな生成済みH3潜在だけからは再現できないため、プロジェクトが目指していたドロップインの潜在専用VAEにはなり得ませんでした。残ったのは実験的な2-in-1ツールであり、解決されたボトルネックではありません。

要件とファイル

  • MiniMax-H3-X2-Detail-v1.safetensors は5.2 GBのチェックポイントで、ComfyUI/models/vae/ に配置します。
  • ComfyUI-MiniMaxH3_LatentUpscaler は MiniMax H3 VAE Decode (fast) を提供し、2Xワークフローに必須です。
  • ComfyUI-H3-X2-Detailed.zip は、参照パス用のオプションの MiniMax H3 VAE 2X (Detailed Upscale) ノードを追加します。
  • H3_VAE_Detailed_and_2X_VAE_2in1.json はサンプルワークフローです。

入手方法

重みとアセット: speach1sdef178/MiniMax-H3-X2-Detail-VAE
ComfyUIファイル: MiniMax-H3-X2-Detail-v1.safetensors(models/vae/ 内)
必須ノードパック: TripleHeadedMonkey/ComfyUI-MiniMaxH3_LatentUpscaler
ベースモデル: MiniMaxAI/MiniMax-H3

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
MiniMax H3 X2 Detail VAE: 2-in-1のアップスケールとディテール強化リリース | ComfyUI Wiki