ComfyUI v0.38.0: Ming-Image、Wan ID-V2V、SeedVR2高速化

ComfyUI Wikinews

ComfyUI v0.38.0では、Ming-Imageのネイティブサポートと公式テンプレートが追加され、Wan ID-V2V、w6a8量子化、HDR LogC3およびACEScct色空間が導入され、SeedVR2とYuE2が高速化されました。

ComfyUI v0.38.0 が公開されました。Ming-Image が公式テンプレートとともにコアへ追加され、長らく未対応だった Wan ID-V2V のサポートが実装され、w6a8 量子化、HDR LogC3 と HDR ACEScct の色空間が加わり、さらに SeedVR2 では動画を1フレームずつデコードすることでメモリ使用量が削減されています。
公式 ComfyUI テンプレートによる Ming-Image 0.1 Design の出力

公式 Ming-Image 0.1 Design テンプレートで生成されたデザインコンポジション。透明度を持つ RGBA 出力を書き出します(素材は workflow_templates リポジトリより)。

Ming-Image の Core 対応

Ming-Image 0.1 Design がネイティブに動作するようになりました。Core サポートは Comfy-Org/ComfyUI#16482 で追加され、続いて #16514 で検出の修正が行われました。同じ変更は v0.37.3 のパッチに含まれ、v0.37.4 で再び元に戻されていました。stable ブランチでモデルが表示されてから消えてしまった場合は、v0.38.0 ではそのまま残ります。

この移植では、専用の条件付けノード Text Encode Ming Image Edit(TextEncodeMingImageEdit、カテゴリ model/conditioning/ming image)が追加されます。プロンプトを最大 8 枚の参照画像(image_1 から image_8)とともに Ming のテキストエンコーダーへトークン化します。VAE 入力は省略可能で、これがない場合、画像は vision tower を通してのみ条件付けされます。これがある場合は、各参照画像がクリーンフレームとして潜在シーケンスに追加されます。後続の参照画像は最初の画像にリサイズされ、サンプリングされた潜在はその最初の画像のサイズと一致させる必要があります。

モデル側では、Ming-Image は独自の MingImage 潜在フォーマットを持つ 16 チャンネルの潜在空間上で動作する 30 層の DiT で、1024 バケットでは 3.16 のシフトで実行されます。テキストエンコーダーは同梱の Ling-Mini-2.0 言語モデルで、256 エキスパートを持つ 20 層の MoE であり、参照画像用の Qwen スタイルの vision tower と組み合わせて使用されます。同じノードグラフで 2 つのチェックポイントが動作します。Design モデルと、完成したデザインを編集可能な透明レイヤーに分解する Design Layer モデルです。

再パッケージ化されたウェイトは Comfy-Org/Ming-Image として bf16 と int8_convrot のバリアントで公開されています。

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── ming_image_0.1_design_bf16.safetensors
    │   ├── ming_image_0.1_design_int8_convrot.safetensors
    │   ├── ming_image_0.1_design_layer_bf16.safetensors
    │   └── ming_image_0.1_design_layer_int8_convrot.safetensors
    ├── 📂 text_encoders/
    │   ├── ming_image_0.1_ling_mini_2.0_bf16.safetensors
    │   └── ming_image_0.1_ling_mini_2.0_int8_convrot.safetensors
    └── 📂 vae/
        └── ming_image_vae_bf16.safetensors

公式テンプレート image_ming_image_01_design_t2i はパイプライン全体を組み立てます。これにはプロンプト強化ステージも含まれ、Qwen3.8-27B テキストエンコーダー(qwen3.8_27b_w4a8.safetensors として同梱)が短いリクエストを構造化された Figma スタイルの JSON デザインブリーフに書き換え、そのブリーフが Ming テキストエンコーダーに渡されます。サンプリングは 12 ステップの Euler で、1024x2048 の潜在に対して ModelSamplingFlux を使用します。

Qwen-Image 2.1 と ControlNet のアップデート

Qwen-Image 2.1 関連の開発は続いています:

  • Union Fun ControlNet がサポートされました(#16519)。これは alibaba-pai/Qwen-Image-2.1-Fun-Controlnet-Union 向けで、個々の Fun ControlNet タイプをまとめてカバーする単一の ControlNet です。これに対応する H3 Fun-ControlNet-Union 2.0 のサポート(#16471)も本リリースに含まれています。
  • Tiny VAE サポート(#16552)では、madebyollin の taesd から taeqi2_1_decoder と taeqi2_1_encoder が追加され、Qwen-Image 2.1 で高速な潜在プレビューと低コストな TAESD ラウンドトリップが利用できるようになりました。ファイルは models/vae_approx/ に配置してください。これらは 64 潜在チャンネルを持つ 16x モデルで、画像側は 4 チャンネル RGBA となっており、スケールとシフトは旧来の TAESD バリアントが使っていたスカラー方式ではなくチャンネル単位で適用されます。
  • プレフィックス KV キャッシュの配置(#16429)は、モデルパッチャーの空きメモリ計算に基づいて決定されるようになったため、動的 VRAM やスマートメモリの環境でもキャッシュを VRAM に保持でき、完全な再計算へのフォールバックを避けられます。Transformer ブロックのコンパイル(#16430)ではメモリコンパイラのサポートが追加され、主にオフロード帯域がボトルネックになる場合に効果を発揮します。
  • fp16 アクティベーションクランプ(#16608)は、メモリコンパイラを壊していたインプレース割り当てを修正しました。また、Qwen VL の画像前処理が 4 チャンネル RGBA 入力でクラッシュしなくなりました(#16548)。

Wan ID-V2Vが登場

ID-V2V対応のPR、Comfy-Org/ComfyUI#15139が2026-09-27についにマージされ、本バージョンに搭載されました。ID-V2Vは、同一性を保ちながら動画のスタイルを変換する機能で、VACE制御を備えたWan 2.1画像から動画へのベース上に構築されています。これは、これまでのComfyUIでは読み込めなかった組み合わせです。

これを可能にした変更は2つあります。モデル検出が、VACEモデルにI2Vベースのimg_emb射影が含まれている場合にそのアーキテクチャを認識するようになり、さらにImage to Videoがオプションのref_pad_image入力を受け取るようになりました。この入力は、画像の条件付けにおけるパディングフレームを、平坦なグレーではなく参照画像で埋めるものです。これは、モデルが学習時に使用していたドリフト防止用のパディングです。ref_pad_imageはオプションであるため、既存のI2Vワークフローは影響を受けません。

テスト用の重みは引き続きHugging Faceで公開されています。Kijai/Wan_ID_V2V_comfyではwan_2.1_idv2v_int8_convrot.safetensorsと、通常のdepth controlを備えたバリアントが公開されており、PRにはすぐに使えるワークフローJSONも含まれています。

量子化: w6a8

ComfyUI が w6a8 チェックポイントを読み込めるようになりました(#16483、comfy-kitchen で実装)。6ビットの重みと8ビットのアクティベーションを使用するため、ファイルは int8 と fp8 の両方の再パックよりも小さくなります。プルーニング済みの H3 重みはすでに新しい形式で Comfy-Org/MiniMax-H3 に公開されており、minimax_h3_fl2va_pruned_w6a8.safetensors と minimax_h3_ref2va_pruned_w6a8.safetensors として、既存の bf16、fp8_scaled、int8_convrot ファイルと並んでいます。

SeedVR2 と YuE2 の高速化

SeedVR2(#16530)は、アップスケーラーの VAE を大幅に書き換えたものです。モデルが許す箇所では、VAE は動画を1フレームずつ処理し、因果畳み込みキャッシュをピン留めされたホストメモリ上に int8 量子化して保持し、必要に応じてそれらをプリフェッチして戻すようになりました。そのため VRAM 使用量はクリップ全体ではなく 1 フレーム分のワーキングセットによって決まり、長尺または高解像度の動画ではこれが重要になります。同じリリースの comfy-kitchen カーネルが必要です。

公式テンプレートによる SeedVR2 拡大出力

公式の SeedVR2 画像アップスケールテンプレートの出力(アセットは workflow_templates リポジトリより)。

2 つの音声パスも高速化されました:

  • YuE2(#16626)は GPU から CPU へのトークン転送をバッチ化し、サンプラーを CUDA graphs 上で実行するようになりました。
  • ACE-Step 1.5(#16461)は自己回帰モデルに CUDA graphs とメモリコンパイラを適用しました。

さらに MiniMax H3 の 2 つの修正も含まれています。VAE はタイルデコードをすでに合成済みの隣接タイルとブレンドするようになり(#16436)、qk_norm_scale がオフロードされた際に H3 VAE がクラッシュする整列バグが修正されました(#16485)。Upscale Image (Using Model) は RGBA 画像でクラッシュしなくなりました(#16500)。

HDR 色空間

Convert Image Color Space(ImageColorSpace)に2つのログエンコーディングが追加されました(#16541):HDR LogC3(Rec.709プライマリのEI 800カーブ)とHDR ACEScct(AP1プライマリとD60ホワイト、Bradford色順応によりD65に適応)です。既存のsRGB、リニアRec.709、HDR HLG、HDR PQターゲットと組み合わせることで、VFXやEXRパイプラインが期待する色空間の間をワークフローで移動できるようになりました。後続の修正(#16565)では、HDR出力パスにおけるネガティブ値を処理します。

メモリ、アテンション、ローダー

  • モデルファイルが 各ブロックでどのアテンション実装を使うか を宣言できるようになりました(#16419)。これにより、1つのモデル内でアテンションバックエンドを混在させたリパックが可能になります。
  • comfy_attention と AttentionTensorContainer のサポートは、Lumina ファミリー(#16515)とさらにいくつかのモデルファミリー(#16595)に拡大し、Flux ファミリー(#16488)ではより少ないメモリ使用量で利用できるようになりました。
  • v0.37.0 で動的読み込み用に追加された fast disk 検出は、すべてのモデルローダー をカバーするようになり(#16425)、アーキテクチャ一覧には AMD RDNA2 とそれ以前のアーキテクチャが追加されました(#16537)。
  • Ascend NPU デバイスで非同期の重みオフロードストリームが利用できるようになりました(#16057)。
  • アセット システムには、堅牢性とパフォーマンスに関する一連の作業が入りました。SQLite の書き込みロックは最初に取得され、ファイルの読み取りは書き込みトランザクションの外に移動しました(#16480、#16486)。出力の再スキャンは、すべてのファイルを確認するのではなくフォルダを列挙し、UI の応答性を保つためにループを一時停止します(#16543、#16546)。また、アセットパッケージが不足している場合でも ComfyUI が起動し、--enable-assets に何が必要かを報告します(#16580)。

その他の変更

  • Text Generate が任意の system_prompt 入力を受け取り、thinking ブロックを専用の出力として返すようになりました (#16442)。
  • 上流が安定した cu132 ビルドの提供を終了したため、torchaudio 依存関係が削除されました (#16457)。
  • #16471 による MiniMax H3 Fun-ControlNet-Union 2.0 サポートが含まれ、SheetSage2 の ABC 生成が上流の YuE コードに合わせられました (#16569)。
  • パートナーノード: Hunyuan Image 3.5 のテキストから画像への生成と編集 (Tencent、#16462)、SVG ノードにおける推論エフォート指定付きの Arrow 2 (Quiver、#16478)、Claude Opus 5.5 (#16479)、Recraft V4.1 Flash (#16501)、GPT-6 Sol and Luna (OpenAI、#16520)、Seedream 5.0 Flash (#16522)、Seedance 2.5 Draft モード (#16529)。非推奨となった Sora ノードは削除されました (#16609)。これらのパートナー向け追加の一部は、すでに v0.37.x のパッチリリースで提供されています。
  • ワークフローテンプレートは v0.11.70、comfy-kitchen は 0.2.36、埋め込みドキュメントは 0.5.13 です。

v0.38.0 の入手

ComfyUI Manager またはお使いのランチャーから更新してください。Qwen-Image 2.1 ControlNet と tiny VAE のサポート、新しい色空間、ID-V2V はすべて v0.38.0 以降が必要です。パッチラインで注目すべきは Ming-Image です。ノードは v0.37.3 に存在していましたが v0.37.4 で再び元に戻されたため、サポートが維持されるのは v0.38.0 です。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
ComfyUI v0.38.0: Ming-Image、Wan ID-V2V、SeedVR2高速化 | ComfyUI Wiki