Qwen-Image 2.1プロンプトエンハンサーモデルがComfyUIで動作

ComfyUI Wikinews

QwenのPE-T2IとPE-I2Iプロンプト書き換えモデルは短いリクエストや編集指示を展開し、コミュニティのノードパックがCLIPを読み込むことで両方をComfyUIで実行します。

Qwen-Image 2.1と併せて、Qwenは2つの専用プロンプト書き換えモデルを公開しました。テキストから画像へのリクエスト用のQwen-Image-2.1-PE-T2Iと、編集指示用のQwen-Image-2.1-PE-I2Iです。ComfyUIにはまだこれらのノードがないため、コミュニティのノードパックComfyUI-Qwen-Image-2.1-Prompt-Enhancerが両方をグラフに組み込めるようにしました。

2つのリライター、それぞれのタスクに1つ

PEチェックポイントはQwen3.5-VL 9Bをファインチューニングしたモデルで、ベースモデルとともに2026-09-20に公開されました。公式のQwen-Image 2.1 READMEでは、プロンプトを準備する既定の方法としてこれらを推奨しています。「最良の結果を得るには、公式のプロンプト書き換えモデルを使用して、短いプロンプトを詳細で高品質な記述に展開することをお勧めします。」

  • PE-T2Iは、任意の言語の簡潔なリクエストを、長い英語プロンプトと推奨アスペクト比に変換します。応答はthinkブロックの後にJSONとして返されます: {"rewritten_prompt": ..., "wh_ratio": "16:9"}
  • PE-I2Iは、編集指示と最大10枚の参照画像を受け取り(<image1><image2>などとして指定)、正確な編集プロンプトを返します。そのJSON応答にはratio_followが追加され、出力が引き継ぐべきアスペクト比を持つ入力画像を指定します。

どちらもthinkingを有効にしてサンプリングすることを想定しています。公式の例ではtemperature 1.0top_p 0.95top_k 20を使用し、テキストから画像へのチェックポイントではmax_new_tokens 16256、編集用では24000を使用します。

Qwen-Image 2.1の公式マルチ参照編集の例

Qwen-Image 2.1の公式例: 5枚の参照画像から組み立てた衣装。PE-I2Iリライターが明示的なプロンプトに変換するよう学習している、まさにこの種の複数画像指示です。

ComfyUI内で実行する

ComfyUIの3つの公式Qwen-Image 2.1テンプレートはテキストから画像へ、画像編集、背景除去をカバーしていますが、いずれもリライターを呼び出しません。Comfy-Orgは2つのPE重みをComfy-Org/Qwen-Image-2.1内でint8 convrotファイルとして再パッケージ化しました(text_encoders/qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors..._pe_i2i...)。しかし、読み込むだけでは半分に過ぎません。チャットプロンプトを構築し、JSONを読み戻し、その結果をサンプラーに渡す処理が依然として必要です。

このノードパックは、Qwen Imageカテゴリに登録された2つのノードでまさにそれを行います。

ノード入力出力
QwenImage21_T2IPromptRewriteCLIP、プロンプト、サンプリング設定positive_promptnegative_promptwh_ratiothinkingparse_ok
QwenImage21_EditPromptRewriteCLIP、プロンプト、image_1image_10同上、加えてratio_follow
T2I Prompt Rewriteノード

T2I書き換えノード: 短いプロンプトを入力すると、展開されたプロンプト、アスペクト比、推論トレースが出力されます。

PEファイルは通常のLoad CLIPノードでtype = qwen_imageとして読み込まれ、生成はComfyUI独自のclip.tokenize()clip.generate()clip.decode()の経路で実行されます。これは組み込みのTextGenerateノードの背後にあるのと同じ仕組みです。外部サーバーも、別個のtransformersパイプラインも不要です。

Edit Prompt Rewriteノード

編集ノードは10個の画像スロットを公開し、書き換えられた指示と継承すべき比率を返します。

いくつかの設定はREADMEからコピーする価値があります。2つのチェックポイントで共通していないためです。

パラメータT2IEdit
presence_penalty1.50
max length1625624000
thinkingonon

高いペナルティはテキストから画像へのリライターが同じことを繰り返すのを防ぎますが、編集リライターはそれなしで実行することを想定しています。両モデルともthinkブロック付きで学習されているため、このパックはJSONを解析する前に推論トレースと回答を分離し、回答が正しく解析されたときにparse_okを報告します。オプションのjson_repairパッケージをインストールすると、失敗する代わりにわずかに不正な形式の回答を修復できます。

グラフへの組み込み

Qwen-Image 2.1グラフに組み込まれたプロンプトエンハンサー

READMEのグラフ: PEチェックポイントを読み込むLoad CLIPが書き換えノードに供給され、そのpositive_promptがText Encode Qwen Image 2.1へと続きます。

テキストから画像への実行では、書き換えられた文字列がテキストエンコードノードに入力するはずだった内容を置き換え、wh_ratioは手動で選んだ幅と高さの代わりに解像度セレクターを駆動できます。編集実行では、参照画像がノードの画像スロットに入り、指示がそれらを<image1><image2>として参照し、ratio_followが出力キャンバスをどの入力に合わせるかを決定します。

入手方法

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Qwen-Image 2.1プロンプトエンハンサーモデルがComfyUIで動作 | ComfyUI Wiki