Qwen-Image-2.1-Turbo: ComfyUI で動く公式の 8 ステップ Turbo
Alibaba 公式の Qwen-Image-2.1-Turbo チェックポイントは、7B の生成モデルと編集モデルを CFG 1 の 8 デノイズステップで実行します。ComfyUI 向けに Comfy-Org が再パッケージした重みも提供されています。
人間のポーズと動き。Alibaba 自身の Turbo ショーケースにおける 8 ステップカテゴリのひとつ。
Turbo チェックポイントが変えるもの
Turbo は新しいアーキテクチャではありません。サンプリングスケジュールを内蔵した Qwen-Image 2.1 の2つ目のチェックポイントであり、同じ transformer の重みがこれまでどおり生成、指示編集、RGBA 透明度、被写体抽出を担います。実際に組み込む際に重要な違いは次のとおりです:
- **40 ステップではなく 8 デノイズステップ。**推奨される 8 ステップのスケジュールはチェックポイントに同梱されています。モデルカードには、
num_inference_stepsを単独で渡してもこれを上書きできないこと、また他のスケジュールはこのチェックポイントで評価されていないことが明記されています。 - **デフォルトで CFG 1。**classifier-free ガイダンスがオフのため、各ステップは1回のフォワードパスで実行されます。
- **プレフィックス KV キャッシュがデノイズステップ間でテキストと参照画像のコンテキストを再利用します。**パイプラインはこれを
use_kv_cache=Trueで有効にします。 - ベースモデルと同じ解像度プリセットで、2048x2048(1:1)から 2752x1536(16:9)や対応する縦位置の比率まで対応します。
- 現時点では Diffusers ベース。
QwenImage21Pipelineで読み込み、パイプライン設定のサンプリングシグマをサポートする diffusers ビルドが必要です。
保存されているスケジュールは 1.0, 0.978453, 0.95418, 0.926626, 0.89508, 0.845148, 0.704534, 0.414568 で、空の 0 ステップで終わります。Banodoco の #qwen-image チャンネルで、Kijai はこれが ComfyUI の linear_quadratic スケジューラにシフトを適用しない状態と近いこと、また一般に turbo チェックポイントでは固定の Euler スケジュールが確率的サンプラーに勝つのを見たことがないと述べました。
ショーケース
モデルカードは、8 ステップの出力を人々が実際にモデルへ求める内容ごとにグループ化しています。ポートレート写真とポスターティポグラフィは、編集ケースと同じチェックポイントから出力されます:
ポートレート。1680x2512 で 8 ステップで生成。
タイポグラフィとポスターデザイン。かつては 40 ステップのフルロールアウトが必要だったカテゴリです。
UI と情報レイアウト。より難しい構造化出力のケースのひとつです。
透明性は高速化後も維持されます。アルファチャンネルはモデルが書き出すため、ステッカーや製品アセットもそのまま合成できる状態で出力されます。
Turbo チェックポイントによる透過画像生成。
編集はベースモデルと同じように動作し、単一画像の変換も含まれます:
![]() | ![]() |
|---|---|
| 入力参照 | 8 ステップの編集出力(2048x2048) |
ComfyUI での利用
Comfy-Org/Qwen-Image-2.1 は、リリースから数時間以内に Turbo を追加しました。ベースモデルと同じ3つの形式です:
diffusion_models/qwen_image_2.1_turbo_bf16.safetensors、BF16 のフル 8 ステップチェックポイント。diffusion_models/qwen_image_2.1_turbo_int8_convrot.safetensors、より少ない VRAM 向けの INT8 convrot 量子化。loras/qwen_image_2.1_turbo_lora_avg_rank_178_bf16.safetensors、同じ蒸留を LoRA として抽出したもので、チェックポイントを差し替える代わりにベース transformer の上に読み込みます。
テキストエンコーダーと VAE は Qwen-Image 2.1 と共通なので、すでにベースモデルを動かしている環境では新しい transformer または LoRA を追加するだけで済みます。Turbo の重みは既存の公式 Qwen-Image 2.1 ワークフローにそのまま組み込めます。サンプラーを 8 ステップ・CFG 1 に設定し、turbo diffusion model か、ベースモデル + turbo LoRA のいずれかを選びます。
初期の反響
このリリースは同日に #qwen-image に登場し、その場でテストされました。RuneX は「公式 turbo は素晴らしく動作する」と報告し、同じプロンプトで少なくとも1つのサードパーティ製 Turbo LoRA より明らかに良いと述べました。Corza は同梱のシグマを独自の Euler スケジュールと比較し、差はわずかで、主に LoRA や LoKR を重ねたときのシャープネスと肌のディテールが増える程度だと分かりました。これはベースモデルでアダプターを重ねたときに報告されるのと同じ過剰スムージングの問題です。Kijai は、より良い turbo 結果を主張するコミュニティノードに感銘を受けず、フローマッチングモデルでは ComfyUI の Euler サンプラーがすでに flow-match Euler であるため、そのようなノードは主にシグマを変えているだけだと指摘しました。


コメント
GitHubでサインインしてディスカッションに参加しましょう。