Viggle Turbo v0.2: ComfyUIで5ステップ生成を実現するQwen-Image 2.1蒸留モデル

ComfyUI Wikinews

ViggleによるQwen-Image 2.1のv0.2 DMD蒸留は、CFGなしで生成を5ステップに短縮。rank-256 LoRAとして公開され、コミュニティによるComfyUI変換も提供されています。

Qwen-Image-2.1-viggle-turbo は、Viggleによる Qwen-Image 2.1 のDMD蒸留モデルです。2026年9月23日に公開された v0.2 では、classifier-free ガイダンスなしで、テキストから画像への生成と参照駆動の編集を 40回ではなく5回のtransformerパス で実行し、未改変のベースtransformer上に重ねるrank-256 LoRAとして配布されています。
5ステップで生成されたカピバラ

Viggle自身のデモSpaceによる5ステップのテキストから画像への生成サンプル。

v0.2での変更点

最初の公開版であるv0.1はプレビュー版で、出力の多様性が失われ、構図がベースモデルからずれていました。v0.2はより大規模な生徒モデルであり、Viggleは96件のユーザーリクエストからなるホールドアウトセット上で、40ステップのベースモデルとその公式プロンプト拡張と比較して評価しています。

指標v0.1 LoRA r64v0.1 フルファインチューニングv0.2 LoRA r256、5ステップ
ベースモデルに対するサンプル多様性0.750.720.93
ベースモデルに対する構図のずれ-0.019-0.033+0.000

多様性は8つのシードにわたるプロンプト内DINOv2パッチ距離の平均を、ベースモデルに対する比率で表したものです。ずれは、同じプロンプトとシードに対するベースモデルの出力と比べて画像の重心がどれだけ移動したかを示します。実際には、v0.2はシード間のばらつきをベースモデル並みに保ち、被写体をベースモデルと同じ位置に配置します。一方v0.1は、どのシードでも似たようなレイアウトに押し込めていました。v0.1の成果物は再現性のためにリポジトリに残されていますが、Viggleはそれらをあえて選ぶ理由はないと述べています。

実行方法

蒸留された生徒モデルは、ステップ数ではなく固定のスケジュールでサンプリングします。シグマノード [1.0, 0.875, 0.75, 0.5, 0.25] を使った5ステップtrue_cfg_scale=1.0、そしてネガティブプロンプトなしです。これは4ステップのトレーニングノードのうち、最もノイズの多い区間を2つに分割したもので、Viggleによれば、単純な4ステップ実行で生じる詳細の損失とゴーストのほとんどが解消されます。他のステップ数やCFG値を試しても効果はありません。

組み込む際に重要な詳細がもう2点あります。

  • 同梱のscheduler configを使用する、または shift_terminal=None を設定してください。ベースモデルの shift_terminal: 0.02 は最終ステップを台無しにします。
  • LoRAのスケールは1.0のままにしてください。同梱のadapterではalphaがrankと等しいためです。

テキストから画像への生成は1024と2048の面積で、編集は1024と1536の面積でトレーニングされており、編集では最大3枚の参照画像を受け付けます。その順序によって、プロンプト内で <image1><image2><image3> がどの画像を指すかが決まります。

2枚の参照画像による編集: image 2の猫を抱く女性

832x1248で5ステップの2枚参照編集。プロンプト: 「The woman from image 1 is holding the cat from image 2 in her arms, keep the background of image 1」。

ComfyUIでの利用可能性

公式リリースは diffusersキー形式 と並行して peft_v0.2 adapterを提供しており、ComfyUIが直接読み込む単一ファイルのkohya形式ではないため、公式のComfyUIワークフローはまだありません。コミュニティはv0.1の公開から1日でこのギャップを埋めました。

  • t8star/Qwen-Image-2.1-viggle-turbo-4step-r64-comfy は、v0.1のr64 adapterをComfyUIで読み込めるLoRAに変換したものです。
  • 4ステップ系の量子化ビルドもGGUFリポジトリとして存在します(Abirayrealrebelai)。他のQwen-Image 2.1量子化と同様、低VRAM環境を想定したものです。

ベースとなる Qwen-Image-2.1 のtransformer、テキストエンコーダー、VAE、processorは蒸留版に同梱されていないため、これらはベースモデルから入手する必要がありますが、ComfyUIはすでにネイティブで対応しています。

まだできないこと

Viggleはv0.2が依然としてプレビューであることを明言しています。テキストから画像への生成はベースモデルに近い結果になりますが、複雑な編集ではまだ劣ります。複数参照の構図、顔の入れ替え、本人確認書類の編集では、人物が重複したりゴーストが生じたりすることがあり、「すべて同じままに」というリクエストでは本人の同一性がずれることがあり、小さなテキストや長いテキストの描画は40ステップの場合より頻繁に文字化けします。2K出力は教師モデルに対して検証されておらず、RGBA出力、3枚を超える参照、マスクベースの局所編集は未検証です。

このモデルはすでにComfyUIコミュニティで取り上げられており、リリースはBanodocoの #qwen-image チャンネルやr/StableDiffusionでも話題になっています。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Viggle Turbo v0.2: ComfyUIで5ステップ生成を実現するQwen-Image 2.1蒸留モデル | ComfyUI Wiki