Turbo8: Qwen-Image 2.1向け8ステップ蒸留LoRA

ComfyUI Wikinews

Turbo8はQwen-Image 2.1をCFGなしの8ステップに蒸留し、テキストから画像生成、編集、RGBA出力、被写体抽出をカバーします。すぐに使えるComfyUIワークフローも2つ付属します。

Turbo8(Hugging Face)はQwen-Image 2.1向けのステップ蒸留LoRAで、8ステップ・CFG 1でレンダリングできます。これはベースモデルの40パスのおよそ5分の1です。単一の1.36 GBファイルで、テキストから画像生成、テキストレンダリング、最大10枚の参照画像を使った指示編集、透明(RGBA)生成、被写体抽出をカバーし、リポジトリにはすぐに使えるComfyUIワークフローが2つ含まれています。

Qwen-Image 2.1は2026年9月20日のリリース以降、いくつかの少ステップ化アプローチを集めてきました。Prunaの5ステップおよび8ステップLoRA、Viggleのturbo LoRA、そしてAlibaba PAI公式の4ステップFun Acc蒸留です。Turbo8は同じ競争におけるコミュニティからの提案であり、その際立った特徴はカバレッジの広さにあります。テキストから画像生成だけを高速化するのではなく、RGBAや複数参照の編集パスを含むベースモデル全体の挙動を維持するようトレーニングされており、これらのパスは以前のアダプターではうまく扱えていませんでした。

Turbo8を8ステップ・CFG 1で生成したサンプル

すべてのサンプルはTurbo8を8ステップ・CFG 1・1024²・最初のシードで使用し、プロンプトごとの選別は行っていません。プロンプトはホールドアウト評価セットから表示用に選ばれたものです。出典: Turbo8-LoRA-Qwen-Image-2.1。

できること

このアダプターはQwen-Image 2.1のアテンション、MLP、モジュレーション、タイムステップ埋め込みレイヤーに対するrank-128 LoRAで、ベースの重みを変更しないまま蒸留されています。推論時は**8ステップ、CFG 1、サンプラーeuler、スケジューラーsimple**で動作し、作者は8ステップを超えたりCFG 1を上回ったりしても結果は改善しないと述べています。

狙いは単一タスクではなくカバレッジです。モデル本来の2Kまでのテキストから画像生成、英語と中国語のテキストレンダリング、最大10枚の参照画像を使った指示編集、透明生成、そして被写体抽出(写真を渡してRGBAの切り抜きを要求する)に対応します。モデルカードにはトレーニング手法も記載されており、それは3段階のレシピです。まず生徒モデルの8つのノイズレベルで記録した3,100件の固定ノイズ40ステップ教師レンダリング、次に3,000ステップの軌道回帰、そしてfake-score criticとGANヘッドを用いた2,500ステップのDMD2分布マッチングです。criticは同じ凍結transformer上の2つ目のLoRAです。

ComfyUIでの実行

Turbo8はComfyUIネイティブのQwen-Image 2.1サポートを直接対象としています。

  1. turbo8_lora_step2500.safetensorsをComfyUI/models/loras/に配置します。
  2. comfyui/turbo8_t2i.json(テキストから画像生成とRGBA)またはcomfyui/turbo8_edit.json(編集と抽出)を読み込みます。
  3. **steps 8、CFG 1、サンプラーeuler、スケジューラーsimple**を維持します。

T2IグラフにはModelSamplingFluxノード(max_shift 0.6935、base_shift 0.5)が含まれ、幅と高さに接続されています。これにより、LoRAの蒸留時に使用された解像度依存のノイズスケジュールが、2Kでも再現されます。モデルカードによると、227個のLoRAレイヤーすべてがComfyUI上でマッピングされ、1024²の画像はRTX PRO 6000で約4秒かかります。

教師モデルとの比較

モデルカードでは、Turbo8を自身の教師モデルである40ステップのベースモデルと、192件のホールドアウトプロンプト(DrawBenchと追加シード、テキストレンダリング用プロンプト、RGBA被写体、OmniEditの編集と抽出)で評価しています。

指標教師モデル(40ステップ)Turbo8(8ステップ)
PickScore、T2I22.1521.94
CLIPScore、T2I26.8926.89
PickScore、RGBA20.5120.07
テキスト完全一致(OCR)95.0%75.0%
テキスト文字精度99.6%95.3%
透明率(RGBA + 抽出)0.8750.925
シード多様性(低いほど多様)0.7050.670
教師モデルとの編集類似度(DINOv2)n/a0.967
教師モデルに対する抽出アルファIoUn/a0.85
同一シードでの40ステップの教師モデルと8ステップのTurbo8の比較

40ステップの教師モデル(各ペアの上段)と8ステップのTurbo8(下段)、同一シード。サンプルはテキストから画像生成、テキストレンダリング、編集、RGBA、抽出をカバーしています。

文書化されている制限

モデルカードでは、これらのギャップを利用者が発見する前に明示しています。

  • 密なテキストや長いテキスト(段落、小さな文字)は40ステップの場合よりはるかに劣化しますが、短い見出し、看板、ラベルは引き続き信頼できます。
  • 一部の込み入ったシーンでは、同一シードでも構図が教師モデルと異なることがあります。
  • 抽出はベースモデルの失敗ケースを引き継ぎます。評価では16件の抽出のうち3件が教師モデルとTurbo8の両方で空になり、Turbo8は切り抜きに周囲のコンテキストをより多く残すことがあります。

コミュニティでの評価

Banodocoの#qwen-imageチャンネルでは、その後の数日間にユーザーがTurbo8を以前の少ステップ化アプローチと比較検証しました。共通の知見は、編集で性能を維持するには強度を下げ、8ステップより多くする必要があるというものでした。報告は、身体の破綻が現れる前に強度0.65、約16ステップに落ち着き、複数のユーザーが編集用途では6ステップのViggle turboより優れていると評価しつつ、一部の作業では依然としてPrunaの8ステップスケジュールを好んでいました。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Turbo8: Qwen-Image 2.1向け8ステップ蒸留LoRA | ComfyUI Wiki