ComfyUI で使う Pruna の 5 ステップ・8 ステップ Qwen-Image 2.1 LoRA

ComfyUI Wikinews

PrunaAI の Pruna-Qwen-Image-2.1 LoRA は、Qwen-Image 2.1 の生成と編集を CFG なしの 5 または 8 ステップに短縮します。コミュニティによる ComfyUI 変換版とステップごとのシグマスケジュールも紹介します。

Pruna-Qwen-Image-2.1 は、PrunaAI による Qwen-Image 2.1 向けの 少数ステップ LoRA アダプター のペアです。テキストから画像への生成とマルチ参照編集を 40 回ではなく 5 または 8 回の transformer パス で実行し、classifier-free guidance を使用しません。未改変のベースパイプライン、テキストエンコーダー、VAE の上に読み込むことができます。
Pruna アダプターを使った 1024 でのテキストから画像へのサンプル

公式モデルカードのテキストから画像への比較。

2 つのアダプター、2 つのスケジュール

このリリースは 1 つの蒸留モデルではなく、別々にトレーニングされた 2 つの生徒モデルです。PrunaAI は、品質を取るか速度を取るかに応じてどちらか一方を選ぶことを想定しています:

アダプターステップ数トレードオフ
p_qwen_image_2.1_8step_v0.1.safetensors8品質が高く、推奨のデフォルト
p_qwen_image_2.1_5step_v0.1.safetensors5高速だが、画像は明らかに劣る

各アダプターはそれぞれ独自のシグマスケジュールでトレーニングされており、モデルカードは一度に 1 つだけ読み込むよう求めています。スケジュールは正確にコピーしなければならない部分です。というのも、これらの生徒モデルは、サンプラーが自前で導き出すステップ数ではトレーニングされていないからです:

ステップ数シグマ
51.0, 0.94, 0.857142857, 0.666666667, 0.4
81.0, 0.933333333, 0.857142857, 0.769230769, 0.666666667, 0.545454545, 0.4, 0.222222222

どちらも DMD でトレーニングされており、空のネガティブプロンプトを使い CFG 1.0 で実行されます。末尾の 0 はスケジュールに書き込まれているのではなく、スケジューラーによって追加されます。その他のステップ数、スケジュール、CFG 値は、アダプターがトレーニングされた範囲外です。

1K および 2K のテキストから画像で測定したレイテンシ

カードのテキストから画像のレイテンシチャート。単一の H100 80GB で測定: 1 回のウォームアップ後の 3 リクエストの中央値で、プロンプトのエンコード、デノイズ、デコードを含みます。ベースモデルは KV キャッシュありの 40 ステップ、アダプターは KV キャッシュなしの 5 または 8 ステップです。

PrunaAI が掲げる目玉の数字は 最大 6.3 倍高速 です。カードは主張しない点にも注意を払っています。タイミングは同等の画質を意味するものではなく、ベンチマークでは LoRA はマージされないままにされ、サンプル画像では KV キャッシュが有効になっていますが、チャートはその設定で再測定されていません。

トレーニングの対象範囲と限界

アダプターは 1K 解像度のみ で、通常のプロンプトとアップサンプリングされたプロンプトを混ぜてトレーニングされており、テキストから画像への生成と、最大 3 枚の参照画像 を使う単一・複数画像の編集をカバーしています。PrunaAI は 1024x1024 から始めることを推奨しており、2K 出力、より多くの参照画像、短く曖昧なプロンプトは対象範囲外として扱い、品質が変動する可能性があるとしています。

このリリースは明示的に v0.1、進行中 と位置づけられています:

  • 品質は 40 ステップのベースモデルを下回り、蒸留の改善に合わせてリポジトリが更新されます。
  • 5 ステップのアダプターは高速な方で、その画像は 8 ステップのアダプターよりも明らかに劣ります。
  • 単体で動作するモデルではありません。Qwen/Qwen-Image-2.1 のベース重みが引き続き必須です。
マルチ参照編集の例

公式モデルカードの編集グリッド。

ComfyUI での利用可否

これらのアダプター向けの公式 ComfyUI パッケージはまだありません。diffusers/PEFT ファイルとして rank 64、PEFT alpha 128 で配布されており、alpha は ComfyUI の LoRA ローダーが読み取るテンソルではなく safetensors のメタデータに保存されています。そのため、そのままドロップインすると誤ったスケールで実行されます。コミュニティはリリースから 1 日以内にこのギャップを埋めました:

  • NidAll/pruna-image-2.1-comfyui-loras は非公式の変換版で、224 個の LoRA ターゲットそれぞれにスカラーの .alpha テンソルを追加し、A と B の重みはそのままに、LoRA 強度 1.0 でアダプターが意図したスケールで動作するようにします。独自の 5 ステップと 8 ステップのワークフロー JSON も同梱されています。
  • これらのワークフローは ComfyUI ネイティブのノードのみを使用します: ManualSigmas、SamplerCustom、Euler、CFG 1.0、LoRA 強度 1.0、ネガティブプロンプトなし、そして 1024x1024 のテキストから画像です。ベースファイルは Comfy-Org/Qwen-Image-2.1 から取得するため、コンシューマー向け VRAM を使う人にとって int8_convrot transformer が現実的なターゲットになります。

ComfyUI は Day-0 リリース 以来 Qwen-Image 2.1 をネイティブでサポートしているため、追加でインストールする必要はありません。ManualSigmas と SamplerCustom を備えた最新の ComfyUI があれば、同梱された両方のワークフローをカバーできます。

1024 での画像編集サンプル

モデルカードの編集サンプルで、少数ステップのアダプターで実行したもの。

2048 でのテキストから画像へのサンプル

2048 でのテキストから画像。1K のトレーニング対象範囲外ですが、公開されたレイテンシ測定の一部です。

初期のテストは、リリース自体よりも主に ComfyUI コミュニティから出ています。アダプターは Banodoco の #qwen-image チャンネルで Viggle の turbo や公式の Qwen Acc LoRA と比較され、テスターは 8 ステップのアダプターを特に注目しました。また、重みが公開された直後に r/StableDiffusion や X にも投稿されました。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
ComfyUI で使う Pruna の 5 ステップ・8 ステップ Qwen-Image 2.1 LoRA | ComfyUI Wiki