Qwen-Image 2.1 Consistency LoRA: 編集を元のフレームからずらさない

ComfyUI Wikinews

Qwen-Image 2.1 向けのコミュニティ製 LoRA が編集を元のフレーム上に保ちます。同じプロンプトとシードでもドリフトや不要な再描画が発生せず、2 つの ComfyUI ワークフローも用意されています。

Qwen-Image 2.1 Consistency LoRA(Hugging Face)は、編集を元の画像のフレーム上に保つコミュニティ製アダプターです。Qwen-Image 2.1 に写真の水彩画版やコミック版を求めると、結果はたいてい数パーセント縦に伸び、横にずれ、シードごとに異なります。この LoRA はそのドリフトを学習によって取り除きます。同じプロンプト、同じシードなら、結果はソースと位置が揃います。ausboss は 9 月 27 日に、2 つのチェックポイント、2 つの ComfyUI ワークフロー、そしてその根拠となるドリフト測定値とともに重みを公開しました。
LoRA なしでは絵が縦に伸び、LoRA ありでは元のライン上に留まる水彩画のリスタイル

破線はオリジナルで特徴が位置する場所を示し、矢印はそれがどれだけ移動したかを示します。各列で同じプロンプトとシードを使用し、Comfy-Org の INT8 Qwen-Image 2.1 重みで ComfyUI 上でレンダリングしました。

解決する問題

Qwen-Image 2.1 の編集はすべて新規生成であるため、モデルは指定した部分だけを変更するのではなく、画像全体を再構成します。全体的なリスタイルでは、これがドリフトとして現れます。ウエストバンドが 40 px 下がり、地平線が 25 px 上がり、顔がオリジナルと揃わなくなる、といった具合です。ローカル編集では再描画として現れ、編集対象の外側にある髪の毛、看板、テクスチャまで一緒に描き直されます。

この LoRA は、編集をオリジナルのフレーム上で行わせます。トリガーワードはありません。読み込んで、いつもどおり編集指示を書けば、変更部分以外のピクセルは元の位置に留まります。

測定されたドリフト

モデルカードには、トレーニングセットに一度も含まれていないホールドアウト編集の数値が報告されています。オフセットは、オリジナルと比較して測定した画像内で最もずれの大きいコーナーの値です。スタイル列は各レンダリングを素の Qwen-Image 2.1 の見た目と比較したもので、距離が小さいほど近い一致を意味します。

ホールドアウト編集、素の Qwen 2.1 と LoRA の比較LoRA なしstep 1500step 2000
リスタイル (36): 最大コーナーずれ、中央値24.3 px1.6 px0.9 px
リスタイル: 最大コーナーずれ、最悪ケース61.1 px12.9 px3.5 px
ずれが 3 px 未満のリスタイル3 %75 %97 %
リスタイル (15): 素の Qwen の見た目に対する色距離7.06.310.9
再ライトとローカル編集 (12): 最大コーナーずれ、中央値0.7 px0.1 px0.1 px

素の Qwen-Image 2.1 の 2 つのシードは、この色スケール上で互いに 7.0 異なります。つまり step 1500 のリスタイルは、素の Qwen が自分自身と似ているのと同じくらい素の Qwen に似ています。step 2000 はより正確に位置が揃いますが、見た目が変わり始めます。紙がより白くなり、インクとグアッシュの色味が減ります。

2 つ目のセットは、ホールドアウト写真に対する 18 件の色変更と削除の編集で、ドリフトではなく再描画を測定しています。各レンダリングはまずオリジナルと位置合わせされるため、カウントされるのはオフセットではなく実際の再描画です。

素の Qwen が髪、店舗の看板、信号機を描き直し、LoRA はそれらに手を付けない街角の色変更
編集対象の外側LoRA なしstep 1500step 2000
目立って変化したピクセル12.8 %7.5 %7.5 %
オリジナルに対する PSNR27.7 dB31.6 dB31.7 dB

参考までに、Qwen-Image 2.1 VAE だけで画像をエンコード・デコードすると、37 dB で約 2 % のピクセルが変化します。これが下限値です。編集自体は、LoRA の有無にかかわらず 18 件すべてで行われています。

シーンが引き伸ばされる素の Qwen に対し、LoRA は位置を保つ、コミックページとしてレンダリングされた街角 地平線が持ち上がる素の Qwen に対し、LoRA はライン上に保つ、コミックページとしてリスタイルされた海岸道路

同じ編集を LoRA ありとなしで並べて実行した比較です。モデルカードより。

step 1500 か step 2000 か

ファイル備考
qwen-image-2.1-consistency.safetensorsstep 1500。推奨の出発点です。Qwen 本来の見た目を維持します。
qwen-image-2.1-consistency-2000.safetensorsstep 2000。最も正確に整列しますが、絵画は少し淡くなります。

どちらも rank 32 で、ComfyUI のキー命名(diffusion_model.transformer_blocks.*)を使用しており、384 個のテンソルすべてが Comfy-Org の Qwen-Image 2.1 重みにロードされます。

ComfyUI での実行方法

このアダプターはモデル専用の LoRA なので、カスタムノードは不要です。任意の Qwen-Image 2.1 編集グラフに追加するには:

  1. .safetensors ファイルを ComfyUI/models/loras/ に置き、モデルローダーの直後に LoraLoaderModelOnly ノードを strength 1.0 で追加します。strength を下げるとドリフトが一部戻ります。
  2. Text Encode Qwen Image 2.1 ノードを使い、image_1 に画像を、resolution を 0 に、prompt に編集指示を設定します。
  3. エンコーダーの latent 出力を Kサンプラー でサンプリングします。25 steps、CFG 1、euler と simple、denoise 1 です。これ以外のサイズの潜在を使用すると、Qwen はサイズ比の分だけズームしてしまい、どの LoRA でも元に戻せません。
  4. Qwen-Image 2.1 の VAE は RGBA をデコードするため、VAEデコード でデコードし、続いて Split Image with Alpha を使用します。

これらの数値は、このパックの Qwen-Image 2.1 Edit サンプルグラフから得られたものです。リポジトリには 2 つの既成ワークフローが同梱されています:

2 つ目のワークフローは LoRA をオフにし、代わりに Realign to Source ノードを使って、完了した編集をオリジナルに位置合わせし直します。何かを移動させる必要がある編集にはこちらが適しています。どちらも作者の ComfyUI-AusBoss ノードで構築されていますが、カードには同等のノードでも問題ないと記されています。

トレーニング方法

データセットは実際の Qwen-Image 2.1 編集から構築されており、ドリフトを測定して各ターゲットから取り除くことで、すべてのトレーニング例がソースのフレーム上に収まるようになっています:

  • 257 枚の画像から作られた 950 の編集ペア: このデータセット用に Qwen-Image 2.1 でレンダリングした 110 枚のポートレート、133 枚の Unsplash 写真、作者の参照フォルダーから厳選した 14 枚の画像。
  • ペアの種類: 順方向ペア(画像から編集へ)、逆方向ペア(編集から画像へ)、および編集対象の外側ではオリジナルのピクセルを保持するローカル編集。
  • トレーニング: Comfy-Org INT8 ConvRot ベースで arch: qwen_image_2 を指定して ostris/ai-toolkit を使用し、参照はターゲットのサイズに保ちました。Rank 32、alpha 32、AdamW8bit で lr 1e-4、バッチ 1、shift timesteps、ターゲット解像度 1408。H100 1 台で 3,000 ステップを実行し、1 ステップあたり約 1.9 秒、250 ステップごとにチェックポイントを保存しました。

制限事項

カードは、このリリースの適用範囲がどれほど狭いかを率直に述べています。9 月 28 日の更新で作者は、データセットが特定の種類の編集に対して LoRA を過適合させた可能性があり、新しいポーズや頭の向きなど実際の動きを必要とする要求を無視することがあると書いています。新しいデータセットがまとまり次第 v2 が計画されており、それまではそうした編集にはリアラインワークフローが推奨の方法です。

その他に明記されている制限:

  • 4 ステップや 8 ステップの turbo LoRA、2 MP、CFG 1 超ではまだテストされていません。
  • コミックやアニメのリスタイルではすべての輪郭が描き直されるため、一部の形はそれ自体で数ピクセルずれることがあります。step 1500 での最悪のリスタイルでは、コーナーが 12.9 px ずれていました。
  • これは画像を所定の位置に保つものです。弱い編集を強くするものではありません。素の Qwen がその編集をまったく行わない場合、LoRA でもそれは変わりません。

入手方法

qwen-image-2.1-consistency.safetensors をダウンロード (152 MB)

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Qwen-Image 2.1 Consistency LoRA: 編集を元のフレームからずらさない | ComfyUI Wiki