Fizgig v6.5: カスタムアダプターによるQwen Image 2.1 LoRAトレーニング

ComfyUI Wikinews

Fizgig v6.5は、スタジオ独自のトレーニングアダプターによるQwen Image 2.1のLoRAおよびLoKRトレーニング、ターボプレビュー、新しいドライバーシステムを追加し、ComfyUIが読み込めるLoRAを保存します。

9月27日にリリースされたFizgig v6.5.0は、スタジオ内でQwen Image 2.1をトレーニング可能なベースモデルにします(GitHub | リリースノート | Qwen Image 2.1ガイド)。FizgigはすでにFlux 2 Klein、Krea 2、MiniMax H3向けのLoRA、LoKR、フルファインチューニングのトレーニングに対応しています。今回のリリースでは、同じツールセットをQwenの画像モデルに提供します。また、Qwen Image 2.1はスタジオの新しいドライバーシステムを通じて追加された最初のモデルです。

FizgigのLoRAおよびファインチューニングスタジオ

Fizgig: Flux 2 Klein 9B、Krea 2、MiniMax H3、そして今回Qwen Image 2.1に対応した、トレーニング・ファインチューニング・修復・探索のためのワークベンチ

Qwen Image 2.1のトレーニングに含まれるもの

  • LoRAまたはLoKRトレーニング。Adaptive LRまたはAutomagic、EMA、Context LoRA、一時停止と再開に対応。
  • トレーニング中のターボプレビュー。Viggleの6ステップのターボLoRAで駆動します。Fizgigは独自のテストで、フル強度でのターボのデフォルト6ステップよりも良い結果が得られることを確認したため、デフォルトではフル強度を下回る0.7で10ステップ実行します。
  • 画像ごとの損失監視: 問題のある画像の検出、画像ごとの学習率、外れ値へのウォームアップ、そして停止した画像の自動再キャプション。再キャプションにはキャプションタブと同じQwen3-VLキャプショナーを使用します。
  • 実行中のライブサンプルオーバーライドパネル。
  • 5つのワークベンチツールすべて: Repair Studio、LoRA the Explorer、Profiler、Extract、LoRA Royale。

保存されたLoRA、LoKR、Repair Studioの保存内容、Extractの出力は、ComfyUI標準のLoRAローダーで読み込めます。

Fizgig独自のトレーニングアダプター

Qwen 2.1のLoRAには、テクスチャに崩壊したり、実行の途中で不安定に揺れたりする癖があり、損失が低下してもその兆候は分かりません。Fizgigの解決策はトレーニングアダプターです。これはトレーニング中は固定されたまま有効で、プレビュー時にはオフになり、保存されるLoRAには決して含まれない小さなLoRAなので、結果は素のモデルで動作します。既存のQwen 2.1トレーニングアシスタントよりも高い解像度でトレーニングされており、作者によれば、これを使ってトレーニングしたLoRAは崩壊を避けられるだけでなく、はるかにシャープな仕上がりになります。すべてのQwenプリセットでデフォルトで有効になっており、あらゆるトレーナー向けにHugging Faceでも公開されています。

3つのプリセット、1つの最適点

3つのプリセットはすべて、0.5 MP、adamw8bit、EMA 0.98、トレーニングアダプターを使用し、30エポック、毎エポック保存でトレーニングします。

プリセットランク学習率用途
Qwen 2.1 Fast(デフォルト)8Adaptive LR 2e-4~4e-4ほとんどの被写体。作者のテストでは最も早く似姿に到達し、肌のディテール保持も最も優れています。
Qwen 2.1 Standard16Adaptive LR 1e-4~2e-4より大きな、または混在したデータセット。Fastプリセットの学習率でランク16にすると過学習します。
Qwen 2.1 Style16固定 1.5e-4スタイル。Adaptive LRはスタイルのデータセットでは上昇しがちで、そこでスタイルが焼き付きすぎます。

より速くトレーニングする理由はこうです。Qwenは素の状態で非常にシャープな画像を描画しますが、LoRAは肌のテクスチャのような細かいディテールをデータセットの側へ引き寄せるため、柔らかい写真で長く実行すると、Qwenのシャープさをデータセットの柔らかさと引き換えにしてしまいます。0.5 MPは50万ピクセルで、正方形の画像では約704×704にあたり、Fizgigはそのピクセル数で各画像を形状ごとにバケット分けします。4:5で624×784、2:3で576×848、9:16で528×928です。保存されたエポックはLoRA Royaleでスクラブできるので、後のエポックが柔らかく見える場合は、以前のエポックの方が良い選択であることがよくあります。

10GBのGPUカードまで対応

ベース精度とブロックスワップは、空きVRAMから自動的に決まります。自動は24GB以上でbf16、12~16GBでINT8、10GBで4ビットNF4を選択します。10GBはQwen Image 2.1の下限であり、約20GBを下回る空き容量ではテキストエンコーダーが8ビットに量子化され、それがこの下限を決めています。作者のテストでは、12GBに制限したRTX 5090がプレビューを含めてピーク9.9GBでINT8トレーニングを行い、10GBに制限するとピーク7.3GBでNF4トレーニングを行いました。

ドライバーシステム

Qwen Image 2.1は、Fizgigの新しいドライバーシステムを通じて追加された最初のモデルです。モデルは、そのファイル、そのLoRA形式、そのモデルコードを標準インターフェースの背後に一度記述するだけで、トレーニング、プレビュー、ダウンロード、メモリ計画、そして5つのワークベンチツールすべてがその記述から動作します。このシステムのガイドと、さらなるモデル追加のためのオープンプルリクエストが来週公開される予定です。

入手方法

環境設定タブのQwen Image 2.1セクションでDownload models for meを押すと、DiT、VAE、テキストエンコーダー、トレーニングアダプター、ターボLoRA(約34GB)を取得します。Qwen3-VLキャプショナーをまだお持ちでなければそれも取得します。その後、トレーニングタブでベースモデルとしてQwen Image 2.1を選択してください。Qwen Image 2.1の編集トレーニングは近日公開とされています。

Fizgigはスタンドアロンのトレーナーであり、ComfyUIノードではありません。kohya形式の.safetensors LoRAを保存し、それはそのままComfyUI/models/loras/に投入できます。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Fizgig v6.5: カスタムアダプターによるQwen Image 2.1 LoRAトレーニング | ComfyUI Wiki