Krea 2 Turbo SDA LoRAがサンプリングの多様性を復元

ComfyUI Wikinews

F16がSemantic Directional Alignmentで学習したKrea 2 Turbo LoRAをリリース: 同じプロンプトでもシードごとに異なる猫、車、シーンを生成し、品質は劣化しません。

Krea 2 Turbo SDA Diversity LoRA v1.0 (Hugging Face) by F16は、蒸留された高速モデルの既知のトレードオフを修正します: Krea 2 Turboは、同じプロンプトからシード間でほぼ同じ画像を再生成します。このrank-32 LoRAは、画像品質やプロンプト忠実度を損なうことなく、そのシード多様性を復元します。HPSv2.1品質を同等に保ちながら、ペアワイズCLIP距離で+85%の向上が測定されています。

最も明確な例は、*「窓辺に座っている猫」*の16シードです。ベースラインのTurboは毎回同じ茶トラと白の猫を描き直します。LoRAを有効にすると、シードによって毛の模様、ライティング、季節、さらには窓の設定まで変化します:

ベースライン: 16シード、1匹の猫SDA LoRA使用: 16シード、16匹の猫
ベースラインTurbo: 同じ猫を16回SDA LoRA使用: 毛、ライト、設定が変化

同じパターンは、静物画(1つのパイナップルのテンプレート vs 多様な構図)やポートレート(同一のスタジオヘッドショットのフレーミング vs 異なる年齢、髪型、シーン)にも当てはまります。

SDAの仕組み

SDA原理図

Semantic Directional Alignmentは、多様性の折りたたみを方向の問題として扱います。1つのトレーニング画像について、2つのランダムノイズが描画され、構成が決定される8ステップTurboスケジュールの最も学習可能なステップであるシグマ0.9567までノイズ化されます。凍結された教師モデル(Krea 2 RAW、非蒸留の親モデル)と生徒モデル(TurboとLoRA)は、それぞれ両方のノイズに対して画像がどうなるかを予測し、凍結されたCLIPスタックが予測を埋め込みます。教師の知覚方向の変化は、ノイズの交換が画像をどのように動かすべきかを記録します。損失は、すべてのノイズを1つのテンプレートに折りたたむのではなく、生徒の方向がそれに一致するように教えます。ベスト5の候補探索により、学習速度が約3倍向上します。

トレーニングには1024x1024の画像が109枚のみ使用されました。これは、小さなアダプターがスタイルを逸脱させずに構図を変えられる理由を説明しています。

ゲートが重要: 2ステップ後はオフ

LoRAは単一の高ノイズノードでトレーニングされたため、8つのデノイズステップの最初の2ステップのみで有効にする必要があります。作者の測定結果:

ゲート(8ステップ中の有効ステップ)結果
1動作するが、多様性が20%低下
2意図した構成、上記のすべての数値
8(常時オン)品質の崩壊: ノイズまたはぼやけ、HPSが-10%

標準のComfyUIはすべてのステップでLoRAを適用するため、ステップ2の後にアダプターを切り替えるには、ステップごとのLoRAスケジューリングノード(フックまたはスケジューリングカスタムノード)が必要です。リポジトリには、ゲートが配線されたClownsharKSampler Betaを中心に構築された既製ワークフロー、Krea2_turbo_sda_workflow.jsonも同梱されています。

ファイル

ファイルサイズ用途
krea2_turbo_sda_v1.0_comfy.safetensors447 MBComfyUIキー形式
krea2_turbo_sda_v1.0_diffusers.safetensors447 MBdiffusers Krea2Pipeline

モデルカード内のdiffusersパイプラインスニペットは、ゲートを1行のステップコールバックとして実装しています。中国語のモデルカードがリポジトリに含まれています。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Krea 2 Turbo SDA LoRAがサンプリングの多様性を復元 | ComfyUI Wiki