Krea 2 Turbo SDA LoRAがサンプリングの多様性を復元
F16がSemantic Directional Alignmentで学習したKrea 2 Turbo LoRAをリリース: 同じプロンプトでもシードごとに異なる猫、車、シーンを生成し、品質は劣化しません。
最も明確な例は、*「窓辺に座っている猫」*の16シードです。ベースラインのTurboは毎回同じ茶トラと白の猫を描き直します。LoRAを有効にすると、シードによって毛の模様、ライティング、季節、さらには窓の設定まで変化します:
![]() | ![]() |
|---|---|
| ベースラインTurbo: 同じ猫を16回 | SDA LoRA使用: 毛、ライト、設定が変化 |
同じパターンは、静物画(1つのパイナップルのテンプレート vs 多様な構図)やポートレート(同一のスタジオヘッドショットのフレーミング vs 異なる年齢、髪型、シーン)にも当てはまります。
SDAの仕組み
Semantic Directional Alignmentは、多様性の折りたたみを方向の問題として扱います。1つのトレーニング画像について、2つのランダムノイズが描画され、構成が決定される8ステップTurboスケジュールの最も学習可能なステップであるシグマ0.9567までノイズ化されます。凍結された教師モデル(Krea 2 RAW、非蒸留の親モデル)と生徒モデル(TurboとLoRA)は、それぞれ両方のノイズに対して画像がどうなるかを予測し、凍結されたCLIPスタックが予測を埋め込みます。教師の知覚方向の変化は、ノイズの交換が画像をどのように動かすべきかを記録します。損失は、すべてのノイズを1つのテンプレートに折りたたむのではなく、生徒の方向がそれに一致するように教えます。ベスト5の候補探索により、学習速度が約3倍向上します。
トレーニングには1024x1024の画像が109枚のみ使用されました。これは、小さなアダプターがスタイルを逸脱させずに構図を変えられる理由を説明しています。
ゲートが重要: 2ステップ後はオフ
LoRAは単一の高ノイズノードでトレーニングされたため、8つのデノイズステップの最初の2ステップのみで有効にする必要があります。作者の測定結果:
| ゲート(8ステップ中の有効ステップ) | 結果 |
|---|---|
| 1 | 動作するが、多様性が20%低下 |
| 2 | 意図した構成、上記のすべての数値 |
| 8(常時オン) | 品質の崩壊: ノイズまたはぼやけ、HPSが-10% |
標準のComfyUIはすべてのステップでLoRAを適用するため、ステップ2の後にアダプターを切り替えるには、ステップごとのLoRAスケジューリングノード(フックまたはスケジューリングカスタムノード)が必要です。リポジトリには、ゲートが配線されたClownsharKSampler Betaを中心に構築された既製ワークフロー、Krea2_turbo_sda_workflow.jsonも同梱されています。
ファイル
| ファイル | サイズ | 用途 |
|---|---|---|
krea2_turbo_sda_v1.0_comfy.safetensors | 447 MB | ComfyUIキー形式 |
krea2_turbo_sda_v1.0_diffusers.safetensors | 447 MB | diffusers Krea2Pipeline |
モデルカード内のdiffusersパイプラインスニペットは、ゲートを1行のステップコールバックとして実装しています。中国語のモデルカードがリポジトリに含まれています。


コメント
GitHubでサインインしてディスカッションに参加しましょう。