Krea 2 Turbo SDA LoRA 恢复采样多样性
F16 发布了一款使用语义方向对齐训练的 Krea 2 Turbo LoRA:相同的提示词在不同种子下能生成不同的猫、汽车和场景,且质量无损。
最清晰的示例是 "一只猫坐在窗台上" 的 16 个种子。基线 Turbo 每次都会重绘同一只虎斑白猫。启用 LoRA 后,不同种子会呈现不同的毛色图案、光线、季节甚至窗户场景:
![]() | ![]() |
|---|---|
| 基线 Turbo:同一只猫重复 16 次 | 使用 SDA LoRA:毛色、光线和场景各不相同 |
同样的模式也适用于静物(单一菠萝模板 vs 多样构图)和肖像(相同的影棚头像取景 vs 不同的年龄、发型和场景)。
SDA 的工作原理
语义方向对齐将多样性折叠视为一个方向问题。对于一张训练图像,会抽取两个随机噪波并将其噪化至 sigma 0.9567,即 8 步 Turbo 调度中决定构图的可学习最高步。冻结的教师模型(Krea 2 RAW,即未蒸馏的父模型)和学生模型(Turbo 加上 LoRA)各自预测两个噪波对应的图像,然后一个冻结的 CLIP 堆栈对预测结果进行嵌入。教师模型在感知方向上的变化记录了噪波交换应该如何移动图像;损失函数则教导学生模型的方向与之匹配,而不是将所有噪波折叠到单一模板上。最佳 5 候选探索在此基础上额外提供了约 3 倍的学习速度。
训练仅使用了 109 张 1024x1024 的图像,这解释了为什么一个小型适配器能够改变构图而不漂移风格。
门控至关重要:前 2 步,然后关闭
该 LoRA 在单一高噪波节点上训练,因此它必须仅在 8 个去噪步骤中的前 2 步 处于激活状态。作者的测量结果:
| 门控(8 步中激活的步数) | 结果 |
|---|---|
| 1 | 可用,但多样性降低 20% |
| 2 | 预期配置,上述所有数据 |
| 8(始终开启) | 质量崩溃:噪波或模糊,HPS 降低 -10% |
ComfyUI 默认会在每一步应用 LoRA,因此需要使用逐步 LoRA 调度节点(约束或调度自定义节点)来在第 2 步之后切换关闭该适配器。该仓库还附带了一个现成的工作流 Krea2_turbo_sda_workflow.json,该工作流围绕 ClownsharKSampler 测试版构建并已接入门控。
文件
| 文件 | 大小 | 用途 |
|---|---|---|
krea2_turbo_sda_v1.0_comfy.safetensors | 447 MB | ComfyUI 键格式 |
krea2_turbo_sda_v1.0_diffusers.safetensors | 447 MB | diffusers Krea2Pipeline |
模型卡片中的 diffusers pipeline 代码片段将门控实现为一行步骤回调。仓库中还包含一份中文模型卡片。


评论
使用 GitHub 登录后即可参与讨论。