Krea 2 Turbo SDA LoRA 恢复采样多样性

ComfyUI Wikinews

F16 发布了一款使用语义方向对齐训练的 Krea 2 Turbo LoRA:相同的提示词在不同种子下能生成不同的猫、汽车和场景,且质量无损。

Krea 2 Turbo SDA 多样性 LoRA v1.0Hugging Face)来自 F16,修复了蒸馏快速模型的一个已知权衡:Krea 2 Turbo 在不同种子下使用相同提示词会生成几乎相同的图像。这款 rank-32 LoRA 在不损害图像质量或提示词遵循度的前提下恢复了种子多样性,经测量,成对 CLIP 距离提升了 +85%,同时 HPSv2.1 质量持平。

最清晰的示例是 "一只猫坐在窗台上" 的 16 个种子。基线 Turbo 每次都会重绘同一只虎斑白猫。启用 LoRA 后,不同种子会呈现不同的毛色图案、光线、季节甚至窗户场景:

基线:16 个种子,一只猫使用 SDA LoRA:16 个种子,16 只猫
基线 Turbo:同一只猫重复 16 次使用 SDA LoRA:毛色、光线和场景各不相同

同样的模式也适用于静物(单一菠萝模板 vs 多样构图)和肖像(相同的影棚头像取景 vs 不同的年龄、发型和场景)。

SDA 的工作原理

SDA 原理图

语义方向对齐将多样性折叠视为一个方向问题。对于一张训练图像,会抽取两个随机噪波并将其噪化至 sigma 0.9567,即 8 步 Turbo 调度中决定构图的可学习最高步。冻结的教师模型(Krea 2 RAW,即未蒸馏的父模型)和学生模型(Turbo 加上 LoRA)各自预测两个噪波对应的图像,然后一个冻结的 CLIP 堆栈对预测结果进行嵌入。教师模型在感知方向上的变化记录了噪波交换应该如何移动图像;损失函数则教导学生模型的方向与之匹配,而不是将所有噪波折叠到单一模板上。最佳 5 候选探索在此基础上额外提供了约 3 倍的学习速度。

训练仅使用了 109 张 1024x1024 的图像,这解释了为什么一个小型适配器能够改变构图而不漂移风格。

门控至关重要:前 2 步,然后关闭

该 LoRA 在单一高噪波节点上训练,因此它必须仅在 8 个去噪步骤中的前 2 步 处于激活状态。作者的测量结果:

门控(8 步中激活的步数)结果
1可用,但多样性降低 20%
2预期配置,上述所有数据
8(始终开启)质量崩溃:噪波或模糊,HPS 降低 -10%

ComfyUI 默认会在每一步应用 LoRA,因此需要使用逐步 LoRA 调度节点(约束或调度自定义节点)来在第 2 步之后切换关闭该适配器。该仓库还附带了一个现成的工作流 Krea2_turbo_sda_workflow.json,该工作流围绕 ClownsharKSampler 测试版构建并已接入门控。

文件

文件大小用途
krea2_turbo_sda_v1.0_comfy.safetensors447 MBComfyUI 键格式
krea2_turbo_sda_v1.0_diffusers.safetensors447 MBdiffusers Krea2Pipeline

模型卡片中的 diffusers pipeline 代码片段将门控实现为一行步骤回调。仓库中还包含一份中文模型卡片。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Krea 2 Turbo SDA LoRA 恢复采样多样性 | ComfyUI Wiki