ComfyUI 中的 Pruna 5 步与 8 步 Qwen-Image 2.1 LoRA

ComfyUI Wikinews

PrunaAI 的 Pruna-Qwen-Image-2.1 LoRA 将 Qwen-Image 2.1 的文生图与编辑压缩到 5 步或 8 步、无需 CFG,并附有社区 ComfyUI 转换版本与分步 sigma 调度表。

Pruna-Qwen-Image-2.1 是 PrunaAI 为 Qwen-Image 2.1 推出的一对少步数 LoRA 适配器。它们仅需 5 或 8 次 transformer 前向传播,而非 40 次,即可完成文生图与多参考图编辑,无需无分类器引导,并且可加载在未经修改的基础流水线、文本编码器和 VAE 之上。
使用 Pruna 适配器在 1024 分辨率下的文生图示例

来自官方模型卡片的文生图对比。

两个适配器,两套调度表

本次发布并非一个蒸馏模型,而是两个分别训练的 student 模型,PrunaAI 希望用户根据自己更看重质量还是速度来选择其中一个:

适配器步数取舍
p_qwen_image_2.1_8step_v0.1.safetensors8质量更高,是推荐的默认选择
p_qwen_image_2.1_5step_v0.1.safetensors5速度更快,但图像质量明显更差

每个适配器都是针对各自的 sigma 调度表训练的,模型卡片要求一次只加载一个。调度表是必须精确复制的一环,因为这两个 student 并不是按照采样器自行推导出的步数来训练的:

步数Sigmas
51.0, 0.94, 0.857142857, 0.666666667, 0.4
81.0, 0.933333333, 0.857142857, 0.769230769, 0.666666667, 0.545454545, 0.4, 0.222222222

两者均采用 DMD 训练,均在 CFG 1.0 下配合空负面提示词运行,序列末尾的 0 由调度器追加,而不是写在调度表里。其他步数、调度表或 CFG 值都超出了适配器的训练范围。

在 1K 与 2K 下测得的文生图延迟

卡片中的文生图延迟图表,在单张 H100 80GB 上测得:预热一次后取三次请求的中位数,包含提示词编码、去噪和解码;基础模型使用 40 步并启用 KV 缓存,适配器使用 5 或 8 步且不启用缓存。

PrunaAI 的核心数字是最高 6.3 倍加速,而卡片对其未声称的内容也十分谨慎:这些耗时并不代表图像质量相同,基准测试时 LoRA 保持未合并状态,示例图像启用了 KV 缓存,而图表并未在该设置下重新测量。

训练覆盖范围与限制

适配器仅在 1K 分辨率下训练,使用了普通提示词与上采样提示词的混合数据,覆盖文生图以及最多 3 张参考图的单图或多图编辑。PrunaAI 建议从 1024x1024 开始,并认为 2K 输出、更多参考图以及简短含糊的提示词超出覆盖范围,质量可能有所波动。

该版本被明确标注为 v0.1,仍在进行中:

  • 质量低于 40 步基础模型,随着蒸馏效果提升,仓库将持续更新。
  • 5 步适配器是速度更快的那个,其图像质量明显差于 8 步适配器。
  • 它不是独立模型:仍然需要 Qwen/Qwen-Image-2.1 基础权重。
多参考图编辑示例

来自官方模型卡片的编辑网格图。

ComfyUI 可用性

目前还没有针对这些适配器的官方 ComfyUI 包:它们以 diffusers/PEFT 文件形式发布,rank 为 64,PEFT alpha 为 128,而该 alpha 存储在 safetensors 元数据中,并不在 ComfyUI 的 LoRA 加载器所读取的张量里,因此直接放入会以错误的缩放运行。社区在发布后一天内就填补了这一空缺:

  • NidAll/pruna-image-2.1-comfyui-loras 是一个非官方转换版本,为 224 个 LoRA 目标各添加了一个标量 .alpha 张量,使适配器在 LoRA 强度 1.0 时以预期的缩放运行,同时不改动 A、B 权重。它还附带了自有的 5 步与 8 步工作流 JSON。
  • 这些工作流只使用原生 ComfyUI 节点:ManualSigmas、SamplerCustom、Euler、CFG 1.0、LoRA 强度 1.0、无负面提示词,以及 1024x1024 的文生图。基础文件来自 Comfy-Org/Qwen-Image-2.1,这意味着对于使用消费级显存的用户来说,int8_convrot transformer 是实际可行的目标。

ComfyUI 自 Day-0 发布 起就原生支持 Qwen-Image 2.1,因此无需额外安装任何东西:一个包含 ManualSigmas 和 SamplerCustom 的最近版本 ComfyUI,即可覆盖这两套随附工作流。

1024 分辨率下的图像编辑示例

来自模型卡片的编辑示例,使用少步数适配器运行。

2048 分辨率下的文生图示例

2048 分辨率下的文生图,超出 1K 训练覆盖范围,但属于已发布的延迟测量的一部分。

早期测试主要来自 ComfyUI 社区,而不是发布方本身:在 Banodoco 的 #qwen-image 频道中,这些适配器与 Viggle 的 turbo 以及官方 Qwen Acc LoRA 进行了对比,测试者特别指出了 8 步适配器;权重上线后不久,它们也被发布到 r/StableDiffusion 和 X 上。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
ComfyUI 中的 Pruna 5 步与 8 步 Qwen-Image 2.1 LoRA | ComfyUI Wiki