Qwen-Image 2.1 Fun Acc LoRA:官方 4 步蒸馏加速模型
阿里 PAI 通过 346 MB 的 PDD LoRA 将 Qwen-Image 2.1 蒸馏至 4 步,覆盖文生图与指令编辑,并自带专属 sigma 调度表。
该适配器沿用了阿里 PAI 在 8 月为 MiniMax H3 PDD Acc LoRAs 使用的同一套方案:选取一个强大的基础模型,用并行解码蒸馏(PDD,arXiv 2607.26004)对其进行蒸馏,然后发布提取出的 LoRA 以及复现参考结果所需的推理代码。Qwen-Image 2.1 本身发布于 2026 年 9 月 20 日,并已获得 ComfyUI 支持,因此这是一个诞生仅数天的模型的加速变体。
仓库中包含的内容
| 适配器 | models/Qwen-Image-2.1-Fun-Acc-4Step.safetensors,346 MB,rank 64,BF16 下 network_alpha 为 64 |
| 基础模型 | Qwen-Image 2.1(Qwen/Qwen-Image-2.1),权重未做任何修改 |
| 步数 | 4 NFE(pdd_num_steps: 4,pdd_block_size: 1) |
| 任务 | 文生图与指令式图像编辑 |
| 训练目标 | 全部 32 个 transformer 块的 img_in、modulation.1、norm_out.linear、timestep embedders、attn.to_q/to_k/to_v/to_out.0 与 img_mlp,以及 txt_in.in_layer / txt_in.out_layer |
| 仅推理额外参数 | 注意力层的 norm_q / norm_k 与 txt_in.text_norm 以完整参数形式存储,而非 LoRA 对 |
| 默认采样尺寸 | 2048 x 2048(pdd_sample_size) |
| 采样精度 | native_time_fp32_state |
sigma 调度表是本次发布的一部分,而非实现细节:pdd_config.json 将四步调度固定为 1.0, 0.9169867, 0.7861579, 0.549491, 0.0,导出格式为 qwenimage21_extracted_prefused_v1。正是这些数值决定了它并非一个可以随意替换的普通 LoRA。使用默认 Sigmas 的通用 4 步采样器无法复现蒸馏后的行为。
效果对比
模型卡片为每个示例都提供了三方对比:40 NFE 的 teacher、4 NFE 的 PDD LoRA,以及 4 NFE 的 Viggle v0.1 full。PDD 不仅与自己的 teacher 对比,还与针对该模型的另一条 4 步路线进行对比,即 9 月更早发布的 Viggle turbo LoRA。
![]() | ![]() | ![]() |
|---|---|---|
| Teacher:40 NFE | PDD LoRA:4 NFE | Viggle v0.1 full:4 NFE |
文生图示例,提示词取自 PDD 论文。三个面板均使用种子 42。
同一个适配器同样覆盖编辑任务,包括多引用编辑。下方示例重绘了引用图像中的旗帜,第三列是同样的 4 步路线,由 Viggle turbo LoRA 提供。
![]() | ![]() | ![]() | ![]() |
|---|---|---|---|
| 引用图像 | Teacher:40 NFE | PDD LoRA:4 NFE | Viggle v0.1 full:4 NFE |
![]() | ![]() | ![]() |
|---|---|---|
| Teacher:40 NFE | PDD LoRA:4 NFE | Viggle v0.1 full:4 NFE |
双引用编辑示例(人物与猫),种子 43。
已知局限
模型卡片列出了两处相对 teacher 的已知差距,而不是留待用户自行发现:
- 密集的小号文字可能出现明显劣化,字符笔画扭曲、可读性降低。
- 部分编辑输出比 teacher 的结果略微更模糊、更暗,细节清晰度有所下降。
可用性
目前没有官方 ComfyUI 支持,本次发布是针对官方 pipeline 编写的:
- 仅限 Diffusers: 将随附的
qwenimage21_pdd.py与lora_utils_pdd.py与脚本放在同一目录,并运行python predict_t2i.py(生成)或python predict_t2i_edit.py(编辑)。 - VideoX-Fun: 使用能够从
videox_fun.pipeline导出QwenImage21Pipeline的代码版本,并运行predict_t2i_videox_fun.py或predict_t2i_edit_videox_fun.py。
对 ComfyUI 而言,目前只有一条实验性路线:Kijai 发布了 ComfyUI 仓库的 Qwen-Image 2.1 PDD 分支,而该 LoRA 在 ComfyUI 加载器使用前还需要转换。由于调度表以及非 LoRA 的 norm_q / norm_k / text_norm 参数都是蒸馏的一部分,请将本适配器的 ComfyUI 转换视为社区工作,而非受支持的路径。
该团队更早为 MiniMax H3 发布的加速适配器,是理解这一系列发布方式的最佳参考:在那里,蒸馏后的 LoRA 同样是附带自己的推理方案发布,而不是作为基础模型的常规 LoRA。










评论
使用 GitHub 登录后即可参与讨论。