Qwen-Image 2.1 Fun Acc LoRA:官方 4 步蒸馏加速模型

ComfyUI Wikinews

阿里 PAI 通过 346 MB 的 PDD LoRA 将 Qwen-Image 2.1 蒸馏至 4 步,覆盖文生图与指令编辑,并自带专属 sigma 调度表。

Qwen-Image-2.1-Fun-Acc-LoRAs(Hugging Face | VideoX-Fun)是阿里 PAI 为 Qwen-Image 2.1 推出的 4 步加速适配器。单个 346 MB 的 LoRA 借助并行解码蒸馏(PDD)将文生图与指令式编辑压缩到 4 NFE,仓库同时提供了采样器代码以及它所蒸馏所对应的精确 sigma 调度表。

该适配器沿用了阿里 PAI 在 8 月为 MiniMax H3 PDD Acc LoRAs 使用的同一套方案:选取一个强大的基础模型,用并行解码蒸馏(PDD,arXiv 2607.26004)对其进行蒸馏,然后发布提取出的 LoRA 以及复现参考结果所需的推理代码。Qwen-Image 2.1 本身发布于 2026 年 9 月 20 日,并已获得 ComfyUI 支持,因此这是一个诞生仅数天的模型的加速变体。

仓库中包含的内容

适配器models/Qwen-Image-2.1-Fun-Acc-4Step.safetensors,346 MB,rank 64,BF16 下 network_alpha 为 64
基础模型Qwen-Image 2.1(Qwen/Qwen-Image-2.1),权重未做任何修改
步数4 NFE(pdd_num_steps: 4,pdd_block_size: 1)
任务文生图与指令式图像编辑
训练目标全部 32 个 transformer 块的 img_in、modulation.1、norm_out.linear、timestep embedders、attn.to_q/to_k/to_v/to_out.0 与 img_mlp,以及 txt_in.in_layer / txt_in.out_layer
仅推理额外参数注意力层的 norm_q / norm_k 与 txt_in.text_norm 以完整参数形式存储,而非 LoRA 对
默认采样尺寸2048 x 2048(pdd_sample_size)
采样精度native_time_fp32_state

sigma 调度表是本次发布的一部分,而非实现细节:pdd_config.json 将四步调度固定为 1.0, 0.9169867, 0.7861579, 0.549491, 0.0,导出格式为 qwenimage21_extracted_prefused_v1。正是这些数值决定了它并非一个可以随意替换的普通 LoRA。使用默认 Sigmas 的通用 4 步采样器无法复现蒸馏后的行为。

效果对比

模型卡片为每个示例都提供了三方对比:40 NFE 的 teacher、4 NFE 的 PDD LoRA,以及 4 NFE 的 Viggle v0.1 full。PDD 不仅与自己的 teacher 对比,还与针对该模型的另一条 4 步路线进行对比,即 9 月更早发布的 Viggle turbo LoRA。

40 NFE 的 Teacher 输出4 NFE 的 PDD LoRA 输出4 NFE 的 Viggle v0.1 输出
Teacher:40 NFEPDD LoRA:4 NFEViggle v0.1 full:4 NFE

文生图示例,提示词取自 PDD 论文。三个面板均使用种子 42。

同一个适配器同样覆盖编辑任务,包括多引用编辑。下方示例重绘了引用图像中的旗帜,第三列是同样的 4 步路线,由 Viggle turbo LoRA 提供。

编辑引用图Teacher 编辑结果PDD LoRA 编辑结果Viggle v0.1 编辑结果
引用图像Teacher:40 NFEPDD LoRA:4 NFEViggle v0.1 full:4 NFE
Teacher 双引用编辑PDD LoRA 双引用编辑Viggle v0.1 双引用编辑
Teacher:40 NFEPDD LoRA:4 NFEViggle v0.1 full:4 NFE

双引用编辑示例(人物与猫),种子 43。

已知局限

模型卡片列出了两处相对 teacher 的已知差距,而不是留待用户自行发现:

  • 密集的小号文字可能出现明显劣化,字符笔画扭曲、可读性降低。
  • 部分编辑输出比 teacher 的结果略微更模糊、更暗,细节清晰度有所下降。

可用性

目前没有官方 ComfyUI 支持,本次发布是针对官方 pipeline 编写的:

  • 仅限 Diffusers: 将随附的 qwenimage21_pdd.py 与 lora_utils_pdd.py 与脚本放在同一目录,并运行 python predict_t2i.py(生成)或 python predict_t2i_edit.py(编辑)。
  • VideoX-Fun: 使用能够从 videox_fun.pipeline 导出 QwenImage21Pipeline 的代码版本,并运行 predict_t2i_videox_fun.py 或 predict_t2i_edit_videox_fun.py。

对 ComfyUI 而言,目前只有一条实验性路线:Kijai 发布了 ComfyUI 仓库的 Qwen-Image 2.1 PDD 分支,而该 LoRA 在 ComfyUI 加载器使用前还需要转换。由于调度表以及非 LoRA 的 norm_q / norm_k / text_norm 参数都是蒸馏的一部分,请将本适配器的 ComfyUI 转换视为社区工作,而非受支持的路径。

该团队更早为 MiniMax H3 发布的加速适配器,是理解这一系列发布方式的最佳参考:在那里,蒸馏后的 LoRA 同样是附带自己的推理方案发布,而不是作为基础模型的常规 LoRA。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Qwen-Image 2.1 Fun Acc LoRA:官方 4 步蒸馏加速模型 | ComfyUI Wiki