Qwen-Image-Flash:NVIDIA 对 Qwen-Image 的 4 步 DMD2 蒸馏

ComfyUI Wiki

Qwen-Image-Flash 是 NVIDIA 对 Qwen-Image 进行的四步 DMD2 蒸馏版本,保留基础 MMDiT transformer,并在 4 次函数评估内生成图像。

Q

Qwen-Image-Flash

文生图少步蒸馏开源

NVIDIA 蒸馏版 Qwen-Image:20.43B 的 MMDiT 去噪 transformer 被替换为 DMD2 学生权重,在封装好的 shift-3 FlowMatch 轨迹上以四次函数评估完成采样,Qwen2.5-VL 文本编码器与 Qwen-Image VAE 保持不变。

开发者NVIDIA
发布日期2026-07-23
基础模型Qwen/Qwen-Image
架构Diffusion Transformer (MMDiT),已蒸馏
参数去噪 transformer 为 20.43B(完整 pipeline 为 28.85B)
步数4 次函数评估,静态 shift-3 FlowMatch Euler scheduler
许可证NVIDIA Open Model License

什么是 Qwen-Image-Flash?

Qwen-Image-Flash 是 NVIDIA 基于 Qwen/Qwen-Image 打造的 四步 DMD2 蒸馏版本。改进的分布匹配蒸馏(Improved Distribution Matching Distillation)通过 NVIDIA FastGen、NVIDIA Model Optimizer 和 NVIDIA AutoModel 运行;只有 transformer 权重发生变化,因此 Qwen-Image pipeline 的其余部分(Qwen2.5-VL 文本编码器、Qwen tokenizer、Qwen-Image VAE、60 层 transformer 形状)均原样继承。

  • 去噪 transformer 包含 20.43B 参数,完整的可学习 pipeline 共 28.85B
  • 4 次函数评估,而非基础模型的完整调度流程
  • 封装好的 FlowMatch Euler scheduler 采用静态 shift-3 轨迹,生成的 sigmas 为 [1.0, 0.9, 0.75, 0.5, 0.0]
  • 使用英文 caption 蒸馏;模型卡片未评估其继承的中文语言能力

运行蒸馏 checkpoint

官方发布的是 Diffusers checkpoint,蒸馏过程已将教师的引导内部化:采样需要 num_inference_steps=4 并配合 true_cfg_scale=1.0。若把该权重放入仍应用 CFG 4.0 的 Qwen-Image 工作流中,会使引导翻倍。

from diffusers import QwenImagePipeline
import torch

pipe = QwenImagePipeline.from_pretrained(
    "nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
    width=1024, height=1024,
    num_inference_steps=4,
    true_cfg_scale=1.0,
).images[0]

模型卡片列出了 Diffusers 0.38.0 与 Transformers 5.12.1、SGLang Diffusion、vLLM-Omni 及 TensorRT-LLM VisualGen 作为受支持的运行时,并将 H100 和 B200 列为已验证硬件。ComfyUI 并不在官方引擎列表之中:请将这些单文件 transformer 权重视为与 Qwen-Image 系列在架构上兼容,而非官方支持的运行时。

Guides and workflows related to this model series.

No articles found.

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…