- 首页
- Models
- Qwen Image
- Qwen-Image-Flash:NVIDIA 对 Qwen-Image 的 4 步 DMD2 蒸馏
Qwen-Image-Flash:NVIDIA 对 Qwen-Image 的 4 步 DMD2 蒸馏
Qwen-Image-Flash 是 NVIDIA 对 Qwen-Image 进行的四步 DMD2 蒸馏版本,保留基础 MMDiT transformer,并在 4 次函数评估内生成图像。
Qwen-Image-Flash
文生图少步蒸馏开源NVIDIA 蒸馏版 Qwen-Image:20.43B 的 MMDiT 去噪 transformer 被替换为 DMD2 学生权重,在封装好的 shift-3 FlowMatch 轨迹上以四次函数评估完成采样,Qwen2.5-VL 文本编码器与 Qwen-Image VAE 保持不变。
| 开发者 | NVIDIA |
| 发布日期 | 2026-07-23 |
| 基础模型 | Qwen/Qwen-Image |
| 架构 | Diffusion Transformer (MMDiT),已蒸馏 |
| 参数 | 去噪 transformer 为 20.43B(完整 pipeline 为 28.85B) |
| 步数 | 4 次函数评估,静态 shift-3 FlowMatch Euler scheduler |
| 许可证 | NVIDIA Open Model License |
什么是 Qwen-Image-Flash?
Qwen-Image-Flash 是 NVIDIA 基于 Qwen/Qwen-Image 打造的 四步 DMD2 蒸馏版本。改进的分布匹配蒸馏(Improved Distribution Matching Distillation)通过 NVIDIA FastGen、NVIDIA Model Optimizer 和 NVIDIA AutoModel 运行;只有 transformer 权重发生变化,因此 Qwen-Image pipeline 的其余部分(Qwen2.5-VL 文本编码器、Qwen tokenizer、Qwen-Image VAE、60 层 transformer 形状)均原样继承。
- 去噪 transformer 包含 20.43B 参数,完整的可学习 pipeline 共 28.85B
- 4 次函数评估,而非基础模型的完整调度流程
- 封装好的 FlowMatch Euler scheduler 采用静态 shift-3 轨迹,生成的 sigmas 为
[1.0, 0.9, 0.75, 0.5, 0.0] - 使用英文 caption 蒸馏;模型卡片未评估其继承的中文语言能力
运行蒸馏 checkpoint
官方发布的是 Diffusers checkpoint,蒸馏过程已将教师的引导内部化:采样需要 num_inference_steps=4 并配合 true_cfg_scale=1.0。若把该权重放入仍应用 CFG 4.0 的 Qwen-Image 工作流中,会使引导翻倍。
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]模型卡片列出了 Diffusers 0.38.0 与 Transformers 5.12.1、SGLang Diffusion、vLLM-Omni 及 TensorRT-LLM VisualGen 作为受支持的运行时,并将 H100 和 B200 列为已验证硬件。ComfyUI 并不在官方引擎列表之中:请将这些单文件 transformer 权重视为与 Qwen-Image 系列在架构上兼容,而非官方支持的运行时。
Guides and workflows related to this model series.
评论
使用 GitHub 登录后即可参与讨论。