Nvidia Qwen-Image-Flash:Qwen-Image 的 4 步 DMD2 蒸馏模型
ComfyUI Wikinews
NVIDIA 发布 Qwen-Image-Flash,这是 Qwen-Image 的 4 步 DMD2 蒸馏版本,保留基础架构以实现快速文生图生成。
NVIDIA 发布了 Qwen-Image-Flash,这是 Qwen/Qwen-Image 的 4 步 DMD2 蒸馏版本,在保留基础模型架构的同时大幅降低了生成成本。
什么是 Qwen-Image-Flash?
Qwen-Image-Flash 是 Qwen-Image 的少步蒸馏 checkpoint,基于 改进分布匹配蒸馏(Improved Distribution Matching Distillation,DMD2) 构建,使用了 NVIDIA FastGen、NVIDIA Model Optimizer 和 NVIDIA AutoModel。蒸馏后的学生权重替换了基础 Transformer,而流水线的其余部分保持不变,因此该模型仍然是 Qwen-Image 家族的即插即用成员。
关键规格:
- Transformer: 20.43B 参数,与 Qwen-Image 相同的 MMDiT 架构
- 步数: 4 次函数评估(NFE),低于基础模型的默认调度
- 调度器: 内置 FlowMatch Euler,使用静态 shift-3 轨迹,生成 Sigmas
[1.0, 0.9, 0.75, 0.5, 0.0] - 流水线: Qwen2.5-VL 文本编码器、Qwen tokenizer、Qwen-Image VAE
随附论文 Qwen-Image-Flash: Beyond Objective Design 描述了一种统一的少步方案,仅需 4 次 NFE 即可同时实现文生图生成和指令引导的图像编辑。
可用性
官方发布是 Diffusers checkpoint。使用 diffusers 中的 QwenImagePipeline 运行,采用 4 步推理、true_cfg_scale=1.0 和内置调度器:
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]
image.save("qwen-image-flash.png")
评论
使用 GitHub 登录后即可参与讨论。