Nvidia Qwen-Image-Flash:Qwen-Image 的 4 步 DMD2 蒸馏模型

ComfyUI Wikinews

NVIDIA 发布 Qwen-Image-Flash,这是 Qwen-Image 的 4 步 DMD2 蒸馏版本,保留基础架构以实现快速文生图生成。

NVIDIA 发布了 Qwen-Image-Flash,这是 Qwen/Qwen-Image4 步 DMD2 蒸馏版本,在保留基础模型架构的同时大幅降低了生成成本。

Qwen-Image-Flash 展示

什么是 Qwen-Image-Flash?

Qwen-Image-Flash 是 Qwen-Image 的少步蒸馏 checkpoint,基于 改进分布匹配蒸馏(Improved Distribution Matching Distillation,DMD2) 构建,使用了 NVIDIA FastGenNVIDIA Model OptimizerNVIDIA AutoModel。蒸馏后的学生权重替换了基础 Transformer,而流水线的其余部分保持不变,因此该模型仍然是 Qwen-Image 家族的即插即用成员。

关键规格:

  • Transformer: 20.43B 参数,与 Qwen-Image 相同的 MMDiT 架构
  • 步数: 4 次函数评估(NFE),低于基础模型的默认调度
  • 调度器: 内置 FlowMatch Euler,使用静态 shift-3 轨迹,生成 Sigmas [1.0, 0.9, 0.75, 0.5, 0.0]
  • 流水线: Qwen2.5-VL 文本编码器、Qwen tokenizer、Qwen-Image VAE

随附论文 Qwen-Image-Flash: Beyond Objective Design 描述了一种统一的少步方案,仅需 4 次 NFE 即可同时实现文生图生成和指令引导的图像编辑。

可用性

官方发布是 Diffusers checkpoint。使用 diffusers 中的 QwenImagePipeline 运行,采用 4 步推理、true_cfg_scale=1.0 和内置调度器:

from diffusers import QwenImagePipeline
import torch

pipe = QwenImagePipeline.from_pretrained(
    "nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
    width=1024, height=1024,
    num_inference_steps=4,
    true_cfg_scale=1.0,
).images[0]
image.save("qwen-image-flash.png")

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Nvidia Qwen-Image-Flash:Qwen-Image 的 4 步 DMD2 蒸馏模型 | ComfyUI Wiki