Qwen-Image-Flash : distillation DMD2 de Qwen-Image par NVIDIA

ComfyUI Wiki

Qwen-Image-Flash est la distillation DMD2 en quatre étapes de Qwen-Image par NVIDIA, qui conserve le transformer MMDiT de base et génère des images en 4 évaluations de fonction.

Q

Qwen-Image-Flash

Text-to-ImageFew-StepDistillationOpen Source

Le Qwen-Image distillé par NVIDIA : le transformer de débruitage MMDiT de 20,43B est remplacé par les poids étudiant DMD2 et échantillonné en quatre évaluations de fonction sur une trajectoire FlowMatch shift-3 packagée, avec l'encodeur de texte Qwen2.5-VL et le VAE Qwen-Image inchangés.

DéveloppeurNVIDIA
Date de sortie2026-07-23
Modèle de baseQwen/Qwen-Image
ArchitectureTransformer de diffusion (MMDiT), distillé
Paramètres20,43B dans le transformer de débruitage (28,85B dans le pipeline complet)
Étapes4 évaluations de fonction, scheduler FlowMatch Euler statique shift-3
LicenceNVIDIA Open Model License

Qu'est-ce que Qwen-Image-Flash ?

Qwen-Image-Flash est une version en quatre étapes, distillée par DMD2 de Qwen/Qwen-Image par NVIDIA. La distillation Improved Distribution Matching Distillation a été exécutée via NVIDIA FastGen, NVIDIA Model Optimizer et NVIDIA AutoModel ; seuls les poids du transformer changent, donc le reste du pipeline Qwen-Image (encodeur de texte Qwen2.5-VL, tokenizer Qwen, VAE Qwen-Image, forme du transformer à 60 couches) est hérité tel quel.

  • 20,43B paramètres dans le transformer de débruitage, 28,85B sur l'ensemble du pipeline appris
  • 4 évaluations de fonction au lieu du calendrier complet du modèle de base
  • Scheduler FlowMatch Euler packagé avec une trajectoire statique shift-3, produisant les sigmas [1.0, 0.9, 0.75, 0.5, 0.0]
  • Distillé avec des légendes en anglais ; la capacité héritée en langue chinoise n'est pas évaluée dans la carte du modèle

Exécuter le checkpoint distillé

La version officielle est un checkpoint Diffusers, et la distillation internalise le guidage de l'enseignant : l'échantillonnage nécessite num_inference_steps=4 conjointement avec true_cfg_scale=1.0. Déposer les poids dans un flux de travail Qwen-Image qui applique encore CFG 4.0 doublerait le guidage.

from diffusers import QwenImagePipeline
import torch

pipe = QwenImagePipeline.from_pretrained(
    "nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
    width=1024, height=1024,
    num_inference_steps=4,
    true_cfg_scale=1.0,
).images[0]

La carte du modèle liste Diffusers 0.38.0 avec Transformers 5.12.1, SGLang Diffusion, vLLM-Omni et TensorRT-LLM VisualGen comme runtimes pris en charge, avec H100 et B200 comme matériel validé. ComfyUI ne fait pas partie de la liste officielle des moteurs : considérez les poids du transformer en fichier unique comme compatibles au niveau de l'architecture avec la famille Qwen-Image, plutôt que comme un runtime officiellement pris en charge.

Guides and workflows related to this model series.

No articles found.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…