- Accueil
- Models
- Qwen Image
- Qwen-Image-Flash : distillation DMD2 de Qwen-Image par NVIDIA
Qwen-Image-Flash : distillation DMD2 de Qwen-Image par NVIDIA
Qwen-Image-Flash est la distillation DMD2 en quatre étapes de Qwen-Image par NVIDIA, qui conserve le transformer MMDiT de base et génère des images en 4 évaluations de fonction.
Qwen-Image-Flash
Text-to-ImageFew-StepDistillationOpen SourceLe Qwen-Image distillé par NVIDIA : le transformer de débruitage MMDiT de 20,43B est remplacé par les poids étudiant DMD2 et échantillonné en quatre évaluations de fonction sur une trajectoire FlowMatch shift-3 packagée, avec l'encodeur de texte Qwen2.5-VL et le VAE Qwen-Image inchangés.
| Développeur | NVIDIA |
| Date de sortie | 2026-07-23 |
| Modèle de base | Qwen/Qwen-Image |
| Architecture | Transformer de diffusion (MMDiT), distillé |
| Paramètres | 20,43B dans le transformer de débruitage (28,85B dans le pipeline complet) |
| Étapes | 4 évaluations de fonction, scheduler FlowMatch Euler statique shift-3 |
| Licence | NVIDIA Open Model License |
Qu'est-ce que Qwen-Image-Flash ?
Qwen-Image-Flash est une version en quatre étapes, distillée par DMD2 de Qwen/Qwen-Image par NVIDIA. La distillation Improved Distribution Matching Distillation a été exécutée via NVIDIA FastGen, NVIDIA Model Optimizer et NVIDIA AutoModel ; seuls les poids du transformer changent, donc le reste du pipeline Qwen-Image (encodeur de texte Qwen2.5-VL, tokenizer Qwen, VAE Qwen-Image, forme du transformer à 60 couches) est hérité tel quel.
- 20,43B paramètres dans le transformer de débruitage, 28,85B sur l'ensemble du pipeline appris
- 4 évaluations de fonction au lieu du calendrier complet du modèle de base
- Scheduler FlowMatch Euler packagé avec une trajectoire statique shift-3, produisant les sigmas
[1.0, 0.9, 0.75, 0.5, 0.0] - Distillé avec des légendes en anglais ; la capacité héritée en langue chinoise n'est pas évaluée dans la carte du modèle
Exécuter le checkpoint distillé
La version officielle est un checkpoint Diffusers, et la distillation internalise le guidage de l'enseignant : l'échantillonnage nécessite num_inference_steps=4 conjointement avec true_cfg_scale=1.0. Déposer les poids dans un flux de travail Qwen-Image qui applique encore CFG 4.0 doublerait le guidage.
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]La carte du modèle liste Diffusers 0.38.0 avec Transformers 5.12.1, SGLang Diffusion, vLLM-Omni et TensorRT-LLM VisualGen comme runtimes pris en charge, avec H100 et B200 comme matériel validé. ComfyUI ne fait pas partie de la liste officielle des moteurs : considérez les poids du transformer en fichier unique comme compatibles au niveau de l'architecture avec la famille Qwen-Image, plutôt que comme un runtime officiellement pris en charge.
Guides and workflows related to this model series.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.