Nvidia Qwen-Image-Flash : distillation DMD2 en 4 étapes de Qwen-Image
NVIDIA publie Qwen-Image-Flash, une version distillée DMD2 en 4 étapes de Qwen-Image qui conserve l'architecture de base pour une génération texte-image rapide.
NVIDIA a publié Qwen-Image-Flash, une version distillée DMD2 en quatre étapes de Qwen/Qwen-Image qui réduit considérablement le coût de génération tout en conservant l'architecture du modèle de base.
Qu'est-ce que Qwen-Image-Flash ?
Qwen-Image-Flash est un checkpoint distillé en quelques étapes de Qwen-Image construit avec Improved Distribution Matching Distillation (DMD2) via NVIDIA FastGen, NVIDIA Model Optimizer et NVIDIA AutoModel. Les poids distillés du modèle élève remplacent le transformer de base tandis que le reste du pipeline reste identique, ce qui en fait un membre de la famille Qwen-Image utilisable directement.
Caractéristiques principales :
- Transformer : 20,43B de paramètres, même architecture MMDiT que Qwen-Image
- Étapes : 4 évaluations de fonction (NFE), contre le calendrier par défaut du modèle de base
- Scheduler : FlowMatch Euler intégré avec une trajectoire statique shift-3, produisant les sigmas
[1.0, 0.9, 0.75, 0.5, 0.0] - Pipeline : encodeur de texte Qwen2.5-VL, tokenizer Qwen, VAE Qwen-Image
Le document associé, Qwen-Image-Flash: Beyond Objective Design, décrit une recette unifiée en quelques étapes pour la génération texte-image et l'édition d'images guidée par instructions en seulement 4 NFE.
Disponibilité
La version officielle est un checkpoint Diffusers. Exécutez-le avec QwenImagePipeline de diffusers, en utilisant 4 étapes d'inférence, true_cfg_scale=1.0 et le scheduler intégré :
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]
image.save("qwen-image-flash.png")
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.