- Inicio
- Models
- Qwen Image
- Qwen-Image-Flash: destilación DMD2 de Qwen-Image en 4 pasos
Qwen-Image-Flash: destilación DMD2 de Qwen-Image en 4 pasos
Qwen-Image-Flash es la destilación DMD2 en cuatro pasos de Qwen-Image realizada por NVIDIA, que conserva el transformer MMDiT base y genera imágenes en 4 evaluaciones de función.
Qwen-Image-Flash
Texto a imagenPocos pasosDestilaciónCódigo abiertoQwen-Image destilado de NVIDIA: el transformer de eliminación de ruido MMDiT de 20.43B se reemplaza por los pesos del estudiante DMD2 y se muestrea en cuatro evaluaciones de función sobre una trayectoria FlowMatch con shift 3 empaquetada, con el codificador de texto Qwen2.5-VL y el VAE de Qwen-Image sin cambios.
| Desarrollador | NVIDIA |
| Fecha de lanzamiento | 2026-07-23 |
| Modelo base | Qwen/Qwen-Image |
| Arquitectura | Diffusion Transformer (MMDiT), destilado |
| Parámetros | 20.43B en el transformer de eliminación de ruido (28.85B en el pipeline completo) |
| Pasos | 4 evaluaciones de función, scheduler FlowMatch Euler estático con shift 3 |
| Licencia | NVIDIA Open Model License |
¿Qué es Qwen-Image-Flash?
Qwen-Image-Flash es una build destilada con DMD2 y de cuatro pasos de Qwen/Qwen-Image creada por NVIDIA. La Distillation Matching de Distribuciones mejorada (Improved Distribution Matching Distillation) se ejecutó a través de NVIDIA FastGen, NVIDIA Model Optimizer y NVIDIA AutoModel; solo cambian los pesos del transformer, por lo que el resto del pipeline de Qwen-Image (codificador de texto Qwen2.5-VL, tokenizer de Qwen, VAE de Qwen-Image, forma del transformer de 60 capas) se hereda sin cambios.
- 20.43B parámetros en el transformer de eliminación de ruido, 28.85B en todo el pipeline aprendido
- 4 evaluaciones de función en lugar del schedule completo del modelo base
- Scheduler FlowMatch Euler empaquetado con una trayectoria estática con shift 3, que produce los sigmas
[1.0, 0.9, 0.75, 0.5, 0.0] - Destilado con descripciones de texto en inglés; la capacidad heredada para el idioma chino no se evalúa en la tarjeta del modelo
Ejecutar el checkpoint destilado
La versión oficial es un checkpoint de Diffusers, y la destilación internaliza la orientación del teacher: el muestreo requiere num_inference_steps=4 junto con true_cfg_scale=1.0. Colocar los pesos en un flujo de trabajo de Qwen-Image que todavía aplique CFG 4.0 duplicaría la orientación.
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]La tarjeta del modelo enumera Diffusers 0.38.0 con Transformers 5.12.1, SGLang Diffusion, vLLM-Omni y TensorRT-LLM VisualGen como los runtimes compatibles, con H100 y B200 como el hardware validado. ComfyUI no forma parte de la lista oficial de motores: considere los pesos del transformer en un solo archivo como compatibles a nivel de arquitectura con la familia Qwen-Image, más que como un runtime oficialmente compatible.
Guides and workflows related to this model series.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.