Qwen-Image-Flash: destilación DMD2 de Qwen-Image en 4 pasos

ComfyUI Wiki

Qwen-Image-Flash es la destilación DMD2 en cuatro pasos de Qwen-Image realizada por NVIDIA, que conserva el transformer MMDiT base y genera imágenes en 4 evaluaciones de función.

Q

Qwen-Image-Flash

Texto a imagenPocos pasosDestilaciónCódigo abierto

Qwen-Image destilado de NVIDIA: el transformer de eliminación de ruido MMDiT de 20.43B se reemplaza por los pesos del estudiante DMD2 y se muestrea en cuatro evaluaciones de función sobre una trayectoria FlowMatch con shift 3 empaquetada, con el codificador de texto Qwen2.5-VL y el VAE de Qwen-Image sin cambios.

DesarrolladorNVIDIA
Fecha de lanzamiento2026-07-23
Modelo baseQwen/Qwen-Image
ArquitecturaDiffusion Transformer (MMDiT), destilado
Parámetros20.43B en el transformer de eliminación de ruido (28.85B en el pipeline completo)
Pasos4 evaluaciones de función, scheduler FlowMatch Euler estático con shift 3
LicenciaNVIDIA Open Model License

¿Qué es Qwen-Image-Flash?

Qwen-Image-Flash es una build destilada con DMD2 y de cuatro pasos de Qwen/Qwen-Image creada por NVIDIA. La Distillation Matching de Distribuciones mejorada (Improved Distribution Matching Distillation) se ejecutó a través de NVIDIA FastGen, NVIDIA Model Optimizer y NVIDIA AutoModel; solo cambian los pesos del transformer, por lo que el resto del pipeline de Qwen-Image (codificador de texto Qwen2.5-VL, tokenizer de Qwen, VAE de Qwen-Image, forma del transformer de 60 capas) se hereda sin cambios.

  • 20.43B parámetros en el transformer de eliminación de ruido, 28.85B en todo el pipeline aprendido
  • 4 evaluaciones de función en lugar del schedule completo del modelo base
  • Scheduler FlowMatch Euler empaquetado con una trayectoria estática con shift 3, que produce los sigmas [1.0, 0.9, 0.75, 0.5, 0.0]
  • Destilado con descripciones de texto en inglés; la capacidad heredada para el idioma chino no se evalúa en la tarjeta del modelo

Ejecutar el checkpoint destilado

La versión oficial es un checkpoint de Diffusers, y la destilación internaliza la orientación del teacher: el muestreo requiere num_inference_steps=4 junto con true_cfg_scale=1.0. Colocar los pesos en un flujo de trabajo de Qwen-Image que todavía aplique CFG 4.0 duplicaría la orientación.

from diffusers import QwenImagePipeline
import torch

pipe = QwenImagePipeline.from_pretrained(
    "nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
    width=1024, height=1024,
    num_inference_steps=4,
    true_cfg_scale=1.0,
).images[0]

La tarjeta del modelo enumera Diffusers 0.38.0 con Transformers 5.12.1, SGLang Diffusion, vLLM-Omni y TensorRT-LLM VisualGen como los runtimes compatibles, con H100 y B200 como el hardware validado. ComfyUI no forma parte de la lista oficial de motores: considere los pesos del transformer en un solo archivo como compatibles a nivel de arquitectura con la familia Qwen-Image, más que como un runtime oficialmente compatible.

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…