Nvidia Qwen-Image-Flash: destilación DMD2 en 4 pasos de Qwen-Image
NVIDIA publica Qwen-Image-Flash, una versión de Qwen-Image destilada con DMD2 en 4 pasos que conserva la arquitectura base para generar texto a imagen rápido.
NVIDIA publicó Qwen-Image-Flash, una versión destilada con DMD2 en cuatro pasos de Qwen/Qwen-Image que reduce drásticamente el coste de generación manteniendo la arquitectura del modelo base.
¿Qué es Qwen-Image-Flash?
Qwen-Image-Flash es un checkpoint destilado de pocos pasos de Qwen-Image construido con Improved Distribution Matching Distillation (DMD2) mediante NVIDIA FastGen, NVIDIA Model Optimizer y NVIDIA AutoModel. Los pesos destilados del modelo alumno reemplazan el transformer base mientras el resto del pipeline permanece igual, por lo que el modelo sigue siendo un miembro de la familia Qwen-Image que se puede usar directamente.
Características principales:
- Transformer: 20.43B de parámetros, misma arquitectura MMDiT que Qwen-Image
- Pasos: 4 evaluaciones de función (NFE), frente a la programación predeterminada del modelo base
- Scheduler: FlowMatch Euler incluido con una trayectoria estática shift-3, que produce sigmas
[1.0, 0.9, 0.75, 0.5, 0.0] - Pipeline: codificador de texto Qwen2.5-VL, tokenizer Qwen, VAE Qwen-Image
El artículo adjunto, Qwen-Image-Flash: Beyond Objective Design, describe una receta unificada de pocos pasos tanto para generación de texto a imagen como para edición de imágenes guiada por instrucciones en solo 4 NFE.
Disponibilidad
El lanzamiento oficial es un checkpoint de Diffusers. Ejecútalo con QwenImagePipeline de diffusers, usando 4 pasos de inferencia, true_cfg_scale=1.0 y el scheduler incluido:
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]
image.save("qwen-image-flash.png")
Comentarios
Inicia sesión con GitHub para unirte a la conversación.