- Главная
- Models
- Qwen Image
- Qwen-Image-Flash: 4-шаговая DMD2-дистилляция Qwen-Image от NVIDIA
Qwen-Image-Flash: 4-шаговая DMD2-дистилляция Qwen-Image от NVIDIA
Qwen-Image-Flash это четырехшаговая DMD2-дистилляция Qwen-Image от NVIDIA, которая сохраняет базовый MMDiT-трансформер и генерирует изображения за 4 вызова функции.
Qwen-Image-Flash
Текст-в-изображениеМалошаговыйДистилляцияОткрытый исходный кодДистиллированная версия Qwen-Image от NVIDIA: денойзинговый MMDiT-трансформер на 20.43B параметров заменен student-весами DMD2 и сэмплируется за четыре вызова функции по упакованной траектории shift-3 FlowMatch, при этом текстовый энкодер Qwen2.5-VL и VAE Qwen-Image остаются без изменений.
| Разработчик | NVIDIA |
| Дата выпуска | 2026-07-23 |
| Базовая модель | Qwen/Qwen-Image |
| Архитектура | Diffusion Transformer (MMDiT), дистиллированный |
| Параметры | 20.43B в денойзинговом трансформере (28.85B во всей pipeline) |
| Шаги | 4 вызова функции, статический shift-3 FlowMatch Euler scheduler |
| Лицензия | NVIDIA Open Model License |
Что такое Qwen-Image-Flash?
Qwen-Image-Flash это четырехшаговая сборка Qwen/Qwen-Image от NVIDIA, дистиллированная методом DMD2. Improved Distribution Matching Distillation была проведена через NVIDIA FastGen, NVIDIA Model Optimizer и NVIDIA AutoModel; меняются только веса трансформера, поэтому остальная часть pipeline Qwen-Image (текстовый энкодер Qwen2.5-VL, токенизатор Qwen, VAE Qwen-Image, форма 60-слойного трансформера) наследуется без изменений.
- 20.43B параметров в денойзинговом трансформере, 28.85B во всей обученной pipeline
- 4 вызова функции вместо полного расписания базовой модели
- Упакованный FlowMatch Euler scheduler со статической траекторией shift-3, дающий сигмы
[1.0, 0.9, 0.75, 0.5, 0.0] - Дистилляция выполнена на английских подписях; унаследованные возможности китайского языка в карточке модели не оцениваются
Запуск дистиллированного checkpoint
Официальный релиз представляет собой checkpoint Diffusers, и дистилляция интернализует направление учителя: для выборки нужны num_inference_steps=4 вместе с true_cfg_scale=1.0. Если подставить веса в рабочий процесс Qwen-Image, который по-прежнему применяет CFG 4.0, направление удвоится.
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]В карточке модели в качестве поддерживаемых сред выполнения указаны Diffusers 0.38.0 с Transformers 5.12.1, SGLang Diffusion, vLLM-Omni и TensorRT-LLM VisualGen, а валидированным оборудованием названы H100 и B200. ComfyUI не входит в официальный список движков: рассматривайте однофайловые веса трансформера как архитектурно совместимые с семейством Qwen-Image, а не как официально поддерживаемую среду выполнения.
Guides and workflows related to this model series.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.