Qwen-Image-Flash: 4-шаговая DMD2-дистилляция Qwen-Image от NVIDIA

ComfyUI Wiki

Qwen-Image-Flash это четырехшаговая DMD2-дистилляция Qwen-Image от NVIDIA, которая сохраняет базовый MMDiT-трансформер и генерирует изображения за 4 вызова функции.

Q

Qwen-Image-Flash

Текст-в-изображениеМалошаговыйДистилляцияОткрытый исходный код

Дистиллированная версия Qwen-Image от NVIDIA: денойзинговый MMDiT-трансформер на 20.43B параметров заменен student-весами DMD2 и сэмплируется за четыре вызова функции по упакованной траектории shift-3 FlowMatch, при этом текстовый энкодер Qwen2.5-VL и VAE Qwen-Image остаются без изменений.

РазработчикNVIDIA
Дата выпуска2026-07-23
Базовая модельQwen/Qwen-Image
АрхитектураDiffusion Transformer (MMDiT), дистиллированный
Параметры20.43B в денойзинговом трансформере (28.85B во всей pipeline)
Шаги4 вызова функции, статический shift-3 FlowMatch Euler scheduler
ЛицензияNVIDIA Open Model License

Что такое Qwen-Image-Flash?

Qwen-Image-Flash это четырехшаговая сборка Qwen/Qwen-Image от NVIDIA, дистиллированная методом DMD2. Improved Distribution Matching Distillation была проведена через NVIDIA FastGen, NVIDIA Model Optimizer и NVIDIA AutoModel; меняются только веса трансформера, поэтому остальная часть pipeline Qwen-Image (текстовый энкодер Qwen2.5-VL, токенизатор Qwen, VAE Qwen-Image, форма 60-слойного трансформера) наследуется без изменений.

  • 20.43B параметров в денойзинговом трансформере, 28.85B во всей обученной pipeline
  • 4 вызова функции вместо полного расписания базовой модели
  • Упакованный FlowMatch Euler scheduler со статической траекторией shift-3, дающий сигмы [1.0, 0.9, 0.75, 0.5, 0.0]
  • Дистилляция выполнена на английских подписях; унаследованные возможности китайского языка в карточке модели не оцениваются

Запуск дистиллированного checkpoint

Официальный релиз представляет собой checkpoint Diffusers, и дистилляция интернализует направление учителя: для выборки нужны num_inference_steps=4 вместе с true_cfg_scale=1.0. Если подставить веса в рабочий процесс Qwen-Image, который по-прежнему применяет CFG 4.0, направление удвоится.

from diffusers import QwenImagePipeline
import torch

pipe = QwenImagePipeline.from_pretrained(
    "nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
    width=1024, height=1024,
    num_inference_steps=4,
    true_cfg_scale=1.0,
).images[0]

В карточке модели в качестве поддерживаемых сред выполнения указаны Diffusers 0.38.0 с Transformers 5.12.1, SGLang Diffusion, vLLM-Omni и TensorRT-LLM VisualGen, а валидированным оборудованием названы H100 и B200. ComfyUI не входит в официальный список движков: рассматривайте однофайловые веса трансформера как архитектурно совместимые с семейством Qwen-Image, а не как официально поддерживаемую среду выполнения.

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…