Nvidia Qwen-Image-Flash: 4-шаговая DMD2-дистилляция Qwen-Image

ComfyUI Wikinews

NVIDIA выпускает Qwen-Image-Flash, 4-шаговую DMD2-дистиллированную версию Qwen-Image с той же архитектурой для быстрой генерации по тексту.

NVIDIA выпустила Qwen-Image-Flash4-шаговую DMD2-дистиллированную версию Qwen/Qwen-Image, которая значительно снижает стоимость генерации, сохраняя архитектуру базовой модели.

Qwen-Image-Flash showcase

Что такое Qwen-Image-Flash?

Qwen-Image-Flash — это дистиллированный малоплаговый чекпойнт Qwen-Image, созданный с помощью Improved Distribution Matching Distillation (DMD2) на базе NVIDIA FastGen, NVIDIA Model Optimizer и NVIDIA AutoModel. Дистиллированные веса студента заменяют базовый трансформер, а остальная часть пайплайна остаётся прежней, поэтому модель остаётся drop-in совместимым членом семейства Qwen-Image.

Ключевые характеристики:

  • Трансформер: 20,43B параметров, та же архитектура MMDiT, что и у Qwen-Image
  • Шаги: 4 вычисления функции (NFE), вместо стандартного расписания базовой модели
  • Сэмплер: встроенный FlowMatch Euler со статической траекторией shift-3, дающий сигмы [1.0, 0.9, 0.75, 0.5, 0.0]
  • Пайплайн: текстовый энкодер Qwen2.5-VL, токенизатор Qwen, VAE Qwen-Image

Сопроводительная статья Qwen-Image-Flash: Beyond Objective Design описывает единый малоплаговый рецепт как для генерации изображений по тексту, так и для редактирования изображений по инструкции всего за 4 NFE.

Доступность

Официальный релиз — чекпойнт Diffusers. Запускайте его с помощью QwenImagePipeline из diffusers, используя 4 шага инференса, true_cfg_scale=1.0 и встроенный сэмплер:

from diffusers import QwenImagePipeline
import torch

pipe = QwenImagePipeline.from_pretrained(
    "nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
    width=1024, height=1024,
    num_inference_steps=4,
    true_cfg_scale=1.0,
).images[0]
image.save("qwen-image-flash.png")

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Nvidia Qwen-Image-Flash: 4-шаговая DMD2-дистилляция Qwen-Image | ComfyUI Wiki