Nvidia Qwen-Image-Flash: 4-шаговая DMD2-дистилляция Qwen-Image
NVIDIA выпускает Qwen-Image-Flash, 4-шаговую DMD2-дистиллированную версию Qwen-Image с той же архитектурой для быстрой генерации по тексту.
NVIDIA выпустила Qwen-Image-Flash — 4-шаговую DMD2-дистиллированную версию Qwen/Qwen-Image, которая значительно снижает стоимость генерации, сохраняя архитектуру базовой модели.
Что такое Qwen-Image-Flash?
Qwen-Image-Flash — это дистиллированный малоплаговый чекпойнт Qwen-Image, созданный с помощью Improved Distribution Matching Distillation (DMD2) на базе NVIDIA FastGen, NVIDIA Model Optimizer и NVIDIA AutoModel. Дистиллированные веса студента заменяют базовый трансформер, а остальная часть пайплайна остаётся прежней, поэтому модель остаётся drop-in совместимым членом семейства Qwen-Image.
Ключевые характеристики:
- Трансформер: 20,43B параметров, та же архитектура MMDiT, что и у Qwen-Image
- Шаги: 4 вычисления функции (NFE), вместо стандартного расписания базовой модели
- Сэмплер: встроенный FlowMatch Euler со статической траекторией shift-3, дающий сигмы
[1.0, 0.9, 0.75, 0.5, 0.0] - Пайплайн: текстовый энкодер Qwen2.5-VL, токенизатор Qwen, VAE Qwen-Image
Сопроводительная статья Qwen-Image-Flash: Beyond Objective Design описывает единый малоплаговый рецепт как для генерации изображений по тексту, так и для редактирования изображений по инструкции всего за 4 NFE.
Доступность
Официальный релиз — чекпойнт Diffusers. Запускайте его с помощью QwenImagePipeline из diffusers, используя 4 шага инференса, true_cfg_scale=1.0 и встроенный сэмплер:
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]
image.save("qwen-image-flash.png")
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.