Nvidia Qwen-Image-Flash:Qwen-Image の 4 ステップ DMD2 蒸留モデル

ComfyUI Wikinews

NVIDIA が Qwen-Image-Flash を公開しました。Qwen-Image の 4 ステップ DMD2 蒸留バージョンで、基本アーキテクチャを維持したまま高速なテキストから画像への生成を実現します。

NVIDIAQwen-Image-Flash を公開しました。Qwen/Qwen-Image4 ステップ DMD2 蒸留バージョンで、ベースモデルのアーキテクチャを維持したまま生成コストを大幅に削減します。

Qwen-Image-Flash のショーケース

Qwen-Image-Flash とは

Qwen-Image-Flash は、NVIDIA FastGenNVIDIA Model OptimizerNVIDIA AutoModel を用いた Improved Distribution Matching Distillation(DMD2) によって構築された、Qwen-Image の少ステップ蒸留チェックポイントです。蒸留された生徒(student)重みがベースの Transformer を置き換えますが、パイプラインの残りはそのままなので、Qwen-Image ファミリーのドロップイン互換モデルとして使えます。

主な仕様:

  • Transformer: 20.43B パラメータ、Qwen-Image と同じ MMDiT アーキテクチャ
  • ステップ数: 4 回の関数評価(NFE)。ベースモデルのデフォルトスケジュールから大幅に削減
  • スケジューラ: 静的 shift-3 軌道の FlowMatch Euler を同梱。シグマは [1.0, 0.9, 0.75, 0.5, 0.0]
  • パイプライン: Qwen2.5-VL テキストエンコーダ、Qwen tokenizer、Qwen-Image VAE

付属の論文 Qwen-Image-Flash: Beyond Objective Design は、テキストから画像への生成と指示に基づく画像編集の両方をわずか 4 NFE で実現する、統一された少ステップ手法を説明しています。

利用方法

公式リリースは Diffusers チェックポイントです。diffusersQwenImagePipeline を使って、4 ステップの推論、true_cfg_scale=1.0、同梱スケジューラで実行します:

from diffusers import QwenImagePipeline
import torch

pipe = QwenImagePipeline.from_pretrained(
    "nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
    width=1024, height=1024,
    num_inference_steps=4,
    true_cfg_scale=1.0,
).images[0]
image.save("qwen-image-flash.png")

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Nvidia Qwen-Image-Flash:Qwen-Image の 4 ステップ DMD2 蒸留モデル | ComfyUI Wiki