Nvidia Qwen-Image-Flash: Qwen-Image의 4단계 DMD2 증류 모델
ComfyUI Wikinews
NVIDIA가 Qwen-Image-Flash를 공개했습니다. Qwen-Image의 4단계 DMD2 증류 버전으로 기본 아키텍처를 유지하면서 빠른 텍스트-이미지 생성을 지원합니다.
NVIDIA가 Qwen-Image-Flash를 공개했습니다. Qwen/Qwen-Image의 4단계 DMD2 증류 버전으로, 기본 모델 아키텍처를 유지하면서 생성 비용을 크게 줄였습니다.
Qwen-Image-Flash란?
Qwen-Image-Flash는 NVIDIA FastGen, NVIDIA Model Optimizer, NVIDIA AutoModel을 사용한 개선된 분포 매칭 증류(Improved Distribution Matching Distillation, DMD2) 로 구축된 Qwen-Image의 소수 스텝 증류 체크포인트입니다. 증류된 학생(student) 가중치가 기본 Transformer를 대체하지만 파이프라인의 나머지 부분은 그대로 유지되므로, Qwen-Image 패밀리의 드롭인 호환 모델로 사용할 수 있습니다.
주요 사양:
- Transformer: 20.43B 파라미터, Qwen-Image와 동일한 MMDiT 아키텍처
- 스텝: 함수 평가(NFE) 4회. 기본 모델의 기본 스케줄 대비 대폭 감소
- 스케줄러: 정적 shift-3 궤적의 FlowMatch Euler 번들. 시그마는
[1.0, 0.9, 0.75, 0.5, 0.0] - 파이프라인: Qwen2.5-VL 텍스트 인코더, Qwen 토크나이저, Qwen-Image VAE
첨부 논문 Qwen-Image-Flash: Beyond Objective Design은 텍스트-이미지 생성과 지시 기반 이미지 편집을 단 4회의 NFE로 처리하는 통합 소수 스텝 방법을 설명합니다.
사용 가능 여부
공식 릴리스는 Diffusers 체크포인트입니다. diffusers의 QwenImagePipeline으로 4스텝 추론, true_cfg_scale=1.0, 번들 스케줄러를 사용해 실행합니다:
from diffusers import QwenImagePipeline
import torch
pipe = QwenImagePipeline.from_pretrained(
"nvidia/Qwen-Image-Flash", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus",
width=1024, height=1024,
num_inference_steps=4,
true_cfg_scale=1.0,
).images[0]
image.save("qwen-image-flash.png")
댓글
GitHub로 로그인하고 토론에 참여하세요.