Qwen-Image: Alibaba Foundation T2I Model with Strong Text Rendering

ComfyUI Wiki

Qwen-Image is Alibaba's foundation image generation model with strong text rendering and editing capabilities. Available in multiple quantization formats for ComfyUI.

Q

Qwen-Image

Text-to-ImageText RenderingImage EditingQuantized

Foundation text-to-image generation model from Alibaba's Qwen series. Built on a diffusion transformer architecture, it excels at complex text rendering (especially Chinese), precise image editing, and general image generation with support for diverse artistic styles. Available in BF16, FP8, FP8 mixed, NVFP4, and 2.5K resolution variants.

DeveloperAlibaba Cloud (Qwen Team)
Release Date2025-08-04
ArchitectureDiffusion Transformer (DiT)
LicenseApache-2.0
Text EncoderQwen2.5-VL-7B
PipelineDiffusers (text-to-image)
ControlNetsInstantX Union/Inpainting, DiffSynth Canny/Depth/Inpaint

Guides and workflows related to this model series.

No articles found.

Comments

Sign in with GitHub to join the discussion.

Loading comments…