- Accueil
- Models
- Qwen Image
- Qwen-Image 2.1 : génération et édition unifiées 7B avec sortie RGBA
Qwen-Image 2.1 : génération et édition unifiées 7B avec sortie RGBA
Qwen-Image 2.1 est le DiT mono-flux 7B d'Alibaba pour génération et édition unifiées, avec un vrai canal alpha RGBA et jusqu'à 10 images de référence.
Qwen-Image 2.1
Texte-vers-imageÉdition d'imageTransparenceOpen SourceLe successeur open-weight d'Alibaba pour Qwen-Image : un transformer de diffusion mono-flux de 7B (32 couches) qui génère et édite avec les mêmes poids, écrit de vrais canaux alpha RGBA, accepte jusqu'à 10 images de référence et produit nativement de 2048x2048 jusqu'à 2752x1536.
Qu'est-ce que Qwen-Image 2.1 ?
Qwen-Image 2.1 est la deuxième génération de la gamme Qwen-Image open-weight d'Alibaba, et elle remplace le backbone MMDiT 20B de la version originale par un composant de génération visuelle 7B construit à partir de 32 couches DiT mono-flux. La carte du modèle décrit quatre changements :
- Compact et efficace. L'attention à granularité mixte et la réutilisation du cache KV de préfixe maintiennent une qualité d'image élevée pour un coût de calcul bien inférieur à celui de la génération 20B.
- Transparence native avec création et édition unifiées. Un seul modèle écrit des images RGBA classiques ou transparentes à partir de texte, édite des calques transparents et extrait un sujet d'une photographie.
- Édition polyvalente. Jusqu'à 10 images de référence par requête, des modifications locales spécifiées par des cercles, des annotations peintes ou un masque distinct, et la préservation de l'identité des personnes et des produits.
- Textures réalistes et esthétique raffinée. Typographie, éclairage des portraits et détails fins améliorés.
Les tailles de sortie natives commencent à 2048x2048 pour le 1:1 et vont jusqu'à 2400x1792 (4:3), 2528x1696 (3:2) et 2752x1536 (16:9), avec les ratios portrait correspondants.
Des images transparentes avec un vrai canal alpha
Le changement phare est une transparence qui survit jusque dans le fichier. Au lieu de générer sur un arrière-plan uni puis de détourer le sujet avec un modèle de matting, Qwen-Image 2.1 écrit lui-même le canal alpha, de sorte que les stickers, les rendus produit et les ressources d'interface ressortent prêts à être composés. La carte du modèle recommande un format de prompt explicite pour le déclencher :
This is an RGBA image with transparency. <your subject description>.
The image has alpha channel and the background is transparent.Prise en charge dans ComfyUI
Qwen-Image 2.1 est arrivé dans ComfyUI dès le premier jour avec la PR d'intégration (Comfy-Org/ComfyUI #16400), et les modèles officiels nécessitent ComfyUI 0.37.0 ou une version plus récente. Les poids repackagés en fichier unique se trouvent dans Comfy-Org/Qwen-Image-2.1, incluant les transformers convrot BF16 et INT8 ainsi que l'encodeur de texte Qwen3-VL-8B et l'optimiseur de prompt optionnel.
Guides and workflows related to this model series.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.