Qwen-Image 2.1: generación y edición unificadas de 7B con salida RGBA

ComfyUI Wiki

Qwen-Image 2.1 es el DiT de flujo único de 7B de Alibaba para generación y edición unificadas, con alfa RGBA real y hasta 10 imágenes de referencia.

Q

Qwen-Image 2.1

Texto a imagenEdición de imágenesTransparenciaCódigo abierto

El sucesor de pesos abiertos de Alibaba para Qwen-Image: un transformer de difusión de flujo único de 7B (32 capas) que genera y edita con los mismos pesos, escribe canales alfa RGBA reales, acepta hasta 10 imágenes de referencia y produce de forma nativa desde 2048x2048 hasta 2752x1536.

DesarrolladorAlibaba Cloud (equipo Qwen)
Fecha de lanzamiento2026-09
ArquitecturaDiT de flujo único (componente de generación visual de 7B, 32 capas)
Codificador de textoQwen3-VL-8B (reempaquetado de Comfy-Org)
LicenciaQwen Research License
Modos de generaciónTexto a imagen, edición por instrucciones, salida transparente (RGBA), extracción de sujetos
Resoluciones nativas2048x2048 (1:1) hasta 2752x1536 (16:9), con las proporciones verticales correspondientes

¿Qué es Qwen-Image 2.1?

Qwen-Image 2.1 es la segunda generación de la línea Qwen-Image de pesos abiertos de Alibaba, y reemplaza la columna vertebral MMDiT de 20B del lanzamiento original por un componente de generación visual de 7B construido con 32 capas DiT de flujo único. La ficha del modelo describe cuatro cambios:

  • Compacto y eficiente. La atención de granularidad mixta junto con la reutilización de la caché KV de prefijo mantiene una alta calidad de imagen con un coste computacional mucho menor que la generación de 20B.
  • Transparencia nativa con creación y edición unificadas. Un solo modelo escribe imágenes RGBA normales o transparentes a partir de texto, edita capas transparentes y extrae un sujeto de una fotografía.
  • Edición versátil. Hasta 10 imágenes de referencia por solicitud, ediciones locales especificadas con círculos, anotaciones pintadas o una máscara independiente, y preservación de la identidad para personas y productos.
  • Texturas realistas y estética refinada. Tipografía, iluminación de retratos y detalles finos mejorados.

Los tamaños de salida nativos comienzan en 2048x2048 para 1:1 y llegan a 2400x1792 (4:3), 2528x1696 (3:2) y 2752x1536 (16:9), con las proporciones verticales correspondientes.

Imágenes transparentes con un canal alfa real

El cambio más destacado es la transparencia que se conserva en el archivo. En lugar de generar sobre un fondo plano y recortar el sujeto después con un modelo de matting, Qwen-Image 2.1 escribe el canal alfa por sí mismo, de modo que los stickers, los renders de productos y los recursos de interfaz salen listos para componer. La ficha del modelo recomienda un formato de prompt explícito para activarla:

This is an RGBA image with transparency. <your subject description>.
The image has alpha channel and the background is transparent.

Soporte en ComfyUI

Qwen-Image 2.1 llegó a ComfyUI el primer día con el PR de integración (Comfy-Org/ComfyUI #16400), y las plantillas oficiales requieren ComfyUI 0.37.0 o superior. Los pesos reempaquetados de archivo único están en Comfy-Org/Qwen-Image-2.1, e incluyen transformers convrot BF16 e INT8, además del codificador de texto Qwen3-VL-8B y un potenciador de prompts opcional.

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…