Qwen-Image 2.1: modelo T2I y de edición de 7B en ComfyUI

ComfyUI Wikinews

Qwen-Image 2.1 es el modelo de imagen 7B de Alibaba con transparencia RGBA nativa, edición con 10 imágenes de referencia y soporte de ComfyUI desde el día 0.

Qwen-Image 2.1 es el sucesor de pesos abiertos de Alibaba de Qwen-Image: un transformer de difusión de flujo único de 7B que genera y edita con los mismos pesos, escribe canales alfa RGBA reales, acepta hasta 10 imágenes de referencia y se lanzó con soporte de ComfyUI desde el día 0 y tres plantillas de flujo de trabajo oficiales.
Muestra de generación de Qwen-Image 2.1

Ejemplos de la tarjeta de modelo oficial de Qwen-Image 2.1.

Qué hay de nuevo en Qwen-Image 2.1

La generación anterior de Qwen-Image usaba una base MMDiT de 20B con un codificador de texto Qwen2.5-VL-7B. Qwen-Image 2.1 reemplaza el lado de generación visual con un componente de 7B formado por 32 capas DiT de flujo único, y los cuatro cambios principales son:

  • Compacto y eficiente. La atención de granularidad mixta junto con la reutilización del caché KV de prefijo mantienen la calidad alta con un coste computacional mucho menor que la línea de 20B.
  • Transparencia nativa, generación y edición unificadas. Un solo modelo escribe imágenes normales o transparentes (RGBA) a partir de texto, edita capas transparentes y extrae sujetos de fotografías.
  • Edición versátil. Hasta 10 imágenes de referencia por solicitud, ediciones locales especificadas con círculos, anotaciones pintadas o una máscara aparte, y preservación de identidad para personas y productos.
  • Texturas realistas y estética refinada. Mejor tipografía, iluminación de retratos y detalle fino.

Los tamaños de salida nativos son más anchos que el cuadrado de clase 1024 que usaban los flujos de trabajo anteriores: 2048x2048 en 1:1, 2400x1792 en 4:3, 2528x1696 en 3:2 y 2752x1536 en 16:9, con las proporciones verticales correspondientes.

Imágenes transparentes con un canal alfa real

La característica estrella es un alfa que sobrevive hasta el archivo. En lugar de generar sobre un fondo plano y luego recortar el sujeto con un modelo de matting aparte, Qwen-Image 2.1 escribe la transparencia por sí mismo, de modo que un sticker, un render de producto o un recurso de interfaz salen listos para componer. La tarjeta del modelo recomienda un formato de prompt explícito para activarlo:

This is an RGBA image with transparency. <your subject description>.
The image has alpha channel and the background is transparent.
Ejemplos de stickers transparentes Sujeto transparente sobre un fondo alfa Recurso generado transparente

Generación nativa de imágenes transparentes, directamente del showcase oficial. Los archivos llevan un canal alfa, no un tablero de ajedrez pintado.

Edición a partir de hasta diez referencias

La edición es donde importa el presupuesto de referencias. Qwen-Image 2.1 acepta hasta diez imágenes en una sola pasada, lo que hace posibles composiciones de grupo, escenas con varios productos y hojas de personajes sin tener que unir generaciones separadas. Las ediciones locales se pueden dirigir con un círculo, una anotación pintada o un nodo de máscara.

Fotografía de grupo generada a partir de seis retratos de referencia

Una fotografía de grupo generada a partir de seis retratos de referencia.

Ejemplo de renderizado de texto Ejemplo de renderizado de texto

Ejemplos de tipografía y composición de la tarjeta del modelo.

Soporte de ComfyUI desde el día 0

ComfyUI integró el soporte de Qwen-Image 2.1 en Comfy-Org/ComfyUI #16400 (CORE-423, por Kijai), y las tres plantillas oficiales de abajo requieren ComfyUI 0.37.0 o superior. Commits posteriores añadieron la compilación de bloques transformer y una mejor ubicación del caché KV para el modelo.

Los pesos reempaquetados en un solo archivo están en Comfy-Org/Qwen-Image-2.1, y las plantillas forman parte de la galería de flujos de trabajo integrada, por lo que también se pueden abrir desde el navegador de plantillas en lugar de arrastrar un JSON.

PlantillaQué hace
Texto a imagenUna imagen de 1024x1024 en 25 pasos de muestreo, salida nativa 2K, soporte de tipografía y alfa
Edición de imagenDos imágenes de referencia a través del único checkpoint de generación y edición, útil para ediciones coherentes de personajes y recortes de productos
Eliminar fondoUna imagen de entrada, un resultado transparente de salida, usando la salida RGBA nativa del modelo

Archivos del modelo

El reempaquetado de Comfy-Org se divide en las carpetas habituales:

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── qwen_image_2.1_bf16.safetensors
    │   └── qwen_image_2.1_int8_convrot.safetensors
    ├── 📂 text_encoders/
    │   ├── qwen3vl_8b_bf16.safetensors
    │   ├── qwen3vl_8b_int8_convrot.safetensors
    │   └── qwen3vl_8b_w4a8.safetensors
    └── 📂 vae/
        └── qwen_image_2.1_vae_bf16.safetensors

Junto a ellos, el reempaquetado también incluye codificadores de texto de mejora de prompt, qwen3.5_9b_qwen_image_2.1_pe_t2i y qwen3.5_9b_qwen_image_2.1_pe_i2i en formato INT8 convrot. Esos son los LLM que Qwen ajustó para expandir una solicitud corta al formato de plantilla que prefiere el modelo de imagen, y son opcionales: cualquier LLM capaz puede rellenar la misma plantilla de prompt, y el modelo de imagen en sí funciona sin uno.

Lo que reportan los primeros usuarios

El modelo está en manos de los usuarios desde el día del lanzamiento, y las mismas notas prácticas siguen apareciendo:

  • El tamaño nativo importa. Superar con creces la resolución de entrenamiento de clase 2048 desestabiliza la exposición, mientras que las referencias de entrada demasiado grandes ralentizan drásticamente la generación. Redimensionar una referencia antes de cargarla es más barato que dejar que el muestreador la procese entera.
  • Un CFG por debajo de 1 no es usable. Una orientación en torno a 1 se comporta como la línea anterior de Qwen-Image, y un CFG pequeño con un prompt negativo centrado en la calidad es lo que la gente usa cuando el texto de la imagen necesita más nitidez.
  • La transferencia de estilo sigue siendo irregular. Las instrucciones de texto cambian el estilo de forma fiable, mientras que el estilo proporcionado mediante imágenes de referencia ha sido menos fiable, lo que refleja lo que los usuarios encontraron en los modelos anteriores de Qwen-Image Editing.

Disponibilidad

Los pesos están en Hugging Face y ModelScope, con la publicación de lanzamiento en el blog de Qwen. Las integraciones del día 0 además de ComfyUI incluyen Diffusers mediante QwenImage21Pipeline, vLLM-Omni, SGLang y LightX2V.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Qwen-Image 2.1: modelo T2I y de edición de 7B en ComfyUI | ComfyUI Wiki