Qwen-Image-2.1-Turbo: Turbo oficial de 8 pasos en ComfyUI

ComfyUI Wikinews

El checkpoint oficial Qwen-Image-2.1-Turbo de Alibaba ejecuta el generador y el editor de 7B en 8 pasos de denoising con CFG 1, con pesos reempaquetados por Comfy-Org para ComfyUI.

Qwen-Image-2.1-Turbo es el checkpoint acelerado propio de Alibaba de Qwen-Image 2.1, publicado el 9 de octubre de 2026. Conserva el mismo modelo de generación visual de 7B y el mismo pipeline de edición, pero ejecuta la generación de texto a imagen y las ediciones con múltiples referencias en 8 pasos de denoising con CFG 1, frente a los 40 pasos del modelo base.
Una bailarina captada a mitad de giro, generada por Qwen-Image-2.1-Turbo en 8 pasos

Poses y movimiento humanos, una de las categorías de 8 pasos en la propia muestra de Turbo de Alibaba.

Qué cambia el checkpoint Turbo

Turbo no es una arquitectura nueva. Es un segundo checkpoint de Qwen-Image 2.1 con su programación de muestreo incorporada, de modo que los mismos pesos del transformer sirven para la generación, la edición por instrucciones, la transparencia RGBA y la extracción de sujetos, igual que antes. Las diferencias que importan a la hora de configurarlo:

  • 8 pasos de denoising en lugar de 40. La programación recomendada de 8 pasos viene dentro del checkpoint. La model card es explícita en que pasar num_inference_steps por sí solo no la sobrescribe, y en que otras programaciones no han sido evaluadas para este checkpoint.
  • CFG 1 por defecto. La orientación libre de clasificador está desactivada, así que cada paso ejecuta una sola pasada forward.
  • El almacenamiento en caché KV por prefijos reutiliza el contexto de texto e imagen de referencia entre los pasos de denoising, algo que el pipeline habilita con use_kv_cache=True.
  • Los mismos ajustes predefinidos de resolución que el modelo base, desde 2048x2048 (1:1) hasta 2752x1536 (16:9) y las proporciones verticales correspondientes.
  • Basado en diffusers por ahora. Se carga con QwenImage21Pipeline y necesita una compilación de diffusers que admita sigmas de muestreo configuradas desde el pipeline.

La programación guardada es 1.0, 0.978453, 0.95418, 0.926626, 0.89508, 0.845148, 0.704534, 0.414568, y termina en un paso 0 vacío. En el canal #qwen-image de Banodoco, Kijai señaló que se acerca al scheduler linear_quadratic de ComfyUI sin ningún shift aplicado, y que en general no ha visto que una programación Euler fija supere a un muestreador estocástico en los checkpoints turbo.

Muestra

La model card agrupa sus salidas de 8 pasos según lo que la gente realmente le pide al modelo. La fotografía de retrato y la tipografía de póster salen del mismo checkpoint que los casos de edición:

Una muestra de retrato de Qwen-Image-2.1-Turbo

Un retrato, generado en 8 pasos a 1680x2512.

Un diseño de póster con tipografía renderizada

Tipografía y diseño de póster, una categoría que antes necesitaba la ejecución completa de 40 pasos.

Una muestra de interfaz y diseño de información

Interfaz y diseño de información, uno de los casos de salida estructurada más difíciles.

La transparencia sobrevive a la aceleración: el canal alfa lo escribe el modelo, así que los stickers y los recursos de producto siguen saliendo listos para componer.

Una salida RGBA con un canal alfa real

Generación de imágenes transparentes con el checkpoint Turbo.

La edición funciona igual que en el modelo base, incluida la transformación de una sola imagen:

Figura de entradaFigura de salida
Referencia de entradaSalida de edición en 8 pasos (2048x2048)

Disponibilidad en ComfyUI

Comfy-Org/Qwen-Image-2.1 añadió Turbo pocas horas después del lanzamiento, en las mismas tres formas que el modelo base:

  • diffusion_models/qwen_image_2.1_turbo_bf16.safetensors, el checkpoint completo de 8 pasos en BF16.
  • diffusion_models/qwen_image_2.1_turbo_int8_convrot.safetensors, la cuantización INT8 convrot para menor VRAM.
  • loras/qwen_image_2.1_turbo_lora_avg_rank_178_bf16.safetensors, una extracción LoRA de la misma destilación que se carga sobre el transformer base en lugar de cambiar de checkpoint.

El text encoder y el VAE se comparten con Qwen-Image 2.1, así que una instalación que ya ejecuta el modelo base solo necesita el nuevo transformer o la LoRA. Los pesos Turbo encajan en el flujo de trabajo oficial existente de Qwen-Image 2.1: configura el muestreador a 8 pasos y CFG 1, y elige el modelo de difusión turbo o el modelo base más la LoRA turbo.

Recepción inicial

El lanzamiento llegó a #qwen-image el mismo día y se probó al momento. RuneX informó de que "el turbo oficial funciona muy bien" y que se veía claramente mejor que al menos una LoRA Turbo de terceros con el mismo prompt. Corza comparó los sigmas incluidos con una programación Euler personalizada y encontró una diferencia menor, sobre todo algo de nitidez y detalle de piel adicionales cuando se apilan LoRA o LoKR encima, que es el mismo problema de suavizado excesivo reportado con adaptadores apilados en el modelo base. Kijai no quedó impresionado por un nodo de la comunidad que afirmaba obtener mejores resultados con turbo, y señaló que en los modelos de flow-matching el muestreador Euler de ComfyUI ya es flow-match Euler, así que esos nodos en su mayoría solo cambian los sigmas.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Qwen-Image-2.1-Turbo: Turbo oficial de 8 pasos en ComfyUI | ComfyUI Wiki