Turbo8: LoRA de destilación de 8 pasos para Qwen-Image 2.1

ComfyUI Wikinews

Turbo8 destila Qwen-Image 2.1 a 8 pasos sin CFG, cubriendo texto a imagen, edición, salida RGBA y extracción de sujetos, con dos flujos de trabajo de ComfyUI listos para usar.

Turbo8 (Hugging Face) es una LoRA de destilación por pasos para Qwen-Image 2.1 que renderiza en 8 pasos con CFG 1, aproximadamente una quinta parte de las 40 pasadas del modelo base. Un único archivo de 1.36 GB cubre texto a imagen, renderizado de texto, edición por instrucciones con hasta 10 imágenes de referencia, generación transparente (RGBA) y extracción de sujetos, y el repositorio incluye dos flujos de trabajo de ComfyUI listos para usar.

Qwen-Image 2.1 ha atraído varias rutas de pocos pasos desde su lanzamiento el 20 de septiembre de 2026: las LoRA de 5 y 8 pasos de Pruna, la turbo LoRA de Viggle y la destilación Fun Acc oficial de 4 pasos de Alibaba PAI. Turbo8 es una entrada de la comunidad en la misma carrera, y su punto distintivo es la amplitud: en lugar de acelerar únicamente el texto a imagen, está entrenada para mantener el comportamiento de todo el modelo base, incluidas las rutas RGBA y de edición con múltiples referencias que los adaptadores anteriores manejaban peor.

Muestras generadas con Turbo8 a 8 pasos y CFG 1

Todas las muestras usan Turbo8 con 8 pasos y CFG 1 a 1024², primera semilla, sin selección dentro de un prompt. Los prompts se eligieron para mostrarlos a partir del conjunto de evaluación reservado. Fuente: Turbo8-LoRA-Qwen-Image-2.1.

Qué hace

El adaptador es una LoRA de rango 128 sobre las capas de atención, MLP, modulación e incrustación de timestep de Qwen-Image 2.1, destilada para que los pesos base permanezcan intactos. En inferencia se ejecuta con 8 pasos, CFG 1, muestreador euler, scheduler simple, y el autor señala que superar los 8 pasos o pasar de CFG 1 no mejora los resultados.

La afirmación es de cobertura más que de una sola tarea: texto a imagen hasta los 2K nativos del modelo, renderizado de texto en inglés y chino, edición por instrucciones con hasta 10 imágenes de referencia, generación transparente y extracción de sujetos (pasar una foto y pedir un recorte RGBA). La ficha del modelo también documenta la ruta de entrenamiento, una receta de tres etapas: 3,100 renders de profesor a 40 pasos con ruido fijo registrados en los 8 niveles de ruido del estudiante, 3,000 pasos de regresión de trayectoria y luego 2,500 pasos de coincidencia de distribución DMD2 con un crítico de puntuación falsa y una cabeza GAN. El crítico es una segunda LoRA sobre el mismo transformer congelado.

Ejecutarlo en ComfyUI

Turbo8 apunta directamente al soporte nativo de Qwen-Image 2.1 de ComfyUI:

  1. Coloca turbo8_lora_step2500.safetensors en ComfyUI/models/loras/.
  2. Carga comfyui/turbo8_t2i.json (texto a imagen y RGBA) o comfyui/turbo8_edit.json (edición y extracción).
  3. Mantén 8 pasos, CFG 1, muestreador euler, scheduler simple.

El gráfico T2I incluye un nodo ModelSamplingFlux (max_shift 0.6935, base_shift 0.5) conectado a ancho y alto, que reproduce el programa de ruido dependiente de la resolución con el que se destiló la LoRA, incluso a 2K. Según la ficha del modelo, las 227 capas de la LoRA se mapean en ComfyUI y una imagen de 1024² tarda unos 4 segundos en una RTX PRO 6000.

Cómo se compara con el profesor

La ficha del modelo evalúa Turbo8 contra su propio profesor, el modelo base a 40 pasos, sobre 192 prompts reservados: DrawBench más semillas adicionales, prompts de renderizado de texto, sujetos RGBA, ediciones y extracciones de OmniEdit.

MétricaProfesor (40 pasos)Turbo8 (8 pasos)
PickScore, T2I22.1521.94
CLIPScore, T2I26.8926.89
PickScore, RGBA20.5120.07
Coincidencia exacta de texto (OCR)95.0%75.0%
Precisión de caracteres de texto99.6%95.3%
Tasa de transparencia (RGBA + extracción)0.8750.925
Diversidad de semillas (menor es más variado)0.7050.670
Similitud de edición con el profesor (DINOv2)n/a0.967
IoU de alfa de extracción vs profesorn/a0.85
Profesor a 40 pasos frente a Turbo8 a 8 pasos, misma semilla

Profesor a 40 pasos (fila superior de cada par) frente a Turbo8 a 8 pasos (fila inferior), misma semilla. Las muestras cubren texto a imagen, renderizado de texto, ediciones, RGBA y extracción.

Limitaciones documentadas

La ficha del modelo enumera las carencias en lugar de dejarlas para que se descubran:

  • El texto denso o largo (párrafos, letra pequeña) se degrada mucho más que a 40 pasos, mientras que los titulares cortos, carteles y etiquetas siguen siendo fiables.
  • En algunas escenas con mucho contenido, la composición puede diferir de la del profesor con la misma semilla.
  • La extracción hereda los casos de fallo del modelo base: en la evaluación, 3 de 16 extracciones salieron vacías tanto para el profesor como para Turbo8, y Turbo8 a veces conserva más contexto alrededor en el recorte.

En la comunidad

En el canal #qwen-image de Banodoco, los usuarios probaron Turbo8 frente a las rutas anteriores de pocos pasos durante los días siguientes. El hallazgo común fue que necesita una fuerza reducida y más de 8 pasos para mantenerse en edición: los informes se asentaron en torno a fuerza 0.65 y unos 16 pasos antes de que aparezcan artefactos en el cuerpo, y varios usuarios lo situaron por delante del turbo Viggle de 6 pasos para ediciones, aunque seguían prefiriendo el programa de 8 pasos de Pruna para algunos trabajos.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Turbo8: LoRA de destilación de 8 pasos para Qwen-Image 2.1 | ComfyUI Wiki