Viggle Turbo v0.2: Qwen-Image 2.1 en 5 pasos para ComfyUI

ComfyUI Wikinews

La destilación DMD v0.2 de Qwen-Image 2.1 de Viggle reduce la generación a 5 pasos sin CFG y se distribuye como un LoRA de rango 256 con conversiones de ComfyUI de la comunidad.

Qwen-Image-2.1-viggle-turbo es la destilación DMD de Qwen-Image 2.1 realizada por Viggle. La versión v0.2, publicada el 23 de septiembre de 2026, ejecuta texto a imagen y edición guiada por referencias en 5 pasadas del transformer en lugar de 40 sin classifier-free guidance, y se distribuye como un LoRA de rango 256 sobre el transformer base sin modificar.
Capibara generado en 5 pasos

Una muestra de texto a imagen en 5 pasos del propio Space de demostración de Viggle.

Qué cambia la v0.2

La primera versión pública, la v0.1, era una versión preliminar que colapsaba la diversidad de las salidas y se desviaba del modelo base en la composición. La v0.2 es un estudiante más grande, y Viggle lo midió contra el modelo base de 40 pasos más su mejora de prompts oficial sobre un conjunto reservado de 96 solicitudes de usuarios:

MétricaLoRA v0.1 r64Ajuste fino completo v0.1LoRA v0.2 r256, 5 pasos
Diversidad de muestras frente al modelo base0.750.720.93
Deriva de composición frente al modelo base-0.019-0.033+0.000

La diversidad es la media de la distancia de patches DINOv2 intra-prompt sobre 8 semillas, expresada como una relación respecto al modelo base, y la deriva es cuánto se desplaza el centroide de la imagen respecto a la salida del modelo base para el mismo prompt y la misma semilla. En la práctica, eso significa que la v0.2 mantiene la dispersión del modelo base entre semillas y coloca los sujetos donde lo haría el modelo base, mientras que la v0.1 empujaba todas las semillas hacia composiciones similares. Los artefactos de la v0.1 permanecen en el repositorio por reproducibilidad, pero Viggle dice que no hay razón para preferirlos.

Cómo se ejecuta

El estudiante destilado se muestrea con un calendario fijo en lugar de un número de pasos: 5 pasos con los nodos sigma [1.0, 0.875, 0.75, 0.5, 0.25], true_cfg_scale=1.0 y sin prompt negativo. Esos son los nodos de entrenamiento de cuatro pasos con el segmento de mayor ruido dividido en dos, algo que, según Viggle, elimina la mayor parte de la pérdida de detalle y el efecto fantasma de un despliegue simple de cuatro pasos. Otros recuentos de pasos y valores de CFG no ayudan.

Hay dos detalles más que importan a quien vaya a montarlo:

  • Usa la configuración de scheduler incluida, o establece shift_terminal=None. El shift_terminal: 0.02 del modelo base arruinaría el paso final.
  • Mantén la escala del LoRA en 1.0, ya que alfa es igual al rango en el adaptador incluido.

El texto a imagen se entrenó con un área de 1024 y 2048, y la edición con un área de 1024 y 1536, y la edición acepta hasta 3 imágenes de referencia cuyo orden fija a cuál de ellas se refieren <image1>, <image2> e <image3> dentro del prompt.

Edición con dos referencias: mujer sosteniendo el gato de la imagen 2

Una edición con dos referencias a 832x1248 en 5 pasos. Prompt: "The woman from image 1 is holding the cat from image 2 in her arms, keep the background of image 1".

Disponibilidad en ComfyUI

La versión oficial se distribuye en formato de claves de diffusers más un adaptador peft_v0.2 paralelo, no en el formato kohya de archivo único que ComfyUI carga directamente, por lo que todavía no hay un flujo de trabajo oficial para ComfyUI. La comunidad cubrió ese hueco en un día desde la v0.1:

El transformer base Qwen-Image-2.1, el text encoder, el VAE y el procesador no se redistribuyen con la destilación, así que esos todavía tienen que venir del modelo base, que ComfyUI ya soporta de forma nativa.

Lo que todavía no hace

Viggle es explícito en que la v0.2 sigue siendo una versión preliminar. El texto a imagen se acerca al modelo base, pero la edición complicada todavía va por detrás: la composición con múltiples referencias, los intercambios de rostro y las ediciones de documentos de identidad pueden producir figuras duplicadas o fantasma, las solicitudes de "mantén todo igual" pueden derivar en la identidad, y el texto renderizado pequeño o largo se distorsiona con más frecuencia que a 40 pasos. La salida en 2K no está validada contra el maestro, y la salida RGBA, más de 3 referencias y la edición local basada en máscaras no están probadas.

El modelo ya está siendo adoptado en la comunidad de ComfyUI, y el lanzamiento está circulando por el canal #qwen-image de Banodoco y por r/StableDiffusion.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Viggle Turbo v0.2: Qwen-Image 2.1 en 5 pasos para ComfyUI | ComfyUI Wiki