Viggle Turbo v0.2 : Qwen-Image 2.1 en 5 étapes sur ComfyUI

ComfyUI Wikinews

La distillation DMD v0.2 de Qwen-Image 2.1 par Viggle réduit la génération à 5 étapes sans CFG, livrée sous forme de LoRA rank-256 avec des conversions ComfyUI communautaires.

Qwen-Image-2.1-viggle-turbo est la distillation DMD de Qwen-Image 2.1 par Viggle. La version v0.2, publiée le 23 septembre 2026, exécute la génération text-to-image et l'édition guidée par référence en 5 passes de transformer au lieu de 40 sans classifier-free guidance, et est livrée sous forme de LoRA rank-256 au-dessus du transformer de base non modifié.
Capybara généré en 5 étapes

Un échantillon text-to-image en 5 étapes issu du Space de démonstration de Viggle.

Ce que change la v0.2

La première version publique, la v0.1, était un aperçu qui réduisait la diversité des sorties et déviait du modèle de base sur la composition. La v0.2 est un modèle étudiant plus grand, et Viggle l'a mesurée par rapport au modèle de base en 40 étapes accompagné de son amélioration de prompt officielle, sur un ensemble réservé de 96 requêtes utilisateur :

MétriqueLoRA v0.1 r64fine-tune complet v0.1LoRA v0.2 r256, 5 étapes
Diversité des échantillons vs modèle de base0.750.720.93
Dérive de composition vs modèle de base-0.019-0.033+0.000

La diversité est la distance moyenne entre patchs DINOv2 au sein d'un même prompt sur 8 graines, exprimée en ratio par rapport au modèle de base, et la dérive mesure de combien le centroïde de l'image se déplace par rapport à la sortie du modèle de base pour le même prompt et la même graine. En pratique, cela signifie que la v0.2 conserve la dispersion du modèle de base entre les graines et place les sujets là où le modèle de base le ferait, alors que la v0.1 poussait chaque graine vers des compositions similaires. Les artefacts de la v0.1 restent dans le référentiel pour la reproductibilité, mais Viggle indique qu'il n'y a aucune raison de les préférer.

Comment ça fonctionne

Le modèle étudiant distillé est échantillonné selon un planning fixe plutôt qu'un nombre d'étapes : 5 étapes avec les nœuds sigma [1.0, 0.875, 0.75, 0.5, 0.25], true_cfg_scale=1.0, et sans prompt négatif. Ce sont les nœuds d'entraînement à quatre étapes avec le segment de plus fort bruit scindé en deux, ce qui, selon Viggle, élimine la majeure partie de la perte de détails et des images fantômes d'un simple déploiement en quatre étapes. Les autres nombres d'étapes et valeurs de CFG n'apportent rien.

Deux autres détails comptent pour quiconque veut le câbler :

  • Utilisez la configuration de scheduler fournie, ou définissez shift_terminal=None. Le shift_terminal: 0.02 du modèle de base ruinerait la dernière étape.
  • Gardez l'échelle du LoRA à 1.0, car alpha est égal au rank dans l'adaptateur fourni.

Le text-to-image a été entraîné sur une aire de 1024 et 2048, l'édition sur une aire de 1024 et 1536, et l'édition accepte jusqu'à 3 images de référence dont l'ordre détermine à laquelle <image1>, <image2> et <image3> font référence dans le prompt.

Édition à deux références : la femme tient le chat de l'image 2

Une édition à deux références en 832x1248 en 5 étapes. Prompt : "The woman from image 1 is holding the cat from image 2 in her arms, keep the background of image 1".

Disponibilité dans ComfyUI

La publication officielle est fournie au format de clé diffusers, avec un adaptateur peft_v0.2 en parallèle, et non au format kohya monofichier que ComfyUI charge directement. Il n'existe donc pas encore de flux de travail ComfyUI officiel. La communauté a comblé ce vide dans la journée suivant la v0.1 :

  • t8star/Qwen-Image-2.1-viggle-turbo-4step-r64-comfy convertit l'adaptateur v0.1 r64 en un LoRA chargeable par ComfyUI.
  • Des builds quantifiées de la lignée 4 étapes existent aussi sous forme de dépôts GGUF (Abiray, realrebelai), destinées aux mêmes configurations à faible VRAM que les autres quantifications de Qwen-Image 2.1.

Le transformer, l'encodeur de texte, le VAE et le processeur du modèle de base Qwen-Image-2.1 ne sont pas redistribués avec la distillation, il faut donc toujours les récupérer depuis le modèle de base, que ComfyUI prend déjà en charge nativement.

Ce qu'il ne fait toujours pas

Viggle précise explicitement que la v0.2 reste un aperçu. Le text-to-image se rapproche du modèle de base, mais les éditions complexes restent à la traîne : la composition multi-références, les échanges de visages et les modifications de documents d'identité peuvent produire des figures dupliquées ou fantômes, les demandes du type « garder tout identique » peuvent dériver sur l'identité, et les textes rendus petits ou longs se brouillent plus souvent qu'à 40 étapes. La sortie 2K n'est pas validée par rapport au professeur, et la sortie RGBA, plus de 3 références et l'édition locale basée sur masque ne sont pas testées.

Le modèle est déjà adopté dans la communauté ComfyUI, la publication circulant dans le canal #qwen-image de Banodoco et sur r/StableDiffusion.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Viggle Turbo v0.2 : Qwen-Image 2.1 en 5 étapes sur ComfyUI | ComfyUI Wiki