LoRA Pruna Qwen-Image 2.1 en 5 et 8 étapes dans ComfyUI

ComfyUI Wikinews

Les LoRA Pruna-Qwen-Image-2.1 de PrunaAI réduisent la génération et l'édition Qwen-Image 2.1 à 5 ou 8 étapes sans CFG, avec conversions ComfyUI communautaires et sigmas par étape.

Pruna-Qwen-Image-2.1 est une paire d'adaptateurs LoRA few-step signés PrunaAI pour Qwen-Image 2.1. Ils exécutent la génération texte-image et l'édition multi-références en 5 ou 8 passes du transformer au lieu de 40, sans classifier-free guidance, et ils se chargent par-dessus le pipeline de base, l'encodeur de texte et le VAE non modifiés.
Exemples texte-image en 1024 avec les adaptateurs Pruna

Comparaisons texte-image issues de la carte de modèle officielle.

Deux adaptateurs, deux plannings

Cette publication n'est pas un seul modèle distillé mais deux étudiants entraînés séparément, et PrunaAI vous invite à en choisir un selon que vous privilégiez la qualité ou la vitesse :

AdaptateurÉtapesCompromis
p_qwen_image_2.1_8step_v0.1.safetensors8Qualité supérieure, la valeur par défaut recommandée
p_qwen_image_2.1_5step_v0.1.safetensors5Plus rapide, avec des images visiblement moins bonnes

Chaque adaptateur a été entraîné pour son propre planning sigma, et la carte de modèle demande de n'en charger qu'un seul à la fois. Les plannings sont la partie qui doit être copiée exactement, car les étudiants n'ont pas été entraînés pour un nombre d'étapes qu'un échantillonneur déduit de lui-même :

ÉtapesSigmas
51.0, 0.94, 0.857142857, 0.666666667, 0.4
81.0, 0.933333333, 0.857142857, 0.769230769, 0.666666667, 0.545454545, 0.4, 0.222222222

Les deux sont entraînés avec DMD, fonctionnent à CFG 1.0 avec un prompt négatif vide, et le 0 terminal est ajouté par le scheduler plutôt qu'écrit dans le planning. D'autres nombres d'étapes, plannings ou valeurs de CFG sortent du cadre pour lequel les adaptateurs ont été entraînés.

Latence mesurée en texte-image en 1K et 2K

Le graphique de latence texte-image de la carte, mesuré sur un seul H100 80GB : médiane de trois requêtes après un échauffement, incluant l'encodage du prompt, le débruitage et le décodage, avec le modèle de base à 40 étapes avec KV cache et les adaptateurs à 5 ou 8 étapes sans celui-ci.

Le chiffre phare de PrunaAI est jusqu'à 6,3x plus rapide, et la carte prend soin de préciser ce qu'elle ne revendique pas : les temps ne signifient pas une qualité d'image équivalente, les LoRA sont restés non fusionnés pour le benchmark, et les images d'exemple activent le KV caching alors que le graphique n'a pas été remesuré avec ce réglage.

Couverture d'entraînement et limites

Les adaptateurs ont été entraînés uniquement en résolution 1K, sur un mélange de prompts simples et suréchantillonnés, couvrant le texte-image et l'édition d'une ou plusieurs images avec jusqu'à 3 images de référence. PrunaAI recommande de commencer à 1024x1024 et considère la sortie 2K, davantage d'images de référence et les prompts courts et vagues comme hors couverture, où la qualité peut varier.

La publication est explicitement étiquetée v0.1, en cours de développement :

  • La qualité est inférieure à celle du modèle de base à 40 étapes, et le référentiel sera mis à jour au fur et à mesure que la distillation s'améliore.
  • L'adaptateur 5 étapes est le plus rapide, et ses images sont visiblement moins bonnes que celles de l'adaptateur 8 étapes.
  • Ce n'est pas un modèle autonome : les poids de base Qwen/Qwen-Image-2.1 sont toujours requis.
Exemples d'édition multi-références

Grilles d'édition issues de la carte de modèle officielle.

Disponibilité dans ComfyUI

Il n'existe pas encore de package ComfyUI officiel pour ces adaptateurs : ils sont livrés sous forme de fichiers diffusers/PEFT avec un rank 64 et un alpha PEFT de 128, et l'alpha est stocké dans les métadonnées safetensors plutôt que dans les tenseurs que lit le chargeur LoRA de ComfyUI, si bien qu'un simple dépôt direct s'exécuterait à la mauvaise échelle. La communauté a comblé cet écart en moins d'un jour après la publication :

  • NidAll/pruna-image-2.1-comfyui-loras est une conversion non officielle qui ajoute un tenseur scalaire .alpha à chacune des 224 cibles LoRA afin que les adaptateurs s'exécutent à l'échelle prévue avec une force LoRA de 1.0, sans toucher aux poids A et B. Elle fournit ses propres fichiers JSON de flux de travail en 5 étapes et 8 étapes.
  • Ces flux de travail n'utilisent que des nœuds natifs de ComfyUI : ManualSigmas, SamplerCustom, Euler, CFG 1.0, force LoRA 1.0, aucun prompt négatif, et texte-image en 1024x1024. Les fichiers de base proviennent de Comfy-Org/Qwen-Image-2.1, ce qui signifie que le transformer int8_convrot est la cible pratique pour toute personne limitée en VRAM.

ComfyUI prend en charge Qwen-Image 2.1 nativement depuis la publication Day-0, donc rien de plus n'a besoin d'être installé : un ComfyUI récent avec ManualSigmas et SamplerCustom couvre les deux flux de travail fournis.

Exemple d'édition d'image en 1024

Un exemple d'édition issu de la carte de modèle, exécuté avec les adaptateurs few-step.

Exemples texte-image en 2048

Texte-image en 2048, hors de la couverture d'entraînement 1K mais intégré aux mesures de latence publiées.

Les premiers tests viennent surtout de la communauté ComfyUI plutôt que de la publication elle-même : les adaptateurs ont été comparés au turbo de Viggle et aux LoRA Qwen Acc officiels dans le canal #qwen-image de Banodoco, où les testeurs ont particulièrement distingué l'adaptateur 8 étapes, et ils ont été publiés sur r/StableDiffusion et X peu après la mise en ligne des poids.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
LoRA Pruna Qwen-Image 2.1 en 5 et 8 étapes dans ComfyUI | ComfyUI Wiki