Qwen-Image 2.1 Fun Acc LoRA : distillation officielle en 4 étapes

ComfyUI Wikinews

Alibaba PAI distille Qwen-Image 2.1 en 4 étapes avec un LoRA PDD de 346 Mo qui couvre la génération texte-image et l'édition par instruction, avec son propre calendrier sigma.

Qwen-Image-2.1-Fun-Acc-LoRAs (Hugging Face | VideoX-Fun) est l'adaptateur d'accélération en 4 étapes d'Alibaba PAI pour Qwen-Image 2.1. Un seul LoRA de 346 Mo ramène la génération texte-image et l'édition par instruction à 4 NFE grâce à la distillation par décodage parallèle (Parallel Decoding Distillation), et le référentiel fournit aussi le code de l'échantillonneur et le calendrier sigma exact pour lequel il a été distillé.

L'adaptateur suit la même recette qu'Alibaba PAI avait utilisée pour les MiniMax H3 PDD Acc LoRAs en août : prendre un modèle de base puissant, le distiller avec la distillation par décodage parallèle (PDD, arXiv 2607.26004), puis publier le LoRA extrait accompagné du code d'inférence nécessaire pour reproduire les résultats de référence. Qwen-Image 2.1 lui-même est sorti le 20 septembre 2026 et est déjà pris en charge dans ComfyUI ; il s'agit donc d'une variante d'accélération d'un modèle qui n'a que quelques jours.

Ce que contient le référentiel

Adaptateurmodels/Qwen-Image-2.1-Fun-Acc-4Step.safetensors, 346 Mo, rang 64 et network_alpha 64 en BF16
Modèle de baseQwen-Image 2.1 (Qwen/Qwen-Image-2.1), poids inchangés
Étapes4 NFE (pdd_num_steps: 4, pdd_block_size: 1)
TâchesGénération texte-image et édition d'image par instruction
Cibles entraînéesimg_in, modulation.1, norm_out.linear, les plongements de pas de temps, attn.to_q/to_k/to_v/to_out.0 et img_mlp des 32 blocs du transformer, plus txt_in.in_layer / txt_in.out_layer
Extras réservés à l'inférencenorm_q / norm_k de l'attention et txt_in.text_norm sont stockés comme paramètres complets plutôt que comme paires LoRA
Taille d'échantillon par défaut2048 x 2048 (pdd_sample_size)
Précision d'échantillonnagenative_time_fp32_state

Le calendrier sigma fait partie de la publication et non d'un détail d'implémentation : pdd_config.json fixe le calendrier en quatre étapes à 1.0, 0.9169867, 0.7861579, 0.549491, 0.0, et le format exporté est qwenimage21_extracted_prefused_v1. C'est pour ces valeurs qu'il ne s'agit pas d'un simple LoRA à déposer tel quel. Un échantillonneur 4 étapes générique avec les sigmas par défaut ne reproduit pas le comportement distillé.

Comparaison

La carte du modèle publie des comparaisons à trois voies pour chaque exemple : le professeur (teacher) à 40 NFE, le LoRA PDD à 4 NFE et Viggle v0.1 full à 4 NFE. Le PDD n'est pas seulement comparé à son propre professeur, mais aussi à l'autre approche en 4 étapes pour ce modèle, à savoir le LoRA turbo Viggle publié plus tôt en septembre.

Sortie du professeur à 40 NFESortie du LoRA PDD à 4 NFEViggle v0.1 à 4 NFE
Professeur : 40 NFELoRA PDD : 4 NFEViggle v0.1 full : 4 NFE

Échantillon texte-image, invite tirée de l'article PDD. Les trois panneaux utilisent la graine 42.

L'édition est couverte par le même adaptateur, y compris les éditions multi-références. L'exemple ci-dessous redessine le drapeau dans l'image de référence, et la troisième colonne correspond à la même approche en 4 étapes servie par le LoRA turbo Viggle.

Référence d'éditionÉdition du professeurÉdition du LoRA PDDÉdition Viggle v0.1
Image de référenceProfesseur : 40 NFELoRA PDD : 4 NFEViggle v0.1 full : 4 NFE
Édition du professeur à deux référencesÉdition du LoRA PDD à deux référencesÉdition Viggle v0.1 à deux références
Professeur : 40 NFELoRA PDD : 4 NFEViggle v0.1 full : 4 NFE

Échantillon d'édition à deux références (personne et chat), graine 43.

Limites documentées

La carte du modèle signale deux lacunes connues par rapport au professeur plutôt que de laisser les utilisateurs les découvrir :

  • Les textes denses et de petite taille peuvent se dégrader nettement, avec des traits de caractères déformés et une lisibilité réduite.
  • Certaines sorties d'édition paraissent légèrement plus floues et plus sombres que celles du professeur, avec une netteté des détails réduite.

Disponibilité

Il n'existe aucune prise en charge officielle dans ComfyUI, et la publication est écrite pour le pipeline officiel :

  • Diffusers uniquement : conservez les fichiers qwenimage21_pdd.py et lora_utils_pdd.py fournis à côté des scripts et exécutez python predict_t2i.py (génération) ou python predict_t2i_edit.py (édition).
  • VideoX-Fun : utilisez une copie du dépôt qui expose QwenImage21Pipeline depuis videox_fun.pipeline et exécutez predict_t2i_videox_fun.py ou predict_t2i_edit_videox_fun.py.

Pour ComfyUI, il n'existe pour l'instant qu'une voie expérimentale : Kijai a publié une branche Qwen-Image 2.1 PDD du référentiel ComfyUI, et le LoRA doit être converti avant qu'un chargeur ComfyUI puisse l'utiliser. Comme le calendrier et les paramètres norm_q / norm_k / text_norm hors LoRA font partie de la distillation, considérez les conversions ComfyUI de cet adaptateur comme un travail de la communauté plutôt que comme une voie prise en charge.

Les adaptateurs d'accélération antérieurs de la même équipe pour MiniMax H3 constituent le point de référence le plus proche pour comprendre le fonctionnement de cette famille de publications : là aussi, le LoRA distillé était livré avec sa propre recette d'inférence plutôt que comme un LoRA standard pour le modèle de base.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Qwen-Image 2.1 Fun Acc LoRA : distillation officielle en 4 étapes | ComfyUI Wiki