Fizgig v6.5 : LoRA Qwen Image 2.1 avec un adaptateur maison

ComfyUI Wikinews

Fizgig v6.5 ajoute l'entraînement LoRA et LoKR pour Qwen Image 2.1 avec adaptateur maison, des aperçus turbo et un nouveau système de pilotes. Les LoRAs se chargent dans ComfyUI.

Fizgig v6.5.0, publié le 27 septembre, fait de Qwen Image 2.1 un modèle de base entraînable au sein du studio (GitHub | notes de version | guide Qwen Image 2.1). Fizgig entraîne déjà des LoRAs, des LoKRs et des fine-tunes complets pour Flux 2 Klein, Krea 2 et MiniMax H3. Cette version apporte le même outillage au modèle d'image de Qwen, et Qwen Image 2.1 est le premier modèle ajouté via le nouveau système de pilotes du studio.

Studio de LoRA et de fine-tune Fizgig

Fizgig : un atelier pour entraîner, fine-tuner, réparer et explorer avec Flux 2 Klein 9B, Krea 2, MiniMax H3 et désormais Qwen Image 2.1

Ce que comprend l'entraînement de Qwen Image 2.1

  • Entraînement LoRA ou LoKR, avec Adaptive LR ou Automagic, EMA, Context LoRA, et pause et reprise.
  • Aperçus turbo pendant l'entraînement, propulsés par le LoRA turbo à 6 étapes de Viggle. Fizgig l'exécute par défaut en dessous de sa pleine puissance, à 0,7 pendant 10 étapes, après avoir constaté dans ses propres tests que cela surpasse les 6 étapes par défaut du turbo à pleine puissance.
  • Un suivi de la perte par image : détection des images problématiques, taux d'apprentissage par image, un échauffement sur les valeurs aberrantes et un légendage automatique des images bloquées avec le même légendeur Qwen3-VL que celui utilisé par l'onglet Captions.
  • Un panneau de remplacement des échantillons en direct pendant une exécution.
  • Les cinq outils de l'atelier : Repair Studio, LoRA the Explorer, Profiler, Extract et LoRA Royale.

Les LoRAs, LoKRs, sauvegardes de Repair Studio et sorties d'Extract enregistrés se chargent via le chargeur de LoRA standard de ComfyUI.

L'adaptateur d'entraînement propre à Fizgig

Les LoRAs Qwen 2.1 ont tendance à s'effondrer en texture ou à vaciller en cours d'exécution, et une perte plus faible ne vous avertit pas que cela se produit. Le correctif de Fizgig est un adaptateur d'entraînement : un petit LoRA qui reste figé et actif pendant l'entraînement, est désactivé pour les aperçus et ne se retrouve jamais dans votre LoRA enregistré, de sorte que le résultat fonctionne sur le modèle de base. Il a été entraîné à une résolution supérieure à celle de l'assistant d'entraînement Qwen 2.1 existant, et l'auteur rapporte que les LoRAs entraînés avec lui ressortent bien plus nets tout en évitant l'effondrement. Il est activé par défaut dans tous les préréglages Qwen et est également publié pour tout entraîneur sur Hugging Face.

Trois préréglages, un point d'équilibre

Les trois préréglages entraînent à 0,5 MP avec adamw8bit, EMA 0,98 et l'adaptateur d'entraînement, pendant 30 époques, avec une sauvegarde à chaque époque :

PréréglageRankTaux d'apprentissagePour
Qwen 2.1 Fast (par défaut)8Adaptive LR 2e-4 à 4e-4La plupart des sujets. Le plus rapide pour atteindre la ressemblance dans les tests de l'auteur, et le meilleur pour préserver le détail de la peau.
Qwen 2.1 Standard16Adaptive LR 1e-4 à 2e-4Jeux de données plus grands ou mixtes. Le rank 16 aux taux du préréglage Fast surapprend.
Qwen 2.1 Style16Fixe 1,5e-4Les styles. Adaptive LR a tendance à grimper sur les jeux de données de style, et c'est là que les styles sur-cuisent.

La raison d'un entraînement plus rapide : Qwen produit des images très nettes d'origine, et un LoRA tire les détails fins comme la texture de la peau vers ce que contient votre jeu de données, si bien qu'un long entraînement sur des photos plus douces échange la netteté de Qwen contre la leur. 0,5 MP représente un demi-million de pixels, soit environ 704×704 pour une image carrée, et Fizgig répartit chaque image par forme à ce nombre de pixels : 624×784 en 4:5, 576×848 en 2:3 et 528×928 en 9:16. Les époques enregistrées restent parcourables dans LoRA Royale, donc si une époque plus tardive paraît plus douce, une époque antérieure est souvent le meilleur choix.

Cartes graphiques à partir de 10 Go

La précision de base et la taille du block swap se règlent automatiquement selon votre VRAM libre. Auto choisit bf16 à partir de 24 Go, INT8 entre 12 et 16 Go, et 4-bit NF4 à 10 Go, qui est le plancher pour Qwen Image 2.1 ; l'encodeur de texte est quantifié en 8 bits en dessous d'environ 20 Go libres, ce qui fixe ce plancher. Dans les tests de l'auteur, une RTX 5090 limitée à 12 Go s'est entraînée en INT8 avec un pic de 9,9 Go, aperçus inclus, et limitée à 10 Go elle s'est entraînée en NF4 avec un pic de 7,3 Go.

Le système de pilotes

Qwen Image 2.1 est le premier modèle ajouté via le nouveau système de pilotes de Fizgig : un modèle est décrit une seule fois, avec ses fichiers, son format de LoRA et son code de modèle derrière une interface standard, et l'entraînement, les aperçus, les téléchargements, la planification de la mémoire et les cinq outils de l'atelier fonctionnent à partir de cette description. Un guide du système et des pull requests ouvertes pour ajouter d'autres modèles sont promis dans la semaine à venir.

Comment l'obtenir

Cliquez sur Download models for me dans la section Qwen Image 2.1 de l'onglet Preferences pour récupérer le DiT, le VAE, l'encodeur de texte, l'adaptateur d'entraînement et le LoRA turbo (environ 34 Go), plus le légendeur Qwen3-VL si vous ne l'avez pas, puis choisissez Qwen Image 2.1 comme Base Model dans l'onglet Training. L'entraînement d'édition pour Qwen Image 2.1 est annoncé comme bientôt disponible.

Fizgig est un entraîneur autonome, pas un nœud ComfyUI : il enregistre des LoRAs au format kohya .safetensors qui se déposent directement dans ComfyUI/models/loras/.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Fizgig v6.5 : LoRA Qwen Image 2.1 avec un adaptateur maison | ComfyUI Wiki