Le LoRA Krea 2 Turbo SDA restaure la diversité d'échantillonnage

ComfyUI Wikinews

F16 publie un LoRA Krea 2 Turbo entraîné avec l'Alignement Directionnel Sémantique : la même invite produit des scènes différentes selon les graines, sans perte de qualité.

LoRA de diversité Krea 2 Turbo SDA v1.0 (Hugging Face) de F16 corrige un compromis connu des modèles rapides distillés : Krea 2 Turbo régénère presque la même image à partir de la même invite sur différentes graines. Ce LoRA de rang 32 restaure cette diversité de graines sans nuire à la qualité d'image ni au respect de l'invite, mesuré avec un bond de +85% dans la distance CLIP par paire à qualité HPSv2.1 égale.

L'illustration la plus claire est 16 graines de "un chat assis sur un rebord de fenêtre". Le Turbo de base redessine le même chat tigré et blanc à chaque fois. Avec le LoRA actif, les graines varient les motifs du pelage, l'éclairage, la saison et même le cadre de la fenêtre :

Base : 16 graines, un chatAvec le LoRA SDA : 16 graines, 16 chats
Turbo de base : le même chat 16 foisAvec le LoRA SDA : pelage, lumière et cadres variés

Le même schéma s'applique aux natures mortes (un modèle d'ananas contre des compositions variées) et aux portraits (cadrage identique de portrait en studio contre différents âges, coiffures et scènes).

Comment fonctionne le SDA

Schéma du principe SDA

L'Alignement Directionnel Sémantique traite la réduction de la diversité comme un problème de direction. Pour une image d'entraînement, deux bruits aléatoires sont tirés et bruités à sigma 0,9567, l'étape la plus élevée apprenable du calendrier Turbo en 8 étapes où la composition est décidée. L'enseignant gelé (Krea 2 RAW, le parent non distillé) et l'étudiant (Turbo plus le LoRA) prédisent chacun ce que serait l'image pour les deux bruits, et une pile CLIP gelée intègre les prédictions. Le changement de direction perceptuelle de l'enseignant enregistre comment un échange de bruit devrait déplacer l'image ; la perte apprend à la direction de l'étudiant à correspondre au lieu de réduire tous les bruits sur un modèle unique. Une exploration de candidats best-of-5 ajoute environ 3x la vitesse d'apprentissage en plus.

L'entraînement n'a utilisé que 109 images en 1024x1024, ce qui explique comment un petit adaptateur peut modifier la composition sans dériver le style.

La porte est importante : 2 étapes, puis désactivé

Le LoRA a été entraîné sur un seul nœud à bruit élevé, il doit donc être actif uniquement pour les 2 premières des 8 étapes de débruitage. Les mesures de l'auteur :

Porte (étapes actives sur 8)Résultat
1Fonctionne, mais 20% de diversité en moins
2Configuration prévue, tous les chiffres ci-dessus
8 (toujours actif)Effondrement de la qualité : bruit ou flou, -10% HPS

Le ComfyUI standard applique les LoRA à chaque étape, donc un nœud de planification de LoRA par étape (crochets ou nœuds personnalisés de planification) est requis pour basculer l'adaptateur après l'étape 2. Le référentiel inclut également un flux de travail prêt à l'emploi, Krea2_turbo_sda_workflow.json, construit autour du ClownsharKSampler BÊTA avec la porte câblée.

Fichiers

FichierTailleUtilisation
krea2_turbo_sda_v1.0_comfy.safetensors447 MoFormat de clé ComfyUI
krea2_turbo_sda_v1.0_diffusers.safetensors447 MoKrea2Pipeline diffusers

L'extrait de pipeline diffusers dans la carte du modèle implémente la porte comme un rappel d'étape en une ligne. Une carte de modèle en chinois est incluse dans le référentiel.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Le LoRA Krea 2 Turbo SDA restaure la diversité d'échantillonnage | ComfyUI Wiki