Le LoRA Krea 2 Turbo SDA restaure la diversité d'échantillonnage
F16 publie un LoRA Krea 2 Turbo entraîné avec l'Alignement Directionnel Sémantique : la même invite produit des scènes différentes selon les graines, sans perte de qualité.
L'illustration la plus claire est 16 graines de "un chat assis sur un rebord de fenêtre". Le Turbo de base redessine le même chat tigré et blanc à chaque fois. Avec le LoRA actif, les graines varient les motifs du pelage, l'éclairage, la saison et même le cadre de la fenêtre :
![]() | ![]() |
|---|---|
| Turbo de base : le même chat 16 fois | Avec le LoRA SDA : pelage, lumière et cadres variés |
Le même schéma s'applique aux natures mortes (un modèle d'ananas contre des compositions variées) et aux portraits (cadrage identique de portrait en studio contre différents âges, coiffures et scènes).
Comment fonctionne le SDA
L'Alignement Directionnel Sémantique traite la réduction de la diversité comme un problème de direction. Pour une image d'entraînement, deux bruits aléatoires sont tirés et bruités à sigma 0,9567, l'étape la plus élevée apprenable du calendrier Turbo en 8 étapes où la composition est décidée. L'enseignant gelé (Krea 2 RAW, le parent non distillé) et l'étudiant (Turbo plus le LoRA) prédisent chacun ce que serait l'image pour les deux bruits, et une pile CLIP gelée intègre les prédictions. Le changement de direction perceptuelle de l'enseignant enregistre comment un échange de bruit devrait déplacer l'image ; la perte apprend à la direction de l'étudiant à correspondre au lieu de réduire tous les bruits sur un modèle unique. Une exploration de candidats best-of-5 ajoute environ 3x la vitesse d'apprentissage en plus.
L'entraînement n'a utilisé que 109 images en 1024x1024, ce qui explique comment un petit adaptateur peut modifier la composition sans dériver le style.
La porte est importante : 2 étapes, puis désactivé
Le LoRA a été entraîné sur un seul nœud à bruit élevé, il doit donc être actif uniquement pour les 2 premières des 8 étapes de débruitage. Les mesures de l'auteur :
| Porte (étapes actives sur 8) | Résultat |
|---|---|
| 1 | Fonctionne, mais 20% de diversité en moins |
| 2 | Configuration prévue, tous les chiffres ci-dessus |
| 8 (toujours actif) | Effondrement de la qualité : bruit ou flou, -10% HPS |
Le ComfyUI standard applique les LoRA à chaque étape, donc un nœud de planification de LoRA par étape (crochets ou nœuds personnalisés de planification) est requis pour basculer l'adaptateur après l'étape 2. Le référentiel inclut également un flux de travail prêt à l'emploi, Krea2_turbo_sda_workflow.json, construit autour du ClownsharKSampler BÊTA avec la porte câblée.
Fichiers
| Fichier | Taille | Utilisation |
|---|---|---|
krea2_turbo_sda_v1.0_comfy.safetensors | 447 Mo | Format de clé ComfyUI |
krea2_turbo_sda_v1.0_diffusers.safetensors | 447 Mo | Krea2Pipeline diffusers |
L'extrait de pipeline diffusers dans la carte du modèle implémente la porte comme un rappel d'étape en une ligne. Une carte de modèle en chinois est incluse dans le référentiel.


Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.