LLaDA-Image : InclusionAI Rend Open-Source un Modèle de Génération et d'Édition d'Images 6B
InclusionAI lance LLaDA-Image, un modèle unifié de génération et d'édition de 6B avec une variante Turbo en 4 étapes, ainsi qu'un pack de Nœuds ComfyUI communautaire avec des poids INT8 et GGUF.
Échantillons de génération photoréaliste depuis le référentiel officiel : éclairage naturel, détails réalistes et scènes cohérentes à multiples sujets.
Un seul checkpoint pour la génération et l'édition
LLaDA-Image est un modèle de diffusion unifié où la colonne vertébrale et le DiT sont tous deux des modèles de diffusion entraînés dans un cadre unique. Contrairement aux modules complémentaires d'édition fixés sur un modèle Texte vers image, un seul checkpoint gère :
- Génération Texte vers image en 50 étapes sur le Modèle de base
- Édition guidée par instructions avec préservation de la référence, utilisant le chemin d'édition natif du modèle plutôt qu'une solution de contournement img2img basée sur la force de denoise
- Génération conditionnée VQ via le module de conditionnement SigVQ
- Rendu de texte chinois et anglais dans les images générées
La recette d'entraînement est entièrement ouverte dans le rapport arXiv accompagnant : le pré-entraînement uniquement sur image construit d'abord le prior visuel, la supervision linguistique appariée vient ensuite, et l'entraînement conjoint génération-édition unifie les deux compétences. Sur Qwen-Image-Bench, il obtient 53,53 en anglais et 53,38 en chinois, des résultats globaux de pointe pour un modèle ouvert de 6B au moment de sa sortie.
Rendu de texte chinois et anglais avec des mises en page de qualité affiche.
Édition native : le contenu reste fidèle tandis que seule la modification indiquée est appliquée.
Turbo : 4 étapes au lieu de 50
À côté du Modèle de base, LLaDA-Image-Turbo condense le pipeline avec une distillation Twin-DMD jusqu'à 2 à 4 étapes d'échantillonnage pour la génération et l'édition. Quatre variantes de checkpoint sont livrées dès le premier jour : BF16 et FP8 pour chacun de Base et Turbo, environ 49 Go par variante dans la disposition diffusers.
Scores globaux Qwen-Image-Bench : LLaDA-Image domine la classe ouverte 6B tant en anglais qu'en chinois.
Lancez-le dans ComfyUI avec le pack de Nœuds RebelAI
Une intégration communautaire de RealRebelAI est arrivée le même jour que la publication des poids. Le pack fournit quatre nœuds : LLaDA Image Chargeur, LLaDA Image Texte vers Image, LLaDA Image Édition et LLaDA Image Déchargement. Le nœud d'édition appelle le chemin d'édition natif du modèle (generation_mode="editing"), pas une approximation de force de denoise, et les dimensions d'édition doivent être divisibles par 32.
L'intégration utilise des poids optimisés de RealRebelAI/LLaDa-Image-Turbo_ComfyUI et un pack Base correspondant, environ 29 Go par pack :
| Fichier | Emplacement | Taille |
|---|---|---|
LLaDA-Image-Turbo-transformer-BF16.safetensors | models/diffusion_models/ | 13.1 Go |
LLaDA-Image-Turbo-INT8.safetensors | models/diffusion_models/ | 6.6 Go |
LLaDA-Image-Turbo-text_encoder-Q4_K_M.gguf | models/text_encoders/ | 9.2 Go |
LLaDa_VAE.safetensors | models/vae/ | 0.17 Go |
Le transformateur INT8 est une quantisation safetensors native plutôt que GGUF ; GGUF est utilisé uniquement pour le encodeur de texte LLaDA2-MoE quantifié. Pour Turbo, commencez par 4 étapes et CFG 1.0.
Le code d'entraînement est listé comme bientôt disponible sur la feuille de route officielle.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.