LLaDA-Image : modèle 6B d'images d'InclusionAI
LLaDA-Image est le modèle ouvert 6B d'InclusionAI pour la génération text-to-image et l'édition native par instructions, avec une variante Turbo et un pack de nœuds ComfyUI.
LLaDA-Image
Text-to-ImageÉdition d'image6BRendu de texteModèle d'image unifié 6B ouvert d'InclusionAI (Ant Group). Un seul checkpoint gère la génération text-to-image et l'édition native guidée par instructions, avec un rendu de texte bilingue chinois et anglais et une recette d'entraînement ouverte. LLaDA-Image Turbo distille le pipeline en 2 à 4 étapes d'échantillonnage.
LLaDA-Image est un modèle de diffusion unifié dans lequel le backbone et le DiT sont tous deux des modèles de diffusion entraînés dans un cadre unique. Au lieu de greffer un module d'édition sur un modèle text-to-image, un seul checkpoint couvre la génération, l'édition guidée par instructions avec préservation de la référence et la génération conditionnée par VQ via le module de conditionnement SigVQ.
Sur Qwen-Image-Bench, il obtient 53,53 en anglais et 53,38 en chinois, soit les meilleurs résultats globaux pour un modèle 6B ouvert lors de sa sortie. La recette d'entraînement complète est documentée dans le rapport arXiv associé.
Modèles
| Modèle | Étapes | Description | Licence | Publié |
|---|---|---|---|---|
| LLaDA-Image Turbo | 2-4 | Variante distillée Twin-DMD empaquetée pour ComfyUI (BF16 / INT8) | Apache-2.0 | 2026-09-04 |
Sélectionnez un modèle ci-dessus pour accéder aux téléchargements de poids vérifiés, aux tutoriels et aux informations associées.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.