LLaDA-Image : InclusionAI Rend Open-Source un Modèle de Génération et d'Édition d'Images 6B

ComfyUI Wikinews

InclusionAI lance LLaDA-Image, un modèle unifié de génération et d'édition de 6B avec une variante Turbo en 4 étapes, ainsi qu'un pack de Nœuds ComfyUI communautaire avec des poids INT8 et GGUF.

LLaDA-Image (GitHub, Hugging Face) est une famille de modèles unifiés de génération et d'édition d'images de 6B paramètres d'InclusionAI (l'équipe du Groupe Ant derrière Ling), publiée le 4 septembre sous Apache-2.0 avec une recette complète d'entraînement ouverte. Un pack de Nœuds ComfyUI communautaire de RebelAI l'exécute déjà localement.
Présentation de la génération photoréaliste de LLaDA-Image

Échantillons de génération photoréaliste depuis le référentiel officiel : éclairage naturel, détails réalistes et scènes cohérentes à multiples sujets.

Un seul checkpoint pour la génération et l'édition

LLaDA-Image est un modèle de diffusion unifié où la colonne vertébrale et le DiT sont tous deux des modèles de diffusion entraînés dans un cadre unique. Contrairement aux modules complémentaires d'édition fixés sur un modèle Texte vers image, un seul checkpoint gère :

  • Génération Texte vers image en 50 étapes sur le Modèle de base
  • Édition guidée par instructions avec préservation de la référence, utilisant le chemin d'édition natif du modèle plutôt qu'une solution de contournement img2img basée sur la force de denoise
  • Génération conditionnée VQ via le module de conditionnement SigVQ
  • Rendu de texte chinois et anglais dans les images générées

La recette d'entraînement est entièrement ouverte dans le rapport arXiv accompagnant : le pré-entraînement uniquement sur image construit d'abord le prior visuel, la supervision linguistique appariée vient ensuite, et l'entraînement conjoint génération-édition unifie les deux compétences. Sur Qwen-Image-Bench, il obtient 53,53 en anglais et 53,38 en chinois, des résultats globaux de pointe pour un modèle ouvert de 6B au moment de sa sortie.

Présentation du rendu de texte et de la génération d'affiches

Rendu de texte chinois et anglais avec des mises en page de qualité affiche.

Présentation de l'édition guidée par instructions

Édition native : le contenu reste fidèle tandis que seule la modification indiquée est appliquée.

Turbo : 4 étapes au lieu de 50

À côté du Modèle de base, LLaDA-Image-Turbo condense le pipeline avec une distillation Twin-DMD jusqu'à 2 à 4 étapes d'échantillonnage pour la génération et l'édition. Quatre variantes de checkpoint sont livrées dès le premier jour : BF16 et FP8 pour chacun de Base et Turbo, environ 49 Go par variante dans la disposition diffusers.

ModèleÉtapesCheckpoints
LLaDA-Image (Base)50BF16, FP8
LLaDA-Image-Turbo2-4BF16, FP8
Comparaison Qwen-Image-Bench

Scores globaux Qwen-Image-Bench : LLaDA-Image domine la classe ouverte 6B tant en anglais qu'en chinois.

Lancez-le dans ComfyUI avec le pack de Nœuds RebelAI

Une intégration communautaire de RealRebelAI est arrivée le même jour que la publication des poids. Le pack fournit quatre nœuds : LLaDA Image Chargeur, LLaDA Image Texte vers Image, LLaDA Image Édition et LLaDA Image Déchargement. Le nœud d'édition appelle le chemin d'édition natif du modèle (generation_mode="editing"), pas une approximation de force de denoise, et les dimensions d'édition doivent être divisibles par 32.

L'intégration utilise des poids optimisés de RealRebelAI/LLaDa-Image-Turbo_ComfyUI et un pack Base correspondant, environ 29 Go par pack :

FichierEmplacementTaille
LLaDA-Image-Turbo-transformer-BF16.safetensorsmodels/diffusion_models/13.1 Go
LLaDA-Image-Turbo-INT8.safetensorsmodels/diffusion_models/6.6 Go
LLaDA-Image-Turbo-text_encoder-Q4_K_M.ggufmodels/text_encoders/9.2 Go
LLaDa_VAE.safetensorsmodels/vae/0.17 Go

Le transformateur INT8 est une quantisation safetensors native plutôt que GGUF ; GGUF est utilisé uniquement pour le encodeur de texte LLaDA2-MoE quantifié. Pour Turbo, commencez par 4 étapes et CFG 1.0.

Le code d'entraînement est listé comme bientôt disponible sur la feuille de route officielle.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
LLaDA-Image : InclusionAI Rend Open-Source un Modèle de Génération et d'Édition d'Images 6B | ComfyUI Wiki