LLaDA-Image: modelo 6B de imágenes de InclusionAI
LLaDA-Image es el modelo abierto 6B de InclusionAI para texto a imagen y edición nativa por instrucciones, con una variante Turbo y un paquete de nodos ComfyUI de la comunidad.
LLaDA-Image
Texto a ImagenEdición de Imágenes6BRenderizado de TextoModelo de imagen unificado y abierto de 6B de InclusionAI (Ant Group). Un único checkpoint gestiona la generación de texto a imagen y la edición nativa guiada por instrucciones, con renderizado de texto bilingüe en chino e inglés y una receta de entrenamiento abierta. LLaDA-Image Turbo destila el pipeline a 2 o 4 pasos de muestreo.
LLaDA-Image es un modelo de difusión unificado en el que tanto el backbone como el DiT son modelos de difusión entrenados en un único framework. En lugar de añadir un complemento de edición a un modelo de texto a imagen, un solo checkpoint cubre la generación, la edición guiada por instrucciones con preservación de la referencia y la generación condicionada por VQ a través del módulo de acondicionamiento SigVQ.
En Qwen-Image-Bench obtiene 53.53 en inglés y 53.38 en chino, resultados generales state-of-the-art para un modelo abierto de 6B en el momento de su lanzamiento. La receta de entrenamiento completa está documentada en el informe arXiv que lo acompaña.
Modelos
| Modelo | Pasos | Descripción | Licencia | Lanzamiento |
|---|---|---|---|---|
| LLaDA-Image Turbo | 2-4 | Variante destilada Twin-DMD empaquetada para ComfyUI (BF16 / INT8) | Apache-2.0 | 2026-09-04 |
Seleccione un modelo arriba para ver descargas de pesos seleccionadas, tutoriales e información relacionada.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.