LLaDA-Image: InclusionAI Libera Modelo de Generación y Edición de Imágenes de 6B de Código Abierto
InclusionAI lanza LLaDA-Image, un modelo unificado de generación y edición de 6B con variante Turbo de 4 pasos, más un paquete de nodos ComfyUI de la comunidad con pesos INT8 y GGUF.
Muestras de generación fotorrealista del repositorio oficial: iluminación natural, detalle realista y escenas coherentes con múltiples sujetos.
Un solo checkpoint para generar y editar
LLaDA-Image es un modelo de difusión unificado donde tanto el backbone como el DiT son modelos de difusión entrenados en un único marco. A diferencia de complementos de edición añadidos a un modelo de Texto a imagen, un solo checkpoint maneja:
- Generación de Texto a imagen en 50 pasos en el Modelo base
- Edición guiada por instrucciones con preservación de referencia, usando la ruta de edición nativa del modelo en lugar de un truco de img2img con fuerza de denoise
- Generación acondicionada por VQ a través del módulo de acondicionamiento SigVQ
- Renderizado de texto en chino e inglés en las imágenes generadas
La receta de entrenamiento está completamente abierta en el reporte de arXiv adjunto: el preentrenamiento solo con imágenes construye primero el prior visual, luego viene la supervisión de lenguaje pareado, y el entrenamiento conjunto de generación-edición unifica ambas habilidades. En Qwen-Image-Bench obtiene 53.53 en inglés y 53.38 en chino, resultados generales estado del arte para un modelo abierto de 6B al lanzamiento.
Renderizado de texto en chino e inglés con maquetaciones tipo póster.
Edición nativa: el contenido se mantiene fiel mientras solo se aplica el cambio instruido.
Turbo: 4 pasos en lugar de 50
Junto al Modelo base, LLaDA-Image-Turbo destila la tubería con destilación Twin-DMD hasta 2 a 4 pasos de muestreo tanto para generación como edición. Cuatro variantes de checkpoint se lanzan el primer día: BF16 y FP8 para cada uno de Base y Turbo, aproximadamente 49 GB por variante en formato diffusers.
Puntuaciones generales de Qwen-Image-Bench: LLaDA-Image lidera la clase abierta de 6B tanto en inglés como en chino.
Ejecútalo en ComfyUI con el paquete de nodos de RebelAI
Una integración comunitaria de RealRebelAI llegó el mismo día que se liberaron los pesos. El paquete proporciona cuatro nodos: Cargador de Imagen LLaDA, Imagen LLaDA Texto a Imagen, Edición de Imagen LLaDA y Descarga de Imagen LLaDA. El nodo de edición llama a la ruta de edición nativa del modelo (generation_mode="editing"), no una aproximación de fuerza de denoise, y las Dimensiones de edición deben ser divisibles por 32.
La integración utiliza pesos optimizados de RealRebelAI/LLaDa-Image-Turbo_ComfyUI y un paquete Base correspondiente, aproximadamente 29 GB por paquete:
| Archivo | Ubicación | Tamaño |
|---|---|---|
LLaDA-Image-Turbo-transformer-BF16.safetensors | models/diffusion_models/ | 13.1 GB |
LLaDA-Image-Turbo-INT8.safetensors | models/diffusion_models/ | 6.6 GB |
LLaDA-Image-Turbo-text_encoder-Q4_K_M.gguf | models/text_encoders/ | 9.2 GB |
LLaDa_VAE.safetensors | models/vae/ | 0.17 GB |
El transformador INT8 es una cuantización nativa de safetensors en lugar de GGUF; GGUF se usa solo para el codificador de texto LLaDA2-MoE cuantizado. Para Turbo, comienza con 4 pasos y CFG 1.0.
El código de entrenamiento se lista como Próximamente en la hoja de ruta oficial.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.