LLaDA-Image: InclusionAI Libera Modelo de Generación y Edición de Imágenes de 6B de Código Abierto

ComfyUI Wikinews

InclusionAI lanza LLaDA-Image, un modelo unificado de generación y edición de 6B con variante Turbo de 4 pasos, más un paquete de nodos ComfyUI de la comunidad con pesos INT8 y GGUF.

LLaDA-Image (GitHub, Hugging Face) es una familia de modelos unificados de generación y edición de imágenes de 6B parámetros de InclusionAI (el equipo de Grupo Ant detrás de Ling), lanzado el 4 de septiembre bajo Apache-2.0 con una receta de entrenamiento completamente abierta. Un paquete de nodos ComfyUI de la comunidad de RebelAI ya lo ejecuta localmente.
Muestra de generación fotorrealista de LLaDA-Image

Muestras de generación fotorrealista del repositorio oficial: iluminación natural, detalle realista y escenas coherentes con múltiples sujetos.

Un solo checkpoint para generar y editar

LLaDA-Image es un modelo de difusión unificado donde tanto el backbone como el DiT son modelos de difusión entrenados en un único marco. A diferencia de complementos de edición añadidos a un modelo de Texto a imagen, un solo checkpoint maneja:

  • Generación de Texto a imagen en 50 pasos en el Modelo base
  • Edición guiada por instrucciones con preservación de referencia, usando la ruta de edición nativa del modelo en lugar de un truco de img2img con fuerza de denoise
  • Generación acondicionada por VQ a través del módulo de acondicionamiento SigVQ
  • Renderizado de texto en chino e inglés en las imágenes generadas

La receta de entrenamiento está completamente abierta en el reporte de arXiv adjunto: el preentrenamiento solo con imágenes construye primero el prior visual, luego viene la supervisión de lenguaje pareado, y el entrenamiento conjunto de generación-edición unifica ambas habilidades. En Qwen-Image-Bench obtiene 53.53 en inglés y 53.38 en chino, resultados generales estado del arte para un modelo abierto de 6B al lanzamiento.

Muestra de renderizado de texto y generación de pósters

Renderizado de texto en chino e inglés con maquetaciones tipo póster.

Muestra de edición guiada por instrucciones

Edición nativa: el contenido se mantiene fiel mientras solo se aplica el cambio instruido.

Turbo: 4 pasos en lugar de 50

Junto al Modelo base, LLaDA-Image-Turbo destila la tubería con destilación Twin-DMD hasta 2 a 4 pasos de muestreo tanto para generación como edición. Cuatro variantes de checkpoint se lanzan el primer día: BF16 y FP8 para cada uno de Base y Turbo, aproximadamente 49 GB por variante en formato diffusers.

ModeloPasosCheckpoints
LLaDA-Image (Base)50BF16, FP8
LLaDA-Image-Turbo2-4BF16, FP8
Comparativa de Qwen-Image-Bench

Puntuaciones generales de Qwen-Image-Bench: LLaDA-Image lidera la clase abierta de 6B tanto en inglés como en chino.

Ejecútalo en ComfyUI con el paquete de nodos de RebelAI

Una integración comunitaria de RealRebelAI llegó el mismo día que se liberaron los pesos. El paquete proporciona cuatro nodos: Cargador de Imagen LLaDA, Imagen LLaDA Texto a Imagen, Edición de Imagen LLaDA y Descarga de Imagen LLaDA. El nodo de edición llama a la ruta de edición nativa del modelo (generation_mode="editing"), no una aproximación de fuerza de denoise, y las Dimensiones de edición deben ser divisibles por 32.

La integración utiliza pesos optimizados de RealRebelAI/LLaDa-Image-Turbo_ComfyUI y un paquete Base correspondiente, aproximadamente 29 GB por paquete:

ArchivoUbicaciónTamaño
LLaDA-Image-Turbo-transformer-BF16.safetensorsmodels/diffusion_models/13.1 GB
LLaDA-Image-Turbo-INT8.safetensorsmodels/diffusion_models/6.6 GB
LLaDA-Image-Turbo-text_encoder-Q4_K_M.ggufmodels/text_encoders/9.2 GB
LLaDa_VAE.safetensorsmodels/vae/0.17 GB

El transformador INT8 es una cuantización nativa de safetensors en lugar de GGUF; GGUF se usa solo para el codificador de texto LLaDA2-MoE cuantizado. Para Turbo, comienza con 4 pasos y CFG 1.0.

El código de entrenamiento se lista como Próximamente en la hoja de ruta oficial.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
LLaDA-Image: InclusionAI Libera Modelo de Generación y Edición de Imágenes de 6B de Código Abierto | ComfyUI Wiki