Ming-Image 0.1 Design: modelo 6B para UI y pósteres en ComfyUI

ComfyUI Wikinews

Ming-Image 0.1 Design es el modelo texto a imagen 6B de inclusionAI para UI, infografías y pósteres con mucho texto, con transparencia RGBA y soporte en ComfyUI en progreso.

Ming-Image 0.1 Design (Hugging Face | GitHub | ModelScope) es el modelo texto a imagen de pesos abiertos de 6B de inclusionAI orientado al diseño visual: pantallas de UI, infografías, pósteres y otras composiciones con mucho texto. También escribe transparencia RGBA real, y un checkpoint hermano descompone un diseño terminado en capas editables. Actualmente se está trabajando en el soporte para ComfyUI.
Ejemplos generados por Ming-Image 0.1 Design

Ejemplos de diseño de la ficha oficial del modelo.

Qué es Ming-Image 0.1 Design

Ming-Image 0.1 Design proviene de inclusionAI, el equipo detrás de las familias de modelos Ling y Bailing, y está orientado a una tarea que los modelos de imagen generales resuelven mal: componer un diseño limpio y legible en lugar de una fotografía. Las pantallas, dashboards, diseños de tarjetas responsive, paneles de infografías, pósteres de productos y hojas de logotipos son el contenido objetivo, y los ejemplos oficiales insisten mucho en que el texto renderizado sea legible y tipográficamente correcto.

  • Transformer de difusión de 6B. El DiT es un diseño de 30 capas y 3840 dimensiones con 16 canales de entrada y parcheado 2x2, combinado con un codificador de visión-lenguaje independiente y su propio conector. Kijai describe la base como derivada de Z-Image con un nuevo codificador de texto.
  • Datos de entrenamiento centrados en el diseño en lugar de un corpus general de fotografías, que es la razón por la que las salidas se leen como diseños compuestos con bloques de texto reales.
  • Dos resoluciones de salida nativas, 1024 y 2048, y se recomienda 2048 para diseños completos.
  • Los valores predeterminados de muestreo son cortos: 12 pasos con CFG 1.0, así que un diseño se genera en pocas pasadas.
  • La mejora del prompt forma parte del flujo previsto. El pipeline oficial recomienda reescribir el prompt con Ling-3.0-flash-VL o qwen3.8-27B antes de la generación, algo que importa sobre todo en diseños densos con mucho texto que colocar.
Diseño de tarjetas responsive generado por Ming-Image 0.1 Design

Un diseño de tarjetas responsive, una de las muestras oficiales de texto a imagen.

Fondos transparentes como salida de primera clase

Además de las imágenes normales, Ming-Image 0.1 Design puede emitir una imagen RGBA con un canal alfa real, de modo que un elemento de póster generado, un recorte de producto o un recurso de UI llega listo para componer en lugar de necesitar una pasada de recorte aparte. La ficha del modelo incluye un conjunto de frases de activación recomendadas y pide anteponer exactamente una de ellas, el mismo patrón que Qwen-Image 2.1 usa para su modo de transparencia.

Generaciones con fondo transparente

Salidas con fondo transparente. El damero muestra el canal alfa y no forma parte de la imagen generada.

El hermano Layer: de diseño a capas editables

La serie tiene un segundo checkpoint de 6B, Ming-Image 0.1 Design Layer, que plantea el problema a la inversa: toma una imagen de diseño aplanada y la descompone en capas transparentes editables por separado. Ese es el paso que convierte un mockup generado en algo con lo que puedes trabajar realmente en una herramienta de diseño, e inclusionAI lo acompaña de dos flujos de trabajo de agente publicados: una habilidad de diseño de UI de Ling que usa referencias generadas más descomposición en capas para construir y verificar visualmente código de UI, y una habilidad de imagen a PPT editable que recrea una página generada como elementos nativos de PowerPoint.

El checkpoint Layer usa valores predeterminados de muestreo distintos a los del modelo de diseño: 12 pasos con CFG 2.0, con resoluciones de trabajo de 512 y 1024.

Dónde se sitúa en la tabla de clasificación de UI/UX

inclusionAI publicó el modelo en la tabla de clasificación UI/UX Design de Artificial Analysis junto con el lanzamiento, que es la señal más clara de con quién compite el modelo.

Ming-Image 0.1 Design en la tabla de clasificación de UI/UX Design

Posición de Ming-Image 0.1 Design en la tabla de clasificación de UI/UX Design, del repositorio oficial.

Disponibilidad en ComfyUI

El soporte de ComfyUI para Ming-Image está en progreso, así que todavía no hay una implementación central fusionada ni una plantilla de flujo de trabajo oficial. Dos cosas lo hacen usable hoy:

  • Kijai publicó un reempaquetado para ComfyUI de los pesos en Kijai/Ming-Image-ComfyUI con variantes BF16, int8_convrot y w4a8 del transformer y del codificador de texto, además del VAE correspondiente, organizados en las carpetas habituales diffusion_models / text_encoders / vae.
  • La implementación central está en ComfyUI PR #16482, donde Kijai afirma que el nodo ya maneja la salida RGBA. El pull request sigue abierto, así que una instalación de ComfyUI sin modificar todavía no puede cargar el modelo.

Las primeras pruebas en el canal #ming-image de Banodoco sugieren que aquí los muestreadores importan más de lo habitual: Kijai señala que la salida de LCM es limpia pero demasiado suave y que los fallos aleatorios de texto siguen siendo comunes con INT8, mientras que RuneX informa de que el modelo responde a prompts de estilo bounding-box y edita rápidamente gracias a su pequeño tamaño. El checkpoint Layer aún no se está empaquetando, ya que Kijai considera que el manejo adicional del codificador de texto y del proyector supone una cantidad significativa de complejidad para un caso de uso más limitado.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Ming-Image 0.1 Design: modelo 6B para UI y pósteres en ComfyUI | ComfyUI Wiki