Supra2-IMG: un modelo de texto a imagen de 100M entrenado en 10 horas

ComfyUI Wikinews

SupraLabs publica Supra2-IMG, un modelo DiT de texto a imagen de 105M de parámetros entrenado desde cero en 10 horas en una sola H100, con muestras a 256x256.

SupraLabs ha publicado Supra2-IMG, un diffusion transformer de 105M de parámetros para generación de texto a imagen. Fue entrenado desde cero en 10 horas en una sola H100, y los autores describen el resultado como el estado del arte para ese presupuesto de parámetros.
Supra2-IMG: un modelo de texto a imagen de 100M de parámetros

El banner oficial de Supra2-IMG del repositorio del modelo.

Qué es

Supra2-IMG es un DiT diminuto: 104,1M de parámetros que genera imágenes de 256x256 a partir de 128 tokens de contexto de Flan-T5. El acondicionamiento de texto proviene de un encoder Flan-T5-Base congelado y los latentes se decodifican con SD-VAE-FT-MSE, por lo que ambos componentes se obtienen de sus propios repositorios en lugar de incluirse en el checkpoint.

ComponenteValor
Parámetros104,1M (D_MODEL 576, profundidad 14, 9 cabezas, dim. de cabeza 64, relación MLP 4.0)
Resolución256x256 (latente de 32x32, tamaño de parche 2)
Encoder de textoFlan-T5-Base, congelado, contexto de 128 tokens
VAESD-VAE-FT-MSE
Checkpointmodel_final_ema.pt

SupraLabs es el laboratorio independiente detrás de los modelos de lenguaje Supra2 de 100M de parámetros, y Supra2-IMG aplica el mismo enfoque de "entrénalo pequeño, entrénalo desde cero" a la generación de imágenes. El modelo se publica como código PyTorch sin procesar más los pesos: inference.py, config.json y model_final_ema.pt.

Entrenamiento

La ejecución es deliberadamente modesta, que es el objetivo de esta publicación:

  • Dataset: 10 épocas sobre el dataset completo LucasFang/FLUX-Reason-6M, 5,6M de imágenes después de la preparación.
  • Selección de leyendas: cada imagen toma la primera leyenda disponible en la cadena caption_composition a caption_entity a caption_text a caption_style a caption_imaginative, conservando la anotación de mayor calidad para cada muestra.
  • Hardware: una Nvidia H100 SXM 80GB en RunPod, 9 horas incluyendo la preparación de datos, en un disco de 2,5TB.

Como el modelo completo cabe en unos pocos cientos de megabytes, es una base práctica para estudiar el preentrenamiento a pequeña escala y para experimentos de fine-tuning que serían demasiado costosos a escala de 8B.

Muestras

Muestras de Supra2-IMG

Muestras oficiales del repositorio del modelo, todas con las configuraciones recomendadas en lugar de ejecuciones seleccionadas.

Salida de ejemplo de Supra2-IMG

Salida de ejemplo a 256x256 producida por el script de inferencia incluido.

Disponibilidad

No hay soporte para ComfyUI: Supra2-IMG es una publicación de PyTorch simple con una arquitectura SupraDiT personalizada, por lo que no es un pipeline de diffusers y no se publica ninguna plantilla ni nodo de ComfyUI. Ejecutarlo implica el script incluido más los dos componentes externos:

wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py
python inference.py --prompt "a sea jellyfish floating in the pitch-black ocean depths" \
  --seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png

Las configuraciones de muestreo recomendadas son semilla 0, CFG 3.0 y 50 pasos.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Supra2-IMG: un modelo de texto a imagen de 100M entrenado en 10 horas | ComfyUI Wiki