MiniMax H3 Image VAE: decodificación de imagen desde una latente

ComfyUI Wikinews

Mamad8 publica un VAE MiniMax H3 experimental que decodifica una latente temporal T=1 directamente en una imagen, sin requerir nodos personalizados.

Mamad8 publicó un VAE MiniMax H3 experimental especializado en imágenes en Hugging Face, compartido en Reddit el 9 de agosto. El checkpoint decodifica una sola latente temporal (T=1) directamente en una imagen, lo que ofrece una ruta de imagen directa de una sola latente utilizable para el formato de latente de 24 canales de H3. Se distribuye como un checkpoint de VAE H3 fusionado estándar, por lo que no se requiere ningún nodo personalizado ni un cabezal de decodificador separado.

Imágenes fuente (izquierda) y reconstrucciones del VAE (derecha)

Qué es y qué no es

La tarjeta del modelo es explícita acerca de las contrapartidas:

  • Solo imágenes. El decodificador especializado en imágenes degrada notablemente la reconstrucción de vídeo de múltiples fotogramas y puede introducir efectos fantasma en la cuadrícula de parches y mezcla entre fotogramas, por lo que no debe reemplazar al VAE H3 original en flujos de trabajo de vídeo.
  • Calidad limitada. Las salidas pueden seguir siendo suaves y perder texto fino, contornos finos, cabello, follaje y microtextura. La imagen de ejemplo anterior muestra el resultado real en lugar de implicar una garantía de calidad: es una ruta de utilidad, no una promesa de fidelidad.

Su propósito es dar al H3 un recorrido de ida y vuelta de una sola imagen viable, algo importante para los flujos de trabajo que quieran inspeccionar o editar una latente de H3 como imagen.

Cómo se entrenó

El codificador original de H3 se congeló mientras se realizaba un ajuste fino del decodificador completo y de post_quant_conv para reconstruir la imagen fuente real directamente desde una latente temporal de H3. El entrenamiento utilizó un currículo progresivo de 256→384 px con 51.083 imágenes únicas (41.259 imágenes de Booru Essence y 9.824 fotografías de pseudo-cámara) con una función objetivo que tiene en cuenta al decodificador y combina pérdidas de reconstrucción de Charbonnier, de bordes, de SSIM y de FDL/FDL-PIPS de bajo peso. El decodificador seleccionado del paso 1597 se fusionó de nuevo en el checkpoint de VAE H3 estándar, por lo que se carga con las herramientas normales de VAE H3.

En un conjunto equilibrado no visto de 512 px (32 fotos y 32 imágenes artísticas), el checkpoint obtuvo 30,44 dB de PSNR, 0,939 de SSIM y 0,0168 de MAE; las comprobaciones de despliegue de ~1 a 3 megapíxeles alcanzaron 31,55–33,43 dB de PSNR.

Uso en ComfyUI

  1. Descargar minimax_h3_t1_image_vae_step1597.safetensors (~5,2 GB) en ComfyUI/models/vae/
  2. Cargarlo con el nodo estándar Cargar VAE y usar los nodos normales de VAE Codificar/Decodificar
  3. El modelo espera el formato de latente de 24 canales de MiniMax H3 y está pensado para recorridos de ida y vuelta de una sola imagen (T=1)

Disponibilidad

El checkpoint está en Hugging Face. Se complementa con el upscaler de latente 2× anterior de Mamad8 para flujos de trabajo en el espacio latente de H3.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 Image VAE: decodificación de imagen desde una latente | ComfyUI Wiki