MiniMax H3 Latent Upscaler 3D: ampliación neuronal con ComfyUI

ComfyUI Wikinews

LBH-123 lanza un upscaler neuronal de latentes 3D para MiniMax H3 con nodos ComfyUI: amplía los latentes de video de 24 canales para acelerar la generación en alta resolución.

Minimax H3 Latent Upscaler (Hugging Face | Nodos personalizados) es un ampliador neuronal de espacio latente para la generación de video MiniMax H3 publicado por LBH-123 el 17 de agosto de 2026, con un par de nodos personalizados de ComfyUI. Amplía directamente el latente de la VAE H3 de 24 canales, de modo que la generación de alta resolución puede omitir el costoso ciclo de ida y vuelta de decodificación → ampliación de píxeles → recodificación.

Qué es

El modelo trabaja directamente sobre los latentes de la VAE de 24 canales de MiniMax H3 para ampliar la resolución espacial (H × W) mientras preserva la dimensión temporal. Una red neuronal entrenada reemplaza la interpolación latente bilineal/bicúbica ingenua, lo que evita los artefactos de efecto fantasma y de imagen doble que introduce la ampliación ingenua.

Su propósito principal es acelerar la generación de video H3 de alta resolución:

  1. Genera el video a baja resolución: muchos menos tokens de latente, mucho más rápido.
  2. Amplía el latente in situ con el ampliador aprendido.
  3. Remuestrea o refina en la resolución objetivo para recuperar detalle.

Al omitir el lento ciclo de ida y vuelta de decodificación → ampliación de píxeles → codificación a través de la pesada VAE de ~5B parámetros de H3, este pipeline ahorra una cantidad significativa de tiempo de generación. Ten en cuenta que ahorra tiempo, no VRAM: el paso de refinamiento aún se ejecuta en la resolución objetivo, por lo que la memoria máxima es comparable a la de generar directamente en alta resolución.

El paquete de nodos personalizados incluye dos variantes de nodos bajo la categoría video/MinimaxH3:

  • Minimax H3 Latent Upscaler (2D): un backbone ResBlock 2D con capas de convolución 3D temporales, ligero y rápido, que utiliza un factor scale simple (1.0×–4.0×).
  • Minimax H3 Latent Upscaler (3D): un backbone de convolución totalmente 3D que procesa el volumen espacio-temporal de manera conjunta para una mayor coherencia temporal, con tres modos de redimensionado en un solo nodo: scale by multiplier, target dimensions y megapixels (con alineación de cuadrícula de píxeles y bloqueo de relación de aspecto).

Ambos nodos admiten solo ampliación (effective scale >= 1.0) y ofrecen inferencia fp32 / fp16 / bf16. Las actualizaciones recientes añadieron una opción enable_chunking para videos largos (con fusión de bordes de fragmentos temporales), descarga automática a CPU después de la ejecución y soporte del backend ROCm (GPU AMD).

Ejemplos

El repositorio incluye una comparación de ampliación con un video y una imagen:

Comparación de ampliación de video (haz clic para reproducir)

Comparación de ampliación de imagen

Comparación de ampliación de imagen

Uso en ComfyUI

  1. Clona Comfyui_Minimax_h3_latent_Upscaler en ComfyUI/custom_nodes/ y reinicia ComfyUI. No se requieren paquetes de Python adicionales.
  2. Descarga uno de los checkpoints (bf16 / fp16, ~691 MB cada uno, o el .pth fp32) en ComfyUI/models/latent_upscale_models/. El cargador detecta automáticamente la arquitectura, por lo que un solo checkpoint funciona tanto para los nodos 2D como para los 3D.

Flujo de trabajo típico: [Low-res H3 Latent] → [H3 Latent Upscaler] → [Refine / Re-sample] → [VAE Decode]. El paquete de nodos incluye flujos de trabajo de ejemplo I2V y R2V:

El ampliador de latente 2x H3 de Mamad8 anterior apunta a latentes limpios posteriores al muestreo; esta versión adopta un enfoque similar de espacio latente con un backbone 3D más pesado que también es compatible con el redimensionado directo por dimensiones objetivo y megapíxeles.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 Latent Upscaler 3D: ampliación neuronal con ComfyUI | ComfyUI Wiki