MiniMax H3 Latent Upscaler 3D: ampliación neuronal con ComfyUI
LBH-123 lanza un upscaler neuronal de latentes 3D para MiniMax H3 con nodos ComfyUI: amplía los latentes de video de 24 canales para acelerar la generación en alta resolución.
Qué es
El modelo trabaja directamente sobre los latentes de la VAE de 24 canales de MiniMax H3 para ampliar la resolución espacial (H × W) mientras preserva la dimensión temporal. Una red neuronal entrenada reemplaza la interpolación latente bilineal/bicúbica ingenua, lo que evita los artefactos de efecto fantasma y de imagen doble que introduce la ampliación ingenua.
Su propósito principal es acelerar la generación de video H3 de alta resolución:
- Genera el video a baja resolución: muchos menos tokens de latente, mucho más rápido.
- Amplía el latente in situ con el ampliador aprendido.
- Remuestrea o refina en la resolución objetivo para recuperar detalle.
Al omitir el lento ciclo de ida y vuelta de decodificación → ampliación de píxeles → codificación a través de la pesada VAE de ~5B parámetros de H3, este pipeline ahorra una cantidad significativa de tiempo de generación. Ten en cuenta que ahorra tiempo, no VRAM: el paso de refinamiento aún se ejecuta en la resolución objetivo, por lo que la memoria máxima es comparable a la de generar directamente en alta resolución.
El paquete de nodos personalizados incluye dos variantes de nodos bajo la categoría video/MinimaxH3:
- Minimax H3 Latent Upscaler (2D): un backbone ResBlock 2D con capas de convolución 3D temporales, ligero y rápido, que utiliza un factor
scalesimple (1.0×–4.0×). - Minimax H3 Latent Upscaler (3D): un backbone de convolución totalmente 3D que procesa el volumen espacio-temporal de manera conjunta para una mayor coherencia temporal, con tres modos de redimensionado en un solo nodo:
scale by multiplier,target dimensionsymegapixels(con alineación de cuadrícula de píxeles y bloqueo de relación de aspecto).
Ambos nodos admiten solo ampliación (effective scale >= 1.0) y ofrecen inferencia fp32 / fp16 / bf16. Las actualizaciones recientes añadieron una opción enable_chunking para videos largos (con fusión de bordes de fragmentos temporales), descarga automática a CPU después de la ejecución y soporte del backend ROCm (GPU AMD).
Ejemplos
El repositorio incluye una comparación de ampliación con un video y una imagen:
Comparación de ampliación de video (haz clic para reproducir)
Comparación de ampliación de imagen
Uso en ComfyUI
- Clona
Comfyui_Minimax_h3_latent_UpscalerenComfyUI/custom_nodes/y reinicia ComfyUI. No se requieren paquetes de Python adicionales. - Descarga uno de los checkpoints (bf16 / fp16, ~691 MB cada uno, o el
.pthfp32) enComfyUI/models/latent_upscale_models/. El cargador detecta automáticamente la arquitectura, por lo que un solo checkpoint funciona tanto para los nodos 2D como para los 3D.
Flujo de trabajo típico: [Low-res H3 Latent] → [H3 Latent Upscaler] → [Refine / Re-sample] → [VAE Decode]. El paquete de nodos incluye flujos de trabajo de ejemplo I2V y R2V:
El ampliador de latente 2x H3 de Mamad8 anterior apunta a latentes limpios posteriores al muestreo; esta versión adopta un enfoque similar de espacio latente con un backbone 3D más pesado que también es compatible con el redimensionado directo por dimensiones objetivo y megapíxeles.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.