Ampliador de Latente 2x para MiniMax H3 con Nodos de ComfyUI

ComfyUI Wikinews

Mamad8 publica un ampliador de latente limpio 2x para MiniMax H3 con dos nodos ComfyUI: duplica la resolución espacial antes del decodificado VAE sin salir del espacio latente.

Mamad8 publicó un ampliador de latente 2× para MiniMax H3 el 8 de agosto, junto con un par de nodos ComfyUI minimalistas (tarjeta del modelo, nodos personalizados). El modelo duplica las dimensiones espaciales de un latente de vídeo H3 completamente denoised, de modo que un flujo de trabajo puede permanecer en el espacio latente en lugar de pagar por un viaje de ida y vuelta de decodificación VAE → redimensionado de píxeles → recodificación VAE.

Qué es

Este no es un ampliador de imagen o vídeo convencional. No hace más nítido un render finalizado, y una decodificación directa de su salida puede verse más suave que el original. Su propósito es mover rápidamente un latente de vídeo H3 limpio a una cuadrícula de latente espacial 2× más grande, para que la continuación de alta resolución o un segundo paso de muestreo puedan ejecutarse en un lienzo más grande.

  • Duplica solo las dimensiones espaciales del latente; la longitud temporal no cambia.
  • Cuando se usa a través del nodo complementario, el flujo de audio en el latente conjunto de vídeo/audio de H3 se conserva intacto.
  • Acepta solo latentes limpios: no se admite aplicarlo a latentes con ruido intermedios.

Cómo se entrenó

Los pares de entrenamiento se construyeron a partir de latentes H3 limpios: cada latente de baja resolución se decodificó con el VAE de H3, se amplió 2× en el espacio de píxeles con Lanczos y luego se recodificó de forma determinista para proporcionar el latente teacher. La red ligera aprendió una corrección sobre la interpolación bilineal del latente utilizando pérdidas de reconstrucción conscientes del latente y del decodificador, SSIM, consistencia espacial y consistencia temporal. El generador H3 en sí no fue entrenado ni modificado.

Uso en ComfyUI

  1. Clona ComfyUI-H3-Latent-Upscaler-Mamad8 en ComfyUI/custom_nodes/ y reinicia ComfyUI. No se requieren paquetes de Python adicionales.
  2. Descarga h3_clean_latent_upscaler_v1_mamad8.safetensors (~56 MB) en ComfyUI/models/h3_latent_upscalers/.

El paquete de nodos proporciona dos nodos: Load H3 Latent Upscaler y Upscale Clean H3 Latent 2x. Coloca el nodo de aplicación después de que termine el muestreo y antes de la decodificación VAE normal:

H3 sampler → Upscale Clean H3 Latent 2x → VAE Decode

Por ejemplo, un latente limpio generado para 672×384 se decodifica a 1344×768 después de la ampliación de latente 2×. El número de fotogramas y el audio no cambian. Continuar el denoising de H3 después de la ampliación requiere un flujo de trabajo explícito de reintroducción de ruido y continuación de alta resolución, que se deja intencionalmente fuera de los dos nodos.

El repositorio incluye un flujo de trabajo predeterminado que utiliza nodos de vídeo y VAE del núcleo de ComfyUI sin dependencias adicionales:

Notas de la comunidad

Los miembros de la comunidad de Banodoco comenzaron a probarlo el mismo día. RuneX ejecutó una configuración de dos pasadas: una primera pasada completa de 25 pasos a baja resolución, una ampliación de latente 2× y luego una segunda pasada de 8 pasos, e informó que el audio resultó notablemente más rico (notas de prueba). mamad8 señaló que el lanzamiento se adelanta parcialmente a un ampliador oficial que se espera que el propio MiniMax publique para H3.

Para la ampliación entre muestreadores (reintroducción de ruido + segunda pasada dentro de un mismo flujo de trabajo), el ComfyUI-MiniMaxH3_LatentUpscaler de Tr1dae adopta un enfoque diferente con un control audio_denoise para determinar cuánto audio de la pasada 1 se debe remezclar.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Ampliador de Latente 2x para MiniMax H3 con Nodos de ComfyUI | ComfyUI Wiki