MiniMax H3 en ComfyUI: Guía completa de generación de vídeo

Domina MiniMax H3 en ComfyUI con los flujos de trabajo oficiales: modos T2V, I2V y R2V, audio estéreo nativo y solución de problemas para vídeo con IA.

MiniMax H3 es un modelo de generación omni-modal de propósito general que comprende texto, imágenes, vídeo y audio en conjunto, y genera vídeo con audio estéreo nativo (voz, efectos de sonido y música en una sola pasada). Se liberó como código abierto el 3 de agosto de 2026, con soporte nativo de ComfyUI integrado el mismo día.

Resumen del Tutorial

Este tutorial cubre todo lo que necesitas para ejecutar MiniMax H3 en ComfyUI: instalando los modelos, cargando los flujos de trabajo oficiales, comprendiendo los tres modos de generación (T2V, I2V, R2V), eligiendo la resolución adecuada y solucionando problemas comunes.

Resumen del modelo MiniMax H3

MiniMax H3 es el último modelo de la línea de vídeo Hailuo de MiniMax. Genera hasta 15 segundos de vídeo a 24 FPS con audio estéreo nativo de 32 kHz, en cualquiera de los 11 idiomas y con una resolución de hasta 2K. El modelo está impulsado por un transformer omni denso de flujo único de 33.1B con un codificador de texto Qwen3-VL-32B.

Capacidades principales:

  • Audio estéreo nativo: diálogo, efectos de sonido y música generados en la misma pasada que el vídeo, sin necesidad de un modelo de audio independiente.
  • Contexto omni-modal: cualquier combinación de texto, imágenes, vídeo y audio como entrada.
  • Tres modos de tarea: texto a vídeo (T2V), imagen a vídeo (I2V) y referencia a vídeo (R2V).
  • 11 idiomas: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español.
  • Pesos abiertos: Licencia comunitaria de MiniMax H3, con inferencia totalmente local.

El lanzamiento abierto cubre H3-Base como dos checkpoints: FL2VA (texto a vídeo y acondicionamiento del primer/último fotograma) y Ref2VA (generación basada en referencias). El sistema de preprocesamiento H3-Context-IR y el módulo de ampliación a 2K H3-Regenerate-2K siguen siendo APIs alojadas.

Primeros Pasos

MiniMax H3 es compatible con ComfyUI con pesos abiertos:

  1. Actualizar ComfyUI a la última versión (0.30.0 o posterior; soporte nativo fusionado en Comfy-Org/ComfyUI #15224)
  2. Abre Flujo de trabajo -> Explorar plantillas -> Vídeo y elige cualquier flujo de trabajo de MiniMax H3
  3. Sigue la ventana emergente para descargar los modelos y ejecutar el flujo de trabajo

Los archivos de modelo están alojados en Hugging Face en el repositorio Comfy-Org/MiniMax-H3.

Instalación de Modelos

Descarga los siguientes archivos de Comfy-Org/MiniMax-H3 y colócalos en sus carpetas:

Modelo diffusion (elige una variante):

ModeloTamañoNotas
minimax_h3_fl2va_pruned_int8_convrot.safetensors19.5 GBRECOMENDADO - INT8 podado, ~40% más pequeño, mejor equilibrio para T2V/I2V
minimax_h3_fl2va_int8_convrot.safetensors31.7 GBINT8 estándar
minimax_h3_fl2va_bf16.safetensors61.7 GBPrecisión completa
minimax_h3_ref2va_pruned_int8_convrot.safetensors19.5 GBUsa este para el modo de referencia a vídeo (R2V)
minimax_h3_ref2va_bf16.safetensors61.7 GBR2V de precisión completa

Codificador de texto (elige uno):

ModeloTamañoNotas
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors14.6 GBRECOMENDADO - NVFP4 AWQ, funciona en cualquier GPU
qwen3vl_32b_minimax_h3_int8_convrot.safetensors25.3 GBINT8 convrot
qwen3vl_32b_minimax_h3_bf16.safetensors48.0 GBPrecisión completa

VAEs (ambos requeridos):

ModeloTamaño
minimax_h3_video_vae_fp16.safetensors4.9 GB
minimax_h3_audio_vae_fp32.safetensors0.6 GB
📂 ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Flujos de trabajo oficiales

Seis plantillas oficiales están disponibles a través de [Comfy-Org/workflow_templates](https

1. MiniMax H3 Texto a Vídeo (T2V)

Genera vídeos a partir de prompts de texto con audio estéreo nativo.

Descargas de modelos (T2V)

ComponenteArchivoDestino
Modelo de difusiónminimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Codificador de textoqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Almacenamiento de modelos (T2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Consejos para prompts (T2V)

  • Describe la escena completa: indica primero la escena general (ubicación, personaje, qué está sucediendo) y luego divídela en tomas con tiempos definidos
  • Tomas, cámara y audio: describe las tomas, los movimientos de cámara y el audio que las acompaña (diálogo, SFX, música) en un solo bloque de prompt
  • Duración: la entrada de duración se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) del modelo a 24 FPS
  • Primer/último fotograma: conecta imágenes a first_frame y/o last_frame en el nodo MiniMaxH3ImageToVideo para convertir este flujo de trabajo en imagen a vídeo con primer/último fotograma

2. MiniMax H3 Imagen a Vídeo (I2V)

Genera vídeos a partir de una imagen de entrada, con fotogramas clave opcionales para el primer y último fotograma.

Imagen de entrada: Input Image - descarga la imagen de entrada predeterminada o usa la tuya propia.

Descargas de modelos (I2V)

ComponenteArchivoDestino
Modelo de difusiónminimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Codificador de textoqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Almacenamiento de modelos (I2V)

Misma estructura que el flujo de trabajo T2V (modelo de difusión FL2VA + codificador de texto NVFP4 + ambos VAEs).

Consejos para el prompt (I2V)

  • Fotogramas clave: las entradas first_frame y last_frame son opcionales; el modelo genera el movimiento entre ellas
  • Prompt: describe los planos, el movimiento y el audio que lo acompaña (diálogo, efectos de sonido, música) en un solo bloque
  • Duración: se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) a 24 FPS

3. MiniMax H3 Reference-to-Video (R2V)

Generate videos that lock in a character, style, motion, camera move, or voice from any mix of reference images, videos, and audio.

Reference images:

  • Reference Image - character reference for the workflow, or use your own
  • Reference Image - style and subject reference for the workflow, or use your own

Model downloads (R2V)

ComponentFileDestination
Diffusion modelminimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Text encoderqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Model storage (R2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Prompting tips (R2V)

  • Reference by tag: reference each input by tag in the exact order it was connected, for example <Picture 1>, <Video 1>, <Audio 1>
  • Assign each reference a job: state which reference drives which part of the shot (identity, style, motion, camera, voice); explicit assignments work much better
  • Limits: up to 9 reference images, 3 reference videos (each can carry its own soundtrack), and 3 standalone reference audio clips
  • ref_image_size: match scales references down to the generation resolution for speed; max keeps up to a 2048px short edge for stronger identity fidelity at the cost of speed
  • Sampler: res_multistep with a beta or normal scheduler tends to outperform simple for reference-heavy prompts
  • Note: R2V uses the ref2va diffusion model, a different set of weights from the fl2va model used by T2V and I2V

Flujos de trabajo de API

Tres plantillas oficiales adicionales llaman a la API de MiniMax en lugar de ejecutarse localmente:

PlantillaModo
api_minimax_h3_t2v.jsonAPI: texto a vídeo
api_minimax_h3_r2v.jsonAPI: referencia a vídeo
api_minimax_h3_flf2v.jsonAPI: primer/último fotograma a vídeo

Troubleshooting

Q: ComfyUI doesn't show the MiniMax H3 nodes

Update ComfyUI to version 0.30.0 or later. Native support merged in Comfy-Org/ComfyUI #15224 on August 3, 2026. Desktop and Cloud updates follow stable releases, so some nightly-supported features may not be available yet.

Q: Out of memory / high VRAM usage

  • Use the pruned INT8 diffusion model (19.5 GB) instead of bf16
  • Use the NVFP4 AWQ text encoder (14.6 GB), which runs on any GPU
  • Lower the resolution in the Resolution Selector node (lower Megapixels) and shorten the duration
  • ComfyUI's dynamic VRAM system and block swap help on machines with ample system RAM

Q: Generation fails at 256p or very small resolutions

H3 has a minimum resolution of 384p. 256p fails completely. Use the resolution presets from the official template.

Q: Output video has no audio

Make sure both VAEs are loaded: minimax_h3_video_vae_fp16.safetensors (video) and minimax_h3_audio_vae_fp32.safetensors (audio), and that the workflow includes a VAEDecodeAudio node connected to SaveVideo.

Q: Which checkpoint should I use for image-to-video?

Use the FL2VA checkpoint for T2V and I2V (first-frame, last-frame, or both). Use the Ref2VA checkpoint when you need full reference-based generation (identity, style, voice).

Q: Where can I report bugs?

Recursos Relacionados

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…