- Inicio
- Tutoriales
- Advanced
- Video
- Minimax
- MiniMax H3 en ComfyUI: Guía completa de generación de vídeo
MiniMax H3 en ComfyUI: Guía completa de generación de vídeo
Domina MiniMax H3 en ComfyUI con los flujos de trabajo oficiales: modos T2V, I2V y R2V, audio estéreo nativo y solución de problemas para vídeo con IA.
Resumen del Tutorial
Este tutorial cubre todo lo que necesitas para ejecutar MiniMax H3 en ComfyUI: instalando los modelos, cargando los flujos de trabajo oficiales, comprendiendo los tres modos de generación (T2V, I2V, R2V), eligiendo la resolución adecuada y solucionando problemas comunes.
Resumen del modelo MiniMax H3
MiniMax H3 es el último modelo de la línea de vídeo Hailuo de MiniMax. Genera hasta 15 segundos de vídeo a 24 FPS con audio estéreo nativo de 32 kHz, en cualquiera de los 11 idiomas y con una resolución de hasta 2K. El modelo está impulsado por un transformer omni denso de flujo único de 33.1B con un codificador de texto Qwen3-VL-32B.
Capacidades principales:
- Audio estéreo nativo: diálogo, efectos de sonido y música generados en la misma pasada que el vídeo, sin necesidad de un modelo de audio independiente.
- Contexto omni-modal: cualquier combinación de texto, imágenes, vídeo y audio como entrada.
- Tres modos de tarea: texto a vídeo (T2V), imagen a vídeo (I2V) y referencia a vídeo (R2V).
- 11 idiomas: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español.
- Pesos abiertos: Licencia comunitaria de MiniMax H3, con inferencia totalmente local.
El lanzamiento abierto cubre H3-Base como dos checkpoints: FL2VA (texto a vídeo y acondicionamiento del primer/último fotograma) y Ref2VA (generación basada en referencias). El sistema de preprocesamiento H3-Context-IR y el módulo de ampliación a 2K H3-Regenerate-2K siguen siendo APIs alojadas.
Primeros Pasos
MiniMax H3 es compatible con ComfyUI con pesos abiertos:
- Actualizar ComfyUI a la última versión (0.30.0 o posterior; soporte nativo fusionado en Comfy-Org/ComfyUI #15224)
- Abre
Flujo de trabajo->Explorar plantillas->Vídeoy elige cualquier flujo de trabajo de MiniMax H3 - Sigue la ventana emergente para descargar los modelos y ejecutar el flujo de trabajo
Los archivos de modelo están alojados en Hugging Face en el repositorio Comfy-Org/MiniMax-H3.
Instalación de Modelos
Descarga los siguientes archivos de Comfy-Org/MiniMax-H3 y colócalos en sus carpetas:
Modelo diffusion (elige una variante):
| Modelo | Tamaño | Notas |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 19.5 GB | RECOMENDADO - INT8 podado, ~40% más pequeño, mejor equilibrio para T2V/I2V |
minimax_h3_fl2va_int8_convrot.safetensors | 31.7 GB | INT8 estándar |
minimax_h3_fl2va_bf16.safetensors | 61.7 GB | Precisión completa |
minimax_h3_ref2va_pruned_int8_convrot.safetensors | 19.5 GB | Usa este para el modo de referencia a vídeo (R2V) |
minimax_h3_ref2va_bf16.safetensors | 61.7 GB | R2V de precisión completa |
Codificador de texto (elige uno):
| Modelo | Tamaño | Notas |
|---|---|---|
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 14.6 GB | RECOMENDADO - NVFP4 AWQ, funciona en cualquier GPU |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 25.3 GB | INT8 convrot |
qwen3vl_32b_minimax_h3_bf16.safetensors | 48.0 GB | Precisión completa |
VAEs (ambos requeridos):
| Modelo | Tamaño |
|---|---|
minimax_h3_video_vae_fp16.safetensors | 4.9 GB |
minimax_h3_audio_vae_fp32.safetensors | 0.6 GB |
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsFlujos de trabajo oficiales
Seis plantillas oficiales están disponibles a través de [Comfy-Org/workflow_templates](https
1. MiniMax H3 Texto a Vídeo (T2V)
Genera vídeos a partir de prompts de texto con audio estéreo nativo.
Descargas de modelos (T2V)
| Componente | Archivo | Destino |
|---|---|---|
| Modelo de difusión | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Codificador de texto | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Almacenamiento de modelos (T2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsConsejos para prompts (T2V)
- Describe la escena completa: indica primero la escena general (ubicación, personaje, qué está sucediendo) y luego divídela en tomas con tiempos definidos
- Tomas, cámara y audio: describe las tomas, los movimientos de cámara y el audio que las acompaña (diálogo, SFX, música) en un solo bloque de prompt
- Duración: la entrada de duración se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) del modelo a 24 FPS
- Primer/último fotograma: conecta imágenes a
first_framey/olast_frameen el nodoMiniMaxH3ImageToVideopara convertir este flujo de trabajo en imagen a vídeo con primer/último fotograma
2. MiniMax H3 Imagen a Vídeo (I2V)
Genera vídeos a partir de una imagen de entrada, con fotogramas clave opcionales para el primer y último fotograma.
Imagen de entrada:
- descarga la imagen de entrada predeterminada o usa la tuya propia.
Descargas de modelos (I2V)
| Componente | Archivo | Destino |
|---|---|---|
| Modelo de difusión | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Codificador de texto | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Almacenamiento de modelos (I2V)
Misma estructura que el flujo de trabajo T2V (modelo de difusión FL2VA + codificador de texto NVFP4 + ambos VAEs).
Consejos para el prompt (I2V)
- Fotogramas clave: las entradas
first_frameylast_frameson opcionales; el modelo genera el movimiento entre ellas - Prompt: describe los planos, el movimiento y el audio que lo acompaña (diálogo, efectos de sonido, música) en un solo bloque
- Duración: se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) a 24 FPS
3. MiniMax H3 Reference-to-Video (R2V)
Generate videos that lock in a character, style, motion, camera move, or voice from any mix of reference images, videos, and audio.
Reference images:
- character reference for the workflow, or use your own
- style and subject reference for the workflow, or use your own
Model downloads (R2V)
| Component | File | Destination |
|---|---|---|
| Diffusion model | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Text encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Model storage (R2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsPrompting tips (R2V)
- Reference by tag: reference each input by tag in the exact order it was connected, for example
<Picture 1>,<Video 1>,<Audio 1> - Assign each reference a job: state which reference drives which part of the shot (identity, style, motion, camera, voice); explicit assignments work much better
- Limits: up to 9 reference images, 3 reference videos (each can carry its own soundtrack), and 3 standalone reference audio clips
- ref_image_size:
matchscales references down to the generation resolution for speed;maxkeeps up to a 2048px short edge for stronger identity fidelity at the cost of speed - Sampler:
res_multistepwith abetaornormalscheduler tends to outperformsimplefor reference-heavy prompts - Note: R2V uses the
ref2vadiffusion model, a different set of weights from thefl2vamodel used by T2V and I2V
Flujos de trabajo de API
Tres plantillas oficiales adicionales llaman a la API de MiniMax en lugar de ejecutarse localmente:
| Plantilla | Modo |
|---|---|
| api_minimax_h3_t2v.json | API: texto a vídeo |
| api_minimax_h3_r2v.json | API: referencia a vídeo |
| api_minimax_h3_flf2v.json | API: primer/último fotograma a vídeo |
Troubleshooting
Q: ComfyUI doesn't show the MiniMax H3 nodes
Update ComfyUI to version 0.30.0 or later. Native support merged in Comfy-Org/ComfyUI #15224 on August 3, 2026. Desktop and Cloud updates follow stable releases, so some nightly-supported features may not be available yet.
Q: Out of memory / high VRAM usage
- Use the pruned INT8 diffusion model (19.5 GB) instead of bf16
- Use the NVFP4 AWQ text encoder (14.6 GB), which runs on any GPU
- Lower the resolution in the Resolution Selector node (lower Megapixels) and shorten the duration
- ComfyUI's dynamic VRAM system and block swap help on machines with ample system RAM
Q: Generation fails at 256p or very small resolutions
H3 has a minimum resolution of 384p. 256p fails completely. Use the resolution presets from the official template.
Q: Output video has no audio
Make sure both VAEs are loaded: minimax_h3_video_vae_fp16.safetensors (video) and minimax_h3_audio_vae_fp32.safetensors (audio), and that the workflow includes a VAEDecodeAudio node connected to SaveVideo.
Q: Which checkpoint should I use for image-to-video?
Use the FL2VA checkpoint for T2V and I2V (first-frame, last-frame, or both). Use the Ref2VA checkpoint when you need full reference-based generation (identity, style, voice).
Q: Where can I report bugs?
- Runtime errors: ComfyUI/issues
- UI issues: ComfyUI_frontend/issues
Comentarios
Inicia sesión con GitHub para unirte a la conversación.