- Inicio
- Tutoriales
- Advanced
- Video
- Minimax
- MiniMax H3 en ComfyUI: Guía completa de generación de vídeo
MiniMax H3 en ComfyUI: Guía completa de generación de vídeo
Descarga y ejecuta MiniMax H3 en ComfyUI: flujos T2V, I2V y R2V, archivos de modelo y VAE, opciones GGUF/INT8/NVFP4, consejos de rendimiento y solución de problemas.
Resumen del Tutorial
Este tutorial cubre todo lo que necesitas para ejecutar MiniMax H3 en ComfyUI: instalando los modelos, cargando los flujos de trabajo oficiales, comprendiendo los tres modos de generación (T2V, I2V, R2V), eligiendo la resolución adecuada y solucionando problemas comunes.
Resumen del modelo MiniMax H3
MiniMax H3 es el último modelo de la línea de vídeo Hailuo de MiniMax. Genera hasta 15 segundos de vídeo a 24 FPS con audio estéreo nativo de 32 kHz, en cualquiera de los 11 idiomas y con una resolución de hasta 2K. El modelo está impulsado por un transformer omni denso de flujo único de 33.1B con un codificador de texto Qwen3-VL-32B.
Capacidades principales:
- Audio estéreo nativo: diálogo, efectos de sonido y música generados en la misma pasada que el vídeo, sin necesidad de un modelo de audio independiente.
- Contexto omni-modal: cualquier combinación de texto, imágenes, vídeo y audio como entrada.
- Tres modos de tarea: texto a vídeo (T2V), imagen a vídeo (I2V) y referencia a vídeo (R2V).
- 11 idiomas: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español.
- Pesos abiertos: Licencia comunitaria de MiniMax H3, con inferencia totalmente local.
El lanzamiento abierto cubre H3-Base como dos checkpoints: FL2VA (texto a vídeo y acondicionamiento del primer/último fotograma) y Ref2VA (generación basada en referencias). El sistema de preprocesamiento H3-Context-IR y el módulo de ampliación a 2K H3-Regenerate-2K siguen siendo APIs alojadas.
Primeros Pasos
MiniMax H3 es compatible con ComfyUI con pesos abiertos:
- Actualizar ComfyUI a la última versión (0.30.0 o posterior; soporte nativo fusionado en Comfy-Org/ComfyUI #15224)
- Abre
Flujo de trabajo->Explorar plantillas->Vídeoy elige cualquier flujo de trabajo de MiniMax H3 - Sigue la ventana emergente para descargar los modelos y ejecutar el flujo de trabajo
Los archivos de modelo están alojados en Hugging Face en el repositorio Comfy-Org/MiniMax-H3.
Instalación de Modelos
Descarga los siguientes archivos de Comfy-Org/MiniMax-H3 y colócalos en sus carpetas:
Modelo diffusion (elige una variante):
| Modelo | Tamaño | Notas |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 19.5 GB | RECOMENDADO - INT8 podado, ~40% más pequeño, mejor equilibrio para T2V/I2V |
minimax_h3_fl2va_int8_convrot.safetensors | 31.7 GB | INT8 estándar |
minimax_h3_fl2va_bf16.safetensors | 61.7 GB | Precisión completa |
minimax_h3_ref2va_pruned_int8_convrot.safetensors | 19.5 GB | Usa este para el modo de referencia a vídeo (R2V) |
minimax_h3_ref2va_bf16.safetensors | 61.7 GB | R2V de precisión completa |
Codificador de texto (elige uno):
| Modelo | Tamaño | Notas |
|---|---|---|
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 14.6 GB | RECOMENDADO - NVFP4 AWQ, funciona en cualquier GPU |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 25.3 GB | INT8 convrot |
qwen3vl_32b_minimax_h3_bf16.safetensors | 48.0 GB | Precisión completa |
VAEs (ambos requeridos):
| Modelo | Tamaño |
|---|---|
minimax_h3_video_vae_fp16.safetensors | 4.9 GB |
minimax_h3_audio_vae_fp32.safetensors | 0.6 GB |
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsFlujos de trabajo oficiales
Seis plantillas oficiales están disponibles a través de [Comfy-Org/workflow_templates](https
1. MiniMax H3 Texto a Vídeo (T2V)
Genera vídeos a partir de prompts de texto con audio estéreo nativo.
Descargas de modelos (T2V)
| Componente | Archivo | Destino |
|---|---|---|
| Modelo de difusión | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Codificador de texto | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Almacenamiento de modelos (T2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsConsejos para prompts (T2V)
- Describe la escena completa: indica primero la escena general (ubicación, personaje, qué está sucediendo) y luego divídela en tomas con tiempos definidos
- Tomas, cámara y audio: describe las tomas, los movimientos de cámara y el audio que las acompaña (diálogo, SFX, música) en un solo bloque de prompt
- Duración: la entrada de duración se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) del modelo a 24 FPS
- Primer/último fotograma: conecta imágenes a
first_framey/olast_frameen el nodoMiniMaxH3ImageToVideopara convertir este flujo de trabajo en imagen a vídeo con primer/último fotograma
2. MiniMax H3 Imagen a Vídeo (I2V)
Genera vídeos a partir de una imagen de entrada, con fotogramas clave opcionales para el primer y último fotograma.
Imagen de entrada:
- descarga la imagen de entrada predeterminada o usa la tuya propia.
Descargas de modelos (I2V)
| Componente | Archivo | Destino |
|---|---|---|
| Modelo de difusión | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Codificador de texto | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Almacenamiento de modelos (I2V)
Misma estructura que el flujo de trabajo T2V (modelo de difusión FL2VA + codificador de texto NVFP4 + ambos VAEs).
Consejos para el prompt (I2V)
- Fotogramas clave: las entradas
first_frameylast_frameson opcionales; el modelo genera el movimiento entre ellas - Prompt: describe los planos, el movimiento y el audio que lo acompaña (diálogo, efectos de sonido, música) en un solo bloque
- Duración: se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) a 24 FPS
3. MiniMax H3 Reference-to-Video (R2V)
Generate videos that lock in a character, style, motion, camera move, or voice from any mix of reference images, videos, and audio.
Reference images:
- character reference for the workflow, or use your own
- style and subject reference for the workflow, or use your own
Model downloads (R2V)
| Component | File | Destination |
|---|---|---|
| Diffusion model | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Text encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Model storage (R2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsPrompting tips (R2V)
- Reference by tag: reference each input by tag in the exact order it was connected, for example
<Picture 1>,<Video 1>,<Audio 1> - Assign each reference a job: state which reference drives which part of the shot (identity, style, motion, camera, voice); explicit assignments work much better
- Limits: up to 9 reference images, 3 reference videos (each can carry its own soundtrack), and 3 standalone reference audio clips
- ref_image_size:
matchscales references down to the generation resolution for speed;maxkeeps up to a 2048px short edge for stronger identity fidelity at the cost of speed - Sampler:
res_multistepwith abetaornormalscheduler tends to outperformsimplefor reference-heavy prompts - Note: R2V uses the
ref2vadiffusion model, a different set of weights from thefl2vamodel used by T2V and I2V
Flujos de trabajo de API
Tres plantillas oficiales adicionales llaman a la API de MiniMax en lugar de ejecutarse localmente:
| Plantilla | Modo |
|---|---|
| api_minimax_h3_t2v.json | API: texto a vídeo |
| api_minimax_h3_r2v.json | API: referencia a vídeo |
| api_minimax_h3_flf2v.json | API: primer/último fotograma a vídeo |
Troubleshooting
ComfyUI-MiniMaxH3-Cache. Este nodo personalizado aplica un monkey-patch global al código del modelo MiniMax H3, lo que puede romper la generación de H3 (o el propio ComfyUI) tras las actualizaciones, incluso si nunca se usa. Ver lihaoyun6/ComfyUI-MiniMaxH3-Cache#4. Si ya lo tienes instalado, elimínalo de custom_nodes/ y reinicia ComfyUI.
Q: ComfyUI doesn't show the MiniMax H3 nodes
Update ComfyUI to version 0.30.0 or later. Native support merged in Comfy-Org/ComfyUI #15224 on August 3, 2026. Desktop and Cloud updates follow stable releases, so some nightly-supported features may not be available yet.
Q: Out of memory / high VRAM usage
- Use the pruned INT8 diffusion model (19.5 GB) instead of bf16
- Use the NVFP4 AWQ text encoder (14.6 GB), which runs on any GPU
- Lower the resolution in the Resolution Selector node (lower Megapixels) and shorten the duration
- ComfyUI's dynamic VRAM system and block swap help on machines with ample system RAM
Q: Generation fails at 256p or very small resolutions
H3 has a minimum resolution of 384p. 256p fails completely. Use the resolution presets from the official template.
Q: Output video has no audio
Make sure both VAEs are loaded: minimax_h3_video_vae_fp16.safetensors (video) and minimax_h3_audio_vae_fp32.safetensors (audio), and that the workflow includes a VAEDecodeAudio node connected to SaveVideo.
Q: Which checkpoint should I use for image-to-video?
Use the FL2VA checkpoint for T2V and I2V (first-frame, last-frame, or both). Use the Ref2VA checkpoint when you need full reference-based generation (identity, style, voice).
Q: Where can I report bugs?
- Runtime errors: ComfyUI/issues
- UI issues: ComfyUI_frontend/issues
Consejos de rendimiento de MiniMax H3
Ajustes probados por la comunidad para generar más rápido con los flujos de trabajo oficiales:
- Muestreador y programador:
res_multistepcon el programadorsimplea 20 pasos es la línea base más usada para T2V e I2V. Reducir los pasos ahorra tiempo, pero la calidad baja notablemente por debajo de unos 15 pasos. Subir a 25 pasos da un contenido de imagen y un movimiento ligeramente mejores, a costa de un tiempo de generación más largo. - Atención Sage: inicia ComfyUI con
--use-sage-attention(integrado, no se necesitan nodos personalizados). La comunidad informa de una generación hasta unas 2 veces más rápida en GPU de gama media, con rendimientos decrecientes al subir la resolución; los resultados varían según la GPU. - Resolución: mantén el selector de resolución cerca de 0.4 MP (por ejemplo, 768x512) para borradores rápidos. H3 funciona en su mínimo de 384p, mucho menos de lo que exigían los modelos de vídeo anteriores.
- Memoria fijada: en ComfyUI 0.30.x una regresión de memoria fijada puede hacer la carga del modelo muy lenta. Se ha informado que iniciar con
--disable-pinned-memoryrestaura la carga rápida y reduce significativamente el tiempo de generación en algunas configuraciones.
Modelos cuantizados de MiniMax H3 de la comunidad
Versiones cuantizadas por la comunidad de los checkpoints de difusión de MiniMax H3, cargables en ComfyUI estándar. Son conversiones de terceros, no lanzamientos oficiales de MiniMax ni Comfy-Org; consulta el README de cada repositorio para conocer la licencia y la calidad.
INT8
| Modelo | Notas |
|---|---|
| DmitryDB/MiniMax-H3-INT8-Lean-ConvRot | INT8 Lean ConvRot orientado a calidad, FL2VA y Ref2VA de unos 20.9 GiB cada uno, diseñado como primera opción para GPU de 24 GB |
| Gluttony10/MiniMax-H3-INT8-CONVROT | FL2VA y Ref2VA en INT8 convrot, con VAE de audio/vídeo y codificador de texto Qwen3-VL INT8 |
INT4
| Modelo | Notas |
|---|---|
| Merserk/MiniMax-H3-INT4-ConvRot | FL2VA y Ref2VA podados de 11.3 GB cada uno más un codificador de texto INT4, orientado a GPU de 12 GB |
| tsolful/Minimax_H3_INT4MixedConvRot | FL2VA INT4 de precisión mixta, con variantes equilibrada (INT4BQ) y de calidad (INT4Q) |
NVFP4
| Modelo | Notas |
|---|---|
| rockerBOO/minimax-h3-nvfp4 | Variantes NVFP4 e INT4 convrot podadas de FL2VA |
| lilcheaty/MiniMax-H3-NVFP4 | Variantes NVFP4 de FL2VA y Ref2VA, incluidos checkpoints de precisión mixta |
| ModelsLab/MiniMax-H3-ref2va-NVFP4 | Checkpoint Ref2VA NVFP4 para el flujo de trabajo de referencias |
FP8
| Modelo | Notas |
|---|---|
| rzgar/minimax_h3_fl2va_fp8_e4m3fn | FL2VA FP8 E4M3FN; el autor informa de un punto óptimo en 8 pasos con dpmpp_2m / sgm_uniform |
Comentarios
Inicia sesión con GitHub para unirte a la conversación.