MiniMax H3 en ComfyUI: Guía completa de generación de vídeo

Descarga y ejecuta MiniMax H3 en ComfyUI: flujos T2V, I2V y R2V, archivos de modelo y VAE, opciones GGUF/INT8/NVFP4, consejos de rendimiento y solución de problemas.

MiniMax H3 es un modelo de generación omni-modal de propósito general que comprende texto, imágenes, vídeo y audio en conjunto, y genera vídeo con audio estéreo nativo (voz, efectos de sonido y música en una sola pasada). Se liberó como código abierto el 3 de agosto de 2026, con soporte nativo de ComfyUI integrado el mismo día.

Resumen del Tutorial

Este tutorial cubre todo lo que necesitas para ejecutar MiniMax H3 en ComfyUI: instalando los modelos, cargando los flujos de trabajo oficiales, comprendiendo los tres modos de generación (T2V, I2V, R2V), eligiendo la resolución adecuada y solucionando problemas comunes.

Resumen del modelo MiniMax H3

MiniMax H3 es el último modelo de la línea de vídeo Hailuo de MiniMax. Genera hasta 15 segundos de vídeo a 24 FPS con audio estéreo nativo de 32 kHz, en cualquiera de los 11 idiomas y con una resolución de hasta 2K. El modelo está impulsado por un transformer omni denso de flujo único de 33.1B con un codificador de texto Qwen3-VL-32B.

Capacidades principales:

  • Audio estéreo nativo: diálogo, efectos de sonido y música generados en la misma pasada que el vídeo, sin necesidad de un modelo de audio independiente.
  • Contexto omni-modal: cualquier combinación de texto, imágenes, vídeo y audio como entrada.
  • Tres modos de tarea: texto a vídeo (T2V), imagen a vídeo (I2V) y referencia a vídeo (R2V).
  • 11 idiomas: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español.
  • Pesos abiertos: Licencia comunitaria de MiniMax H3, con inferencia totalmente local.

El lanzamiento abierto cubre H3-Base como dos checkpoints: FL2VA (texto a vídeo y acondicionamiento del primer/último fotograma) y Ref2VA (generación basada en referencias). El sistema de preprocesamiento H3-Context-IR y el módulo de ampliación a 2K H3-Regenerate-2K siguen siendo APIs alojadas.

Primeros Pasos

MiniMax H3 es compatible con ComfyUI con pesos abiertos:

  1. Actualizar ComfyUI a la última versión (0.30.0 o posterior; soporte nativo fusionado en Comfy-Org/ComfyUI #15224)
  2. Abre Flujo de trabajo -> Explorar plantillas -> Vídeo y elige cualquier flujo de trabajo de MiniMax H3
  3. Sigue la ventana emergente para descargar los modelos y ejecutar el flujo de trabajo

Los archivos de modelo están alojados en Hugging Face en el repositorio Comfy-Org/MiniMax-H3.

Instalación de Modelos

Descarga los siguientes archivos de Comfy-Org/MiniMax-H3 y colócalos en sus carpetas:

Modelo diffusion (elige una variante):

ModeloTamañoNotas
minimax_h3_fl2va_pruned_int8_convrot.safetensors19.5 GBRECOMENDADO - INT8 podado, ~40% más pequeño, mejor equilibrio para T2V/I2V
minimax_h3_fl2va_int8_convrot.safetensors31.7 GBINT8 estándar
minimax_h3_fl2va_bf16.safetensors61.7 GBPrecisión completa
minimax_h3_ref2va_pruned_int8_convrot.safetensors19.5 GBUsa este para el modo de referencia a vídeo (R2V)
minimax_h3_ref2va_bf16.safetensors61.7 GBR2V de precisión completa

Codificador de texto (elige uno):

ModeloTamañoNotas
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors14.6 GBRECOMENDADO - NVFP4 AWQ, funciona en cualquier GPU
qwen3vl_32b_minimax_h3_int8_convrot.safetensors25.3 GBINT8 convrot
qwen3vl_32b_minimax_h3_bf16.safetensors48.0 GBPrecisión completa

VAEs (ambos requeridos):

ModeloTamaño
minimax_h3_video_vae_fp16.safetensors4.9 GB
minimax_h3_audio_vae_fp32.safetensors0.6 GB
📂 ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Flujos de trabajo oficiales

Seis plantillas oficiales están disponibles a través de [Comfy-Org/workflow_templates](https

1. MiniMax H3 Texto a Vídeo (T2V)

Genera vídeos a partir de prompts de texto con audio estéreo nativo.

Descargas de modelos (T2V)

ComponenteArchivoDestino
Modelo de difusiónminimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Codificador de textoqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Almacenamiento de modelos (T2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Consejos para prompts (T2V)

  • Describe la escena completa: indica primero la escena general (ubicación, personaje, qué está sucediendo) y luego divídela en tomas con tiempos definidos
  • Tomas, cámara y audio: describe las tomas, los movimientos de cámara y el audio que las acompaña (diálogo, SFX, música) en un solo bloque de prompt
  • Duración: la entrada de duración se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) del modelo a 24 FPS
  • Primer/último fotograma: conecta imágenes a first_frame y/o last_frame en el nodo MiniMaxH3ImageToVideo para convertir este flujo de trabajo en imagen a vídeo con primer/último fotograma

2. MiniMax H3 Imagen a Vídeo (I2V)

Genera vídeos a partir de una imagen de entrada, con fotogramas clave opcionales para el primer y último fotograma.

Imagen de entrada: Input Image - descarga la imagen de entrada predeterminada o usa la tuya propia.

Descargas de modelos (I2V)

ComponenteArchivoDestino
Modelo de difusiónminimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Codificador de textoqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Almacenamiento de modelos (I2V)

Misma estructura que el flujo de trabajo T2V (modelo de difusión FL2VA + codificador de texto NVFP4 + ambos VAEs).

Consejos para el prompt (I2V)

  • Fotogramas clave: las entradas first_frame y last_frame son opcionales; el modelo genera el movimiento entre ellas
  • Prompt: describe los planos, el movimiento y el audio que lo acompaña (diálogo, efectos de sonido, música) en un solo bloque
  • Duración: se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) a 24 FPS

3. MiniMax H3 Reference-to-Video (R2V)

Generate videos that lock in a character, style, motion, camera move, or voice from any mix of reference images, videos, and audio.

Reference images:

  • Reference Image - character reference for the workflow, or use your own
  • Reference Image - style and subject reference for the workflow, or use your own

Model downloads (R2V)

ComponentFileDestination
Diffusion modelminimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Text encoderqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Model storage (R2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Prompting tips (R2V)

  • Reference by tag: reference each input by tag in the exact order it was connected, for example <Picture 1>, <Video 1>, <Audio 1>
  • Assign each reference a job: state which reference drives which part of the shot (identity, style, motion, camera, voice); explicit assignments work much better
  • Limits: up to 9 reference images, 3 reference videos (each can carry its own soundtrack), and 3 standalone reference audio clips
  • ref_image_size: match scales references down to the generation resolution for speed; max keeps up to a 2048px short edge for stronger identity fidelity at the cost of speed
  • Sampler: res_multistep with a beta or normal scheduler tends to outperform simple for reference-heavy prompts
  • Note: R2V uses the ref2va diffusion model, a different set of weights from the fl2va model used by T2V and I2V

Flujos de trabajo de API

Tres plantillas oficiales adicionales llaman a la API de MiniMax en lugar de ejecutarse localmente:

PlantillaModo
api_minimax_h3_t2v.jsonAPI: texto a vídeo
api_minimax_h3_r2v.jsonAPI: referencia a vídeo
api_minimax_h3_flf2v.jsonAPI: primer/último fotograma a vídeo

Troubleshooting

No instales ComfyUI-MiniMaxH3-Cache. Este nodo personalizado aplica un monkey-patch global al código del modelo MiniMax H3, lo que puede romper la generación de H3 (o el propio ComfyUI) tras las actualizaciones, incluso si nunca se usa. Ver lihaoyun6/ComfyUI-MiniMaxH3-Cache#4. Si ya lo tienes instalado, elimínalo de custom_nodes/ y reinicia ComfyUI.

Q: ComfyUI doesn't show the MiniMax H3 nodes

Update ComfyUI to version 0.30.0 or later. Native support merged in Comfy-Org/ComfyUI #15224 on August 3, 2026. Desktop and Cloud updates follow stable releases, so some nightly-supported features may not be available yet.

Q: Out of memory / high VRAM usage

  • Use the pruned INT8 diffusion model (19.5 GB) instead of bf16
  • Use the NVFP4 AWQ text encoder (14.6 GB), which runs on any GPU
  • Lower the resolution in the Resolution Selector node (lower Megapixels) and shorten the duration
  • ComfyUI's dynamic VRAM system and block swap help on machines with ample system RAM

Q: Generation fails at 256p or very small resolutions

H3 has a minimum resolution of 384p. 256p fails completely. Use the resolution presets from the official template.

Q: Output video has no audio

Make sure both VAEs are loaded: minimax_h3_video_vae_fp16.safetensors (video) and minimax_h3_audio_vae_fp32.safetensors (audio), and that the workflow includes a VAEDecodeAudio node connected to SaveVideo.

Q: Which checkpoint should I use for image-to-video?

Use the FL2VA checkpoint for T2V and I2V (first-frame, last-frame, or both). Use the Ref2VA checkpoint when you need full reference-based generation (identity, style, voice).

Q: Where can I report bugs?

Consejos de rendimiento de MiniMax H3

Ajustes probados por la comunidad para generar más rápido con los flujos de trabajo oficiales:

  • Muestreador y programador: res_multistep con el programador simple a 20 pasos es la línea base más usada para T2V e I2V. Reducir los pasos ahorra tiempo, pero la calidad baja notablemente por debajo de unos 15 pasos. Subir a 25 pasos da un contenido de imagen y un movimiento ligeramente mejores, a costa de un tiempo de generación más largo.
  • Atención Sage: inicia ComfyUI con --use-sage-attention (integrado, no se necesitan nodos personalizados). La comunidad informa de una generación hasta unas 2 veces más rápida en GPU de gama media, con rendimientos decrecientes al subir la resolución; los resultados varían según la GPU.
  • Resolución: mantén el selector de resolución cerca de 0.4 MP (por ejemplo, 768x512) para borradores rápidos. H3 funciona en su mínimo de 384p, mucho menos de lo que exigían los modelos de vídeo anteriores.
  • Memoria fijada: en ComfyUI 0.30.x una regresión de memoria fijada puede hacer la carga del modelo muy lenta. Se ha informado que iniciar con --disable-pinned-memory restaura la carga rápida y reduce significativamente el tiempo de generación en algunas configuraciones.

Modelos cuantizados de MiniMax H3 de la comunidad

Versiones cuantizadas por la comunidad de los checkpoints de difusión de MiniMax H3, cargables en ComfyUI estándar. Son conversiones de terceros, no lanzamientos oficiales de MiniMax ni Comfy-Org; consulta el README de cada repositorio para conocer la licencia y la calidad.

INT8

ModeloNotas
DmitryDB/MiniMax-H3-INT8-Lean-ConvRotINT8 Lean ConvRot orientado a calidad, FL2VA y Ref2VA de unos 20.9 GiB cada uno, diseñado como primera opción para GPU de 24 GB
Gluttony10/MiniMax-H3-INT8-CONVROTFL2VA y Ref2VA en INT8 convrot, con VAE de audio/vídeo y codificador de texto Qwen3-VL INT8

INT4

ModeloNotas
Merserk/MiniMax-H3-INT4-ConvRotFL2VA y Ref2VA podados de 11.3 GB cada uno más un codificador de texto INT4, orientado a GPU de 12 GB
tsolful/Minimax_H3_INT4MixedConvRotFL2VA INT4 de precisión mixta, con variantes equilibrada (INT4BQ) y de calidad (INT4Q)

NVFP4

ModeloNotas
rockerBOO/minimax-h3-nvfp4Variantes NVFP4 e INT4 convrot podadas de FL2VA
lilcheaty/MiniMax-H3-NVFP4Variantes NVFP4 de FL2VA y Ref2VA, incluidos checkpoints de precisión mixta
ModelsLab/MiniMax-H3-ref2va-NVFP4Checkpoint Ref2VA NVFP4 para el flujo de trabajo de referencias

FP8

ModeloNotas
rzgar/minimax_h3_fl2va_fp8_e4m3fnFL2VA FP8 E4M3FN; el autor informa de un punto óptimo en 8 pasos con dpmpp_2m / sgm_uniform

Recursos Relacionados

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…