Pesos abiertos de MiniMax H3 con soporte nativo de ComfyUI
Los pesos abiertos de MiniMax H3 ya están en Hugging Face con soporte nativo de ComfyUI. Archivos bf16, INT8, pruned y NVFP4, más seis plantillas oficiales.
La publicación de pesos abiertos de H3 de MiniMax, el modelo de video omni-modal detrás de la línea Hailuo, ya está disponible. Los pesos están publicados en Hugging Face y el soporte nativo de ComfyUI llegó el mismo día: el pull request Comfy-Org/ComfyUI #15224 se fusionó el 3 de agosto, añadiendo generación conjunta de audio y video con cuatro nodos nuevos y seis plantillas de flujo de trabajo oficiales.
H3 se lanzó el 31 de julio (lee la historia del lanzamiento). La publicación de pesos abiertos lleva el transformador de difusión conjunto de audio y video de 33.1B a GPUs locales con múltiples opciones de cuantización.
Imagen de entrada de ejemplo usada en la demo oficial de contexto multimodal de H3 de MiniMax
Video generado por H3 que combina un clip de referencia, una imagen y una pista de audio en un solo prompt (fuente: blog de MiniMax)
Descripción general del sistema
H3 es un sistema de generación omni-modal de propósito general construido con tres módulos:
- H3-Context-IR: un sistema de preprocesamiento y orquestación gestionado que analiza el contexto multimodal (texto, imágenes, video, audio) y lo convierte en una representación intermedia estructurada para la generación. No está incluido en la publicación de código abierto; MiniMax lo ofrece como API y publica una guía de escritura de prompts para construir el propio.
- H3-Base: el transformador omni de 33.1B de pesos abiertos que genera video 768p con audio estéreo nativo.
- H3-Regenerate-2K: regenera la salida de 768p a resolución 2K in-context, reutilizando el contexto multimodal original. Este módulo aún no es de código abierto; una API reproduce el pipeline completo de 2K.
La publicación abierta cubre H3-Base como dos checkpoints específicos de tarea: FL2VA (texto a video, primer fotograma, último fotograma y primer+último fotograma) y Ref2VA (generación basada en referencias a partir de imágenes, video y audio).
Especificaciones de salida
| Elemento | Especificación |
|---|---|
| Duración | 4-15 segundos |
| Relaciones de aspecto | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Resolución | Borde corto 768px por defecto; 2K vía H3-Regenerate-2K |
| Fotogramas por segundo | 24 FPS |
| Audio | Estéreo de 32 kHz, generado en la misma pasada |
| Idiomas | 11 estables (ar, zh, en, fr, de, it, ja, ko, pt, ru, es) |
Modos de entrada
FL2VA acepta 0, 1 o 2 imágenes: sin imagen es texto a video, una imagen es condición de primer o último fotograma, y dos imágenes son condición de primer+último fotograma.
Ref2VA acepta hasta 9 imágenes de referencia, 3 videos de referencia (2-15 s cada uno, 15 s máximo en total) y 3 clips de audio de referencia (2-15 s cada uno, 15 s máximo en total, siempre junto a una imagen o video). La entrada mixta se limita a 12 archivos en total.
Pesos abiertos en Hugging Face
Ya hay dos repositorios disponibles:
- MiniMaxAI/MiniMax-H3 (Hugging Face): la publicación oficial en formato Diffusers, con variantes FL2VA y Ref2VA, el código completo del modelo y las guías de escritura de prompts (base / referencia). Con licencia del Acuerdo de Licencia Comunitaria MiniMax H3.
- Comfy-Org/MiniMax-H3 (Hugging Face): archivos reempaquetados para los nodos nativos de ComfyUI, listos para colocar en
models/diffusion_models,models/text_encodersymodels/vae.
| Componente | Archivos |
|---|---|
| Modelo de difusión | minimax_h3_fl2va_bf16 (61.7 GB), minimax_h3_fl2va_int8_convrot (31.7 GB), minimax_h3_fl2va_pruned_int8_convrot (19.5 GB), más las variantes ref2va_* correspondientes |
| Codificador de texto | qwen3vl_32b_minimax_h3_bf16 (48.0 GB), int8_convrot (25.3 GB), nvfp4_awq (14.6 GB) |
| VAEs | minimax_h3_video_vae_fp16 (4.9 GB), minimax_h3_audio_vae_fp32 (0.6 GB) |
Los checkpoints INT8 pruned son aproximadamente un 40% más pequeños que los archivos INT8 estándar gracias a las tablas de curvas adaLN precalculadas, y el codificador de texto NVFP4 AWQ funciona en cualquier GPU.
Soporte nativo de ComfyUI fusionado
El soporte nativo se fusionó como Comfy-Org/ComfyUI #15224 el 3 de agosto, integrando un transformador de difusión de tokens empaquetados de un solo flujo que denoisa conjuntamente latents de video y audio estéreo, condicionado por los estados ocultos de Qwen3-VL-32B con etiquetas de modalidad por token. Cuatro nodos nuevos manejan el flujo de trabajo: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo y MiniMaxH3SigmaShift.
Los flujos de trabajo oficiales de texto a video e imagen a video están disponibles como descargas:
- video_minimax_h3_t2v.json (texto a video)
- video_minimax_h3_i2v.json (imagen a video)
- video_minimax_h3_r2v.json (referencia a video)
Plantillas de flujo de trabajo oficiales
Seis plantillas oficiales llegaron a través de Comfy-Org/workflow_templates:
| Plantilla | Modo |
|---|---|
| video_minimax_h3_t2v.json | Local: texto a video |
| video_minimax_h3_i2v.json | Local: imagen a video |
| video_minimax_h3_r2v.json | Local: referencia a video |
| api_minimax_h3_t2v.json | API: texto a video |
| api_minimax_h3_r2v.json | API: referencia a video |
| api_minimax_h3_flf2v.json | API: primer/último fotograma a video |
Las guías paso a paso para los flujos de trabajo locales de pesos abiertos están publicadas en la documentación oficial: tutorial de flujo de trabajo de código abierto de MiniMax H3.
Disponibilidad
- Pesos abiertos: Disponibles en Hugging Face (MiniMaxAI/MiniMax-H3) y reempaquetados para ComfyUI en Comfy-Org/MiniMax-H3.
- ComfyUI: Soporte nativo fusionado en Comfy-Org/ComfyUI #15224; actualiza ComfyUI a la última versión para obtener los nuevos nodos.
- Plantillas oficiales: Seis flujos de trabajo en la galería de plantillas integrada de ComfyUI.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.