MiniMax H3: modelo abierto de generación de video omni-modal

ComfyUI Wiki

MiniMax H3 es un modelo abierto de generación de video omni-modal con audio estéreo nativo de 32 kHz, salida 768p y regeneración 2K in-context. Soporte nativo de ComfyUI.

M

MiniMax H3

Generación de VideoAudio NativoOmni-ModalTexto a VideoImagen a Video

MiniMax H3 es un modelo abierto de generación omni-modal de propósito general que entiende conjuntamente texto, imágenes, video y audio, y genera hasta 15 segundos de video con audio estéreo nativo de 32 kHz en una sola pasada. Es el último modelo de la línea de video Hailuo de MiniMax, impulsado por un transformador omni de flujo único denso de 33.1B con un codificador de texto Qwen3-VL-32B.

DesarrolladorMiniMax
Fecha de lanzamiento2026-08
ArquitecturaTransformador omni denso de flujo único de 33.1B (rama adaLN de 13B)
Codificador de textoQwen3-VL-32B (estados ocultos de la capa 50)
VAE de videoVAE causal temporal, f16t4d24
VAE de audioEstéreo de 32 kHz a tokens latentes de 40 Hz
LicenciaLicencia Comunitaria MiniMax H3

MiniMax H3 genera hasta 15 segundos de video a 24 FPS con audio estéreo nativo de 32 kHz, en cualquiera de 11 idiomas. La salida usa por defecto un borde corto de 768px; el módulo H3-Regenerate-2K vuelve a generar los resultados a resolución 2K in-context. El modelo se publicó oficialmente como código abierto el 3 de agosto de 2026 bajo el Acuerdo de Licencia Comunitaria MiniMax H3, con soporte nativo de ComfyUI fusionado el mismo día (Comfy-Org/ComfyUI #15224).

Checkpoints

CheckpointModos
FL2VATexto a video, primer fotograma, último fotograma, primer+último
Ref2VABasado en referencias: hasta 9 imágenes, 3 videos, 3 clips de audio (12 archivos máx. mixtos)

Recursos

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…