MiniMax H3: modelo abierto de generación de video omni-modal
MiniMax H3 es un modelo abierto de generación de video omni-modal con audio estéreo nativo de 32 kHz, salida 768p y regeneración 2K in-context. Soporte nativo de ComfyUI.
MiniMax H3
Generación de VideoAudio NativoOmni-ModalTexto a VideoImagen a VideoMiniMax H3 es un modelo abierto de generación omni-modal de propósito general que entiende conjuntamente texto, imágenes, video y audio, y genera hasta 15 segundos de video con audio estéreo nativo de 32 kHz en una sola pasada. Es el último modelo de la línea de video Hailuo de MiniMax, impulsado por un transformador omni de flujo único denso de 33.1B con un codificador de texto Qwen3-VL-32B.
| Desarrollador | MiniMax |
| Fecha de lanzamiento | 2026-08 |
| Arquitectura | Transformador omni denso de flujo único de 33.1B (rama adaLN de 13B) |
| Codificador de texto | Qwen3-VL-32B (estados ocultos de la capa 50) |
| VAE de video | VAE causal temporal, f16t4d24 |
| VAE de audio | Estéreo de 32 kHz a tokens latentes de 40 Hz |
| Licencia | Licencia Comunitaria MiniMax H3 |
MiniMax H3 genera hasta 15 segundos de video a 24 FPS con audio estéreo nativo de 32 kHz, en cualquiera de 11 idiomas. La salida usa por defecto un borde corto de 768px; el módulo H3-Regenerate-2K vuelve a generar los resultados a resolución 2K in-context. El modelo se publicó oficialmente como código abierto el 3 de agosto de 2026 bajo el Acuerdo de Licencia Comunitaria MiniMax H3, con soporte nativo de ComfyUI fusionado el mismo día (Comfy-Org/ComfyUI #15224).
Checkpoints
| Checkpoint | Modos |
|---|---|
| FL2VA | Texto a video, primer fotograma, último fotograma, primer+último |
| Ref2VA | Basado en referencias: hasta 9 imágenes, 3 videos, 3 clips de audio (12 archivos máx. mixtos) |
Recursos
Guides and workflows related to this model series.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.