MiniMax H3 : modèle ouvert de génération vidéo omni-modal
MiniMax H3 est un modèle ouvert de génération vidéo omni-modal avec audio stéréo natif 32 kHz, sortie 768p et régénération 2K in-context. Support natif de ComfyUI.
MiniMax H3
Génération VidéoAudio NatifOmni-ModalTexte vers VidéoImage vers VidéoMiniMax H3 est un modèle ouvert de génération omni-modal à usage général qui comprend conjointement le texte, les images, la vidéo et l'audio, et génère jusqu'à 15 secondes de vidéo avec audio stéréo natif 32 kHz en une seule passe. C'est le dernier modèle de la gamme vidéo Hailuo de MiniMax, propulsé par un transformateur omni dense à flux unique de 33.1B avec un encodeur de texte Qwen3-VL-32B.
| Développeur | MiniMax |
| Date de sortie | 2026-08 |
| Architecture | Transformateur omni dense à flux unique de 33.1B (branche adaLN de 13B) |
| Encodeur de texte | Qwen3-VL-32B (états cachés de la couche 50) |
| VAE vidéo | VAE causal temporel, f16t4d24 |
| VAE audio | Stéréo 32 kHz vers jetons latents 40 Hz |
| Licence | Licence communautaire MiniMax H3 |
MiniMax H3 génère jusqu'à 15 secondes de vidéo à 24 FPS avec audio stéréo natif 32 kHz, dans l'une des 11 langues. La sortie utilise par défaut un bord court de 768px ; le module H3-Regenerate-2K régénère les résultats en résolution 2K in-context. Le modèle a été officiellement publié en open source le 3 août 2026 sous le contrat de licence communautaire MiniMax H3, avec le support natif de ComfyUI fusionné le même jour (Comfy-Org/ComfyUI #15224).
Checkpoints
| Checkpoint | Modes |
|---|---|
| FL2VA | Texte vers vidéo, première image, dernière image, première+dernière |
| Ref2VA | Basé sur références : jusqu'à 9 images, 3 vidéos, 3 clips audio (12 fichiers max mixtes) |
Ressources
Guides and workflows related to this model series.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.