MiniMax H3 : modèle ouvert de génération vidéo omni-modal

ComfyUI Wiki

MiniMax H3 est un modèle ouvert de génération vidéo omni-modal avec audio stéréo natif 32 kHz, sortie 768p et régénération 2K in-context. Support natif de ComfyUI.

M

MiniMax H3

Génération VidéoAudio NatifOmni-ModalTexte vers VidéoImage vers Vidéo

MiniMax H3 est un modèle ouvert de génération omni-modal à usage général qui comprend conjointement le texte, les images, la vidéo et l'audio, et génère jusqu'à 15 secondes de vidéo avec audio stéréo natif 32 kHz en une seule passe. C'est le dernier modèle de la gamme vidéo Hailuo de MiniMax, propulsé par un transformateur omni dense à flux unique de 33.1B avec un encodeur de texte Qwen3-VL-32B.

DéveloppeurMiniMax
Date de sortie2026-08
ArchitectureTransformateur omni dense à flux unique de 33.1B (branche adaLN de 13B)
Encodeur de texteQwen3-VL-32B (états cachés de la couche 50)
VAE vidéoVAE causal temporel, f16t4d24
VAE audioStéréo 32 kHz vers jetons latents 40 Hz
LicenceLicence communautaire MiniMax H3

MiniMax H3 génère jusqu'à 15 secondes de vidéo à 24 FPS avec audio stéréo natif 32 kHz, dans l'une des 11 langues. La sortie utilise par défaut un bord court de 768px ; le module H3-Regenerate-2K régénère les résultats en résolution 2K in-context. Le modèle a été officiellement publié en open source le 3 août 2026 sous le contrat de licence communautaire MiniMax H3, avec le support natif de ComfyUI fusionné le même jour (Comfy-Org/ComfyUI #15224).

Checkpoints

CheckpointModes
FL2VATexte vers vidéo, première image, dernière image, première+dernière
Ref2VABasé sur références : jusqu'à 9 images, 3 vidéos, 3 clips audio (12 fichiers max mixtes)

Ressources

Guides and workflows related to this model series.

No articles found.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…