MiniMax H3 : modèle vidéo omni-modal ouvert avec audio natif

ComfyUI Wiki

MiniMax H3 est un modèle ouvert de génération omni-modal à usage général : vidéo 768p avec audio stéréo natif 32 kHz, 11 langues et régénération 2K in-context.

M

MiniMax H3

Génération VidéoAudio NatifOmni-ModalTexte vers VidéoImage vers Vidéo

MiniMax H3 est un système ouvert de génération omni-modal à usage général qui comprend le contexte multimodal composé de texte, d'images, de vidéo et d'audio, et génère jusqu'à 15 secondes de vidéo avec audio stéréo natif 32 kHz en une seule passe. C'est le dernier modèle de la gamme vidéo Hailuo de MiniMax, propulsé par un transformateur omni dense à flux unique de 33.1B avec un encodeur de texte Qwen3-VL-32B.

Image d'entrée d'exemple de la démo officielle de MiniMax

Image d'entrée d'exemple utilisée dans la démo officielle de contexte multimodal H3 de MiniMax

MiniMax H3 a été officiellement publié en open source le 3 août 2026 sous le contrat de licence communautaire MiniMax H3. La publication ouverte couvre H3-Base sous forme de deux checkpoints spécifiques aux tâches : FL2VA (texte vers vidéo et conditionnement par première/dernière image) et Ref2VA (génération basée sur des références). Le système de prétraitement H3-Context-IR et le module d'amplification H3-Regenerate-2K restent disponibles en tant qu'API hébergées.

Versions

VersionDescription
H3-Base FL2VAModes texte vers vidéo, première image, dernière image et première+dernière
H3-Base Ref2VAGénération basée sur des références : jusqu'à 9 images, 3 vidéos et 3 clips audio

Capacités principales

  • Audio stéréo natif : 32 kHz stéréo généré dans la même passe que l'image, sans modèle audio séparé
  • Contexte multimodal : toute combinaison de texte, d'images, de vidéo et d'audio en entrée
  • Régénération 2K in-context : H3-Regenerate-2K régénère la sortie 768p en 2K en réutilisant le contexte original
  • 11 langues : ar, zh, en, fr, de, it, ja, ko, pt, ru, es
  • Déploiement : SGLang, vLLM, diffusers et ComfyUI

Installation

MiniMax H3 est nativement supporté dans ComfyUI. Placez les fichiers dans leurs dossiers respectifs :

FichierDestination
minimax_h3_*_bf16.safetensors ou *_int8_convrot.safetensorsComfyUI/models/diffusion_models/
qwen3vl_32b_minimax_h3_*.safetensorsComfyUI/models/text_encoders/
minimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
minimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Le dépôt officiel reconditionné pour ComfyUI (Comfy-Org/MiniMax-H3) fournit des variantes du modèle de diffusion bf16, INT8 convrot et pruned INT8, ainsi que des options d'encodeur de texte bf16, INT8 et NVFP4 AWQ. Les checkpoints INT8 pruned sont environ 40% plus petits que les fichiers INT8 standard grâce aux tables de courbes adaLN précalculées, et l'encodeur de texte NVFP4 AWQ fonctionne sur n'importe quel GPU.

Ressources

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…