Poids ouverts de MiniMax H3 avec support natif de ComfyUI
Les poids ouverts de MiniMax H3 sont sur Hugging Face avec le support natif de ComfyUI. Fichiers bf16, INT8, pruned et NVFP4, plus six modèles officiels.
La sortie des poids ouverts de H3 de MiniMax, le modèle vidéo omni-modal derrière la gamme Hailuo, est maintenant en ligne. Les poids sont publiés sur Hugging Face et le support natif de ComfyUI est arrivé le même jour : la pull request Comfy-Org/ComfyUI #15224 a été fusionnée le 3 août, ajoutant la génération conjointe audio-vidéo avec quatre nouveaux nœuds et six modèles de workflow officiels.
H3 a été lancé le 31 juillet (lire l'article de lancement). La sortie des poids ouverts amène le transformateur de diffusion conjoint audio-vidéo de 33.1B sur les GPU locaux avec plusieurs options de quantification.
Image d'entrée d'exemple utilisée dans la démo officielle de contexte multimodal H3 de MiniMax
Vidéo générée par H3 combinant un clip de référence, une image et une piste audio dans un seul prompt (source : blog de MiniMax)
Vue d'ensemble du système
H3 est un système de génération omni-modal à usage général construit à partir de trois modules :
- H3-Context-IR : un système de prétraitement et d'orchestration géré qui analyse le contexte multimodal (texte, images, vidéo, audio) et le convertit en une représentation intermédiaire structurée pour la génération. Il n'est pas inclus dans la publication open source ; MiniMax le fournit en API et publie un guide de rédaction de prompts pour construire le vôtre.
- H3-Base : le transformateur omni de 33.1B à poids ouverts qui génère une vidéo 768p avec audio stéréo natif.
- H3-Regenerate-2K : régénère la sortie 768p en résolution 2K in-context, en réutilisant le contexte multimodal original. Ce module n'est pas encore open source ; une API reproduit le pipeline complet 2K.
La publication ouverte couvre H3-Base sous forme de deux checkpoints spécifiques aux tâches : FL2VA (texte vers vidéo, première image, dernière image et première+dernière image) et Ref2VA (génération basée sur des références à partir d'images, de vidéo et d'audio).
Spécifications de sortie
| Élément | Spécification |
|---|---|
| Durée | 4-15 secondes |
| Formats d'image | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Résolution | Bord court 768px par défaut ; 2K via H3-Regenerate-2K |
| Cadence | 24 FPS |
| Audio | Stéréo 32 kHz, généré dans la même passe |
| Langues | 11 stables (ar, zh, en, fr, de, it, ja, ko, pt, ru, es) |
Modes d'entrée
FL2VA accepte 0, 1 ou 2 images : aucune image est texte vers vidéo, une image est une condition de première ou dernière image, et deux images sont une condition première+dernière image.
Ref2VA accepte jusqu'à 9 images de référence, 3 vidéos de référence (2-15 s chacune, 15 s maximum au total) et 3 clips audio de référence (2-15 s chacun, 15 s maximum au total, toujours accompagnés d'une image ou vidéo). L'entrée mixte est limitée à 12 fichiers au total.
Poids ouverts sur Hugging Face
Deux dépôts sont maintenant en ligne :
- MiniMaxAI/MiniMax-H3 (Hugging Face) : la publication officielle au format Diffusers, avec les variantes FL2VA et Ref2VA, le code complet du modèle et les guides de rédaction de prompts (base / référence). Sous licence du contrat de licence communautaire MiniMax H3.
- Comfy-Org/MiniMax-H3 (Hugging Face) : fichiers reconditionnés pour les nœuds natifs de ComfyUI, prêts à placer dans
models/diffusion_models,models/text_encodersetmodels/vae.
| Composant | Fichiers |
|---|---|
| Modèle de diffusion | minimax_h3_fl2va_bf16 (61,7 Go), minimax_h3_fl2va_int8_convrot (31,7 Go), minimax_h3_fl2va_pruned_int8_convrot (19,5 Go), plus les variantes ref2va_* correspondantes |
| Encodage de texte | qwen3vl_32b_minimax_h3_bf16 (48,0 Go), int8_convrot (25,3 Go), nvfp4_awq (14,6 Go) |
| VAE | minimax_h3_video_vae_fp16 (4,9 Go), minimax_h3_audio_vae_fp32 (0,6 Go) |
Les checkpoints INT8 pruned sont environ 40% plus petits que les fichiers INT8 standard grâce aux tables de courbes adaLN précalculées, et l'encodeur de texte NVFP4 AWQ fonctionne sur n'importe quel GPU.
Support natif de ComfyUI fusionné
Le support natif a été fusionné dans Comfy-Org/ComfyUI #15224 le 3 août, intégrant un transformateur de diffusion à jetons empaquetés à flux unique qui débruite conjointement les latents vidéo et audio stéréo, conditionné par les états cachés de Qwen3-VL-32B avec des étiquettes de modalité par jeton. Quatre nouveaux nœuds gèrent le workflow : EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo et MiniMaxH3SigmaShift.
Les workflows officiels de texte vers vidéo et d'image vers vidéo sont disponibles en téléchargement :
- video_minimax_h3_t2v.json (texte vers vidéo)
- video_minimax_h3_i2v.json (image vers vidéo)
- video_minimax_h3_r2v.json (référence vers vidéo)
Modèles de workflow officiels
Six modèles officiels ont été publiés via Comfy-Org/workflow_templates :
| Modèle | Mode |
|---|---|
| video_minimax_h3_t2v.json | Local : texte vers vidéo |
| video_minimax_h3_i2v.json | Local : image vers vidéo |
| video_minimax_h3_r2v.json | Local : référence vers vidéo |
| api_minimax_h3_t2v.json | API : texte vers vidéo |
| api_minimax_h3_r2v.json | API : référence vers vidéo |
| api_minimax_h3_flf2v.json | API : première/dernière image vers vidéo |
Les guides pas à pas pour les workflows locaux à poids ouverts sont publiés sur la documentation officielle : tutoriel de workflow open source MiniMax H3.
Disponibilité
- Poids ouverts : Disponibles sur Hugging Face (MiniMaxAI/MiniMax-H3) et reconditionnés pour ComfyUI sur Comfy-Org/MiniMax-H3.
- ComfyUI : Support natif fusionné dans Comfy-Org/ComfyUI #15224 ; mettez à jour ComfyUI vers la dernière version pour obtenir les nouveaux nœuds.
- Modèles officiels : Six workflows dans la galerie de modèles intégrée de ComfyUI.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.