MiniMax H3 dans ComfyUI : Guide complet de génération vidéo
Maîtrisez MiniMax H3 dans ComfyUI avec les flux de travail officiels : modes T2V, I2V, R2V, audio stéréo natif et dépannage pour la génération vidéo par IA.
Aperçu du tutoriel
Ce tutoriel couvre tout ce dont vous avez besoin pour exécuter MiniMax H3 dans ComfyUI : l'installation des modèles, le chargement des flux de travail officiels, la compréhension des trois modes de génération (T2V, I2V, R2V), le choix de la bonne résolution et la résolution des problèmes courants.
Aperçu du modèle MiniMax H3
MiniMax H3 est le dernier modèle de la gamme vidéo Hailuo de MiniMax. Il génère jusqu'à 15 secondes de vidéo à 24 FPS avec un audio stéréo natif de 32 kHz, dans l'une des 11 langues, à une résolution allant jusqu'à 2K. Le modèle est propulsé par un transformer omni dense à flux unique de 33.1B avec un encodeur de texte Qwen3-VL-32B.
Capacités clés :
- Audio stéréo natif : dialogues, effets sonores et musique générés en une seule passe avec la vidéo, sans modèle audio séparé
- Contexte omni-modal : toute combinaison de texte, d'images, de vidéo et d'audio en entrée
- Trois modes de tâches : texte-vers-vidéo (T2V), image-vers-vidéo (I2V) et référence-vers-vidéo (R2V)
- 11 langues : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe, espagnol
- Poids ouverts : licence Communauté MiniMax H3, inférence entièrement locale
La version ouverte couvre H3-Base sous forme de deux checkpoints : FL2VA (texte-vers-vidéo et conditionnement par première/dernière image) et Ref2VA (génération basée sur référence). Le système de prétraitement H3-Context-IR et le module de mise à l'échelle 2K H3-Regenerate-2K restent des API hébergées.
Installation du modèle
Téléchargez les fichiers suivants depuis Comfy-Org/MiniMax-H3 et placez-les dans leurs dossiers :
Modèle de diffusion (choisissez une variante) :
| Modèle | Taille | Remarques |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 19,5 Go | RECOMMANDÉ : INT8 élagué, ~40 % plus petit, meilleur compromis pour T2V/I2V |
minimax_h3_fl2va_int8_convrot.safetensors | 31,7 Go | INT8 standard |
minimax_h3_fl2va_bf16.safetensors | 61,7 Go | Précision complète |
minimax_h3_ref2va_pruned_int8_convrot.safetensors | 19,5 Go | Utilisez-le pour le mode référence-vers-vidéo (R2V) |
minimax_h3_ref2va_bf16.safetensors | 61,7 Go | Précision complète R2V |
Encodeur de texte (choisissez-en un) :
| Modèle | Taille | Remarques |
|---|---|---|
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 14,6 Go | RECOMMANDÉ : NVFP4 AWQ, fonctionne sur n'importe quel GPU |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 25,3 Go | INT8 convrot |
qwen3vl_32b_minimax_h3_bf16.safetensors | 48,0 Go | Précision complète |
VAE (les deux sont requis) :
| Modèle | Taille |
|---|---|
minimax_h3_video_vae_fp16.safetensors | 4,9 Go |
minimax_h3_audio_vae_fp32.safetensors | 0,6 Go |
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsFlux de travail officiels
Six modèles officiels sont disponibles via Comfy-Org/workflow_templates. Trois s'exécutent localement (poids ouverts) et trois appellent l'API MiniMax. Ce guide couvre les trois flux de travail locaux en détail, en suivant la documentation officielle de Comfy-Org.
Chargement des flux de travail
Méthode 1 : Galerie de modèles (recommandée)
Mettez à jour ComfyUI vers la dernière version, puis chargez via Flux de travail -> Parcourir les modèles -> Vidéo -> MiniMax H3.
Méthode 2 : Téléchargement et glisser-déposer
Téléchargez le JSON et glissez-le dans la fenêtre ComfyUI.
Réglage de la résolution de sortie
Chaque flux de travail utilise un nœud Sélecteur de résolution qui calcule width et height à partir de trois paramètres :
- Format d'image : préréglages tels que 16:9 (Paysage), 9:16 (Portrait) ou 1:1 (Carré)
- Mégapixels : nombre total de pixels cible ; des valeurs plus élevées produisent des images plus grandes, des valeurs plus faibles s'exécutent plus rapidement
- Multiple : arrondi au multiple le plus proche de ce nombre ; conservez-le à 32 pour correspondre à la grille de résolution de H3
La toile native de H3 possède un bord court de 768 px, plafonné à 768 × 1344 pixels et arrondi à un multiple de 32. Le modèle est fourni avec une taille d'aperçu rapide ; pour une qualité complète, augmentez les Mégapixels à environ 1,0 en 16:9, ce qui donne environ 1344 × 768.
1. MiniMax H3 Text-to-Video (T2V)
Generate videos from text prompts with native stereo audio.
Model downloads (T2V)
| Component | File | Destination |
|---|---|---|
| Diffusion model | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Text encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Model storage (T2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsPrompting tips (T2V)
- Describe the whole scene: state the overall scene first (location, character, what is happening), then break it into timed shots
- Shots, camera, and audio: describe the shots, camera moves, and the accompanying audio (dialogue, SFX, music) in one prompt block
- Duration: the duration input snaps to the model's 17-frame-per-block (17k+5) grid at 24 FPS
- First/last frame: connect images to
first_frameand/orlast_frameon theMiniMaxH3ImageToVideonode to turn this workflow into first/last-frame image-to-video
2. MiniMax H3 Image-to-Video (I2V)
Générez des vidéos à partir d'une image d'entrée, avec des images clés facultatives pour la première et la dernière image.
Image d'entrée :
- Téléchargez l'image d'entrée par défaut ou utilisez la vôtre.
Téléchargements de modèles (I2V)
| Composant | Fichier | Destination |
|---|---|---|
| Modèle de diffusion | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Encodeur de texte | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Stockage des modèles (I2V)
Même organisation que le flux de travail T2V (modèle de diffusion FL2VA + encodeur de texte NVFP4 + les deux VAE).
Conseils pour les prompts (I2V)
- Images clés : les entrées
first_frameetlast_framesont facultatives ; le modèle génère le mouvement entre elles - Prompt : décrivez les plans, le mouvement et l'audio qui l'accompagne (dialogues, effets sonores, musique) en un seul bloc
- Durée : s'aligne sur la grille de 17 images par bloc (17k+5) à 24 FPS
3. MiniMax H3 Vidéo à partir de références (R2V)
Générez des vidéos qui conservent un personnage, un style, un mouvement, un déplacement de caméra ou une voix à partir de n'importe quel mélange d'images de référence, de vidéos et d'audio.
Images de référence :
- référence de personnage pour le flux de travail, ou utilisez la vôtre
- référence de style et de sujet pour le flux de travail, ou utilisez la vôtre
Téléchargements de modèles (R2V)
| Composant | Fichier | Destination |
|---|---|---|
| Modèle de diffusion | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Encodeur de texte | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Stockage des modèles (R2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsConseils pour les prompts (R2V)
- Référence par balise : référencez chaque entrée par balise dans l'ordre exact où elle a été connectée, par exemple
<Picture 1>,<Video 1>,<Audio 1> - Attribuez une tâche à chaque référence : indiquez quelle référence pilote quelle partie du plan (identité, style, mouvement, caméra, voix) ; les attributions explicites fonctionnent beaucoup mieux
- Limites : jusqu'à 9 images de référence, 3 vidéos de référence (chacune peut contenir sa propre bande sonore) et 3 clips audio de référence autonomes
- ref_image_size :
matchréduit les références à la résolution de génération pour plus de rapidité ;maxconserve jusqu'à un petit côté de 2048 px pour une meilleure fidélité de l'identité, au prix de la rapidité - Sampler :
res_multistepavec un schedulerbetaounormaltend à surpassersimplepour les prompts fortement basés sur des références - Remarque : R2V utilise le modèle de diffusion
ref2va, un ensemble de poids différent du modèlefl2vautilisé par T2V et I2V.
API Workflows
Three additional official templates call the MiniMax API instead of running locally:
| Template | Mode |
|---|---|
| api_minimax_h3_t2v.json | API: text to video |
| api_minimax_h3_r2v.json | API: reference to video |
| api_minimax_h3_flf2v.json | API: first/last frame to video |
Dépannage
Q : ComfyUI n'affiche pas les nœuds MiniMax H3
Mettez à jour ComfyUI vers la version 0.30.0 ou une version ultérieure. La prise en charge native a été fusionnée dans Comfy-Org/ComfyUI #15224 le 3 août 2026. Les mises à jour Desktop et Cloud suivent les versions stables. Certaines fonctionnalités prises en charge par les versions nocturnes peuvent donc ne pas encore être disponibles.
Q : Mémoire insuffisante / utilisation élevée de la VRAM
- Utilisez le modèle de diffusion INT8 élagué (19,5 Go) au lieu du bf16
- Utilisez l'encodeur de texte NVFP4 AWQ (14,6 Go), qui fonctionne sur n'importe quel GPU
- Réduisez la résolution dans le nœud Sélecteur de résolution (réduisez les mégapixels) et raccourcissez la durée
- Le système de VRAM dynamique de ComfyUI et l'échange de blocs aident sur les machines disposant de beaucoup de RAM système
Q : La génération échoue à 256p ou à de très petites résolutions
H3 a une résolution minimale de 384p. La 256p échoue complètement. Utilisez les préréglages de résolution du modèle de flux de travail officiel.
Q : La vidéo de sortie n'a pas d'audio
Assurez-vous que les deux VAE sont chargés : minimax_h3_video_vae_fp16.safetensors (vidéo) et minimax_h3_audio_vae_fp32.safetensors (audio), et que le flux de travail comprend un nœud VAEDecodeAudio connecté à SaveVideo.
Q : Quel checkpoint dois-je utiliser pour l'image vers vidéo ?
Utilisez le checkpoint FL2VA pour T2V et I2V (première image, dernière image, ou les deux). Utilisez le checkpoint Ref2VA lorsque vous avez besoin d'une génération entièrement basée sur des références (identité, style, voix).
Q : Où puis-je signaler des bugs ?
- Erreurs d'exécution : ComfyUI/issues
- Problèmes d'interface utilisateur : ComfyUI_frontend/issues
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.