MiniMax H3 dans ComfyUI : Guide complet de génération vidéo
Téléchargez et exécutez MiniMax H3 dans ComfyUI : flux T2V, I2V et R2V, fichiers modèle et VAE, options quantifiées GGUF/INT8/NVFP4, conseils de performance et dépannage.
Aperçu du tutoriel
Ce tutoriel couvre tout ce dont vous avez besoin pour exécuter MiniMax H3 dans ComfyUI : l'installation des modèles, le chargement des flux de travail officiels, la compréhension des trois modes de génération (T2V, I2V, R2V), le choix de la bonne résolution et la résolution des problèmes courants.
Aperçu du modèle MiniMax H3
MiniMax H3 est le dernier modèle de la gamme vidéo Hailuo de MiniMax. Il génère jusqu'à 15 secondes de vidéo à 24 FPS avec un audio stéréo natif de 32 kHz, dans l'une des 11 langues, à une résolution allant jusqu'à 2K. Le modèle est propulsé par un transformer omni dense à flux unique de 33.1B avec un encodeur de texte Qwen3-VL-32B.
Capacités clés :
- Audio stéréo natif : dialogues, effets sonores et musique générés en une seule passe avec la vidéo, sans modèle audio séparé
- Contexte omni-modal : toute combinaison de texte, d'images, de vidéo et d'audio en entrée
- Trois modes de tâches : texte-vers-vidéo (T2V), image-vers-vidéo (I2V) et référence-vers-vidéo (R2V)
- 11 langues : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe, espagnol
- Poids ouverts : licence Communauté MiniMax H3, inférence entièrement locale
La version ouverte couvre H3-Base sous forme de deux checkpoints : FL2VA (texte-vers-vidéo et conditionnement par première/dernière image) et Ref2VA (génération basée sur référence). Le système de prétraitement H3-Context-IR et le module de mise à l'échelle 2K H3-Regenerate-2K restent des API hébergées.
Installation du modèle
Téléchargez les fichiers suivants depuis Comfy-Org/MiniMax-H3 et placez-les dans leurs dossiers :
Modèle de diffusion (choisissez une variante) :
| Modèle | Taille | Remarques |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 19,5 Go | RECOMMANDÉ : INT8 élagué, ~40 % plus petit, meilleur compromis pour T2V/I2V |
minimax_h3_fl2va_int8_convrot.safetensors | 31,7 Go | INT8 standard |
minimax_h3_fl2va_bf16.safetensors | 61,7 Go | Précision complète |
minimax_h3_ref2va_pruned_int8_convrot.safetensors | 19,5 Go | Utilisez-le pour le mode référence-vers-vidéo (R2V) |
minimax_h3_ref2va_bf16.safetensors | 61,7 Go | Précision complète R2V |
Encodeur de texte (choisissez-en un) :
| Modèle | Taille | Remarques |
|---|---|---|
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 14,6 Go | RECOMMANDÉ : NVFP4 AWQ, fonctionne sur n'importe quel GPU |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 25,3 Go | INT8 convrot |
qwen3vl_32b_minimax_h3_bf16.safetensors | 48,0 Go | Précision complète |
VAE (les deux sont requis) :
| Modèle | Taille |
|---|---|
minimax_h3_video_vae_fp16.safetensors | 4,9 Go |
minimax_h3_audio_vae_fp32.safetensors | 0,6 Go |
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsFlux de travail officiels
Six modèles officiels sont disponibles via Comfy-Org/workflow_templates. Trois s'exécutent localement (poids ouverts) et trois appellent l'API MiniMax. Ce guide couvre les trois flux de travail locaux en détail, en suivant la documentation officielle de Comfy-Org.
Chargement des flux de travail
Méthode 1 : Galerie de modèles (recommandée)
Mettez à jour ComfyUI vers la dernière version, puis chargez via Flux de travail -> Parcourir les modèles -> Vidéo -> MiniMax H3.
Méthode 2 : Téléchargement et glisser-déposer
Téléchargez le JSON et glissez-le dans la fenêtre ComfyUI.
Réglage de la résolution de sortie
Chaque flux de travail utilise un nœud Sélecteur de résolution qui calcule width et height à partir de trois paramètres :
- Format d'image : préréglages tels que 16:9 (Paysage), 9:16 (Portrait) ou 1:1 (Carré)
- Mégapixels : nombre total de pixels cible ; des valeurs plus élevées produisent des images plus grandes, des valeurs plus faibles s'exécutent plus rapidement
- Multiple : arrondi au multiple le plus proche de ce nombre ; conservez-le à 32 pour correspondre à la grille de résolution de H3
La toile native de H3 possède un bord court de 768 px, plafonné à 768 × 1344 pixels et arrondi à un multiple de 32. Le modèle est fourni avec une taille d'aperçu rapide ; pour une qualité complète, augmentez les Mégapixels à environ 1,0 en 16:9, ce qui donne environ 1344 × 768.
1. MiniMax H3 Text-to-Video (T2V)
Generate videos from text prompts with native stereo audio.
Model downloads (T2V)
| Component | File | Destination |
|---|---|---|
| Diffusion model | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Text encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Model storage (T2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsPrompting tips (T2V)
- Describe the whole scene: state the overall scene first (location, character, what is happening), then break it into timed shots
- Shots, camera, and audio: describe the shots, camera moves, and the accompanying audio (dialogue, SFX, music) in one prompt block
- Duration: the duration input snaps to the model's 17-frame-per-block (17k+5) grid at 24 FPS
- First/last frame: connect images to
first_frameand/orlast_frameon theMiniMaxH3ImageToVideonode to turn this workflow into first/last-frame image-to-video
2. MiniMax H3 Image-to-Video (I2V)
Générez des vidéos à partir d'une image d'entrée, avec des images clés facultatives pour la première et la dernière image.
Image d'entrée :
- Téléchargez l'image d'entrée par défaut ou utilisez la vôtre.
Téléchargements de modèles (I2V)
| Composant | Fichier | Destination |
|---|---|---|
| Modèle de diffusion | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Encodeur de texte | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Stockage des modèles (I2V)
Même organisation que le flux de travail T2V (modèle de diffusion FL2VA + encodeur de texte NVFP4 + les deux VAE).
Conseils pour les prompts (I2V)
- Images clés : les entrées
first_frameetlast_framesont facultatives ; le modèle génère le mouvement entre elles - Prompt : décrivez les plans, le mouvement et l'audio qui l'accompagne (dialogues, effets sonores, musique) en un seul bloc
- Durée : s'aligne sur la grille de 17 images par bloc (17k+5) à 24 FPS
3. MiniMax H3 Vidéo à partir de références (R2V)
Générez des vidéos qui conservent un personnage, un style, un mouvement, un déplacement de caméra ou une voix à partir de n'importe quel mélange d'images de référence, de vidéos et d'audio.
Images de référence :
- référence de personnage pour le flux de travail, ou utilisez la vôtre
- référence de style et de sujet pour le flux de travail, ou utilisez la vôtre
Téléchargements de modèles (R2V)
| Composant | Fichier | Destination |
|---|---|---|
| Modèle de diffusion | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| Encodeur de texte | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Stockage des modèles (R2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensorsConseils pour les prompts (R2V)
- Référence par balise : référencez chaque entrée par balise dans l'ordre exact où elle a été connectée, par exemple
<Picture 1>,<Video 1>,<Audio 1> - Attribuez une tâche à chaque référence : indiquez quelle référence pilote quelle partie du plan (identité, style, mouvement, caméra, voix) ; les attributions explicites fonctionnent beaucoup mieux
- Limites : jusqu'à 9 images de référence, 3 vidéos de référence (chacune peut contenir sa propre bande sonore) et 3 clips audio de référence autonomes
- ref_image_size :
matchréduit les références à la résolution de génération pour plus de rapidité ;maxconserve jusqu'à un petit côté de 2048 px pour une meilleure fidélité de l'identité, au prix de la rapidité - Sampler :
res_multistepavec un schedulerbetaounormaltend à surpassersimplepour les prompts fortement basés sur des références - Remarque : R2V utilise le modèle de diffusion
ref2va, un ensemble de poids différent du modèlefl2vautilisé par T2V et I2V.
API Workflows
Three additional official templates call the MiniMax API instead of running locally:
| Template | Mode |
|---|---|
| api_minimax_h3_t2v.json | API: text to video |
| api_minimax_h3_r2v.json | API: reference to video |
| api_minimax_h3_flf2v.json | API: first/last frame to video |
Dépannage
ComfyUI-MiniMaxH3-Cache. Ce nœud personnalisé applique un monkey-patch global au code du modèle MiniMax H3, ce qui peut casser la génération H3 (ou ComfyUI lui-même) après les mises à jour, même s'il n'est jamais utilisé. Voir lihaoyun6/ComfyUI-MiniMaxH3-Cache#4. Si vous l'avez déjà installé, supprimez-le de custom_nodes/ et redémarrez ComfyUI.
Q : ComfyUI n'affiche pas les nœuds MiniMax H3
Mettez à jour ComfyUI vers la version 0.30.0 ou une version ultérieure. La prise en charge native a été fusionnée dans Comfy-Org/ComfyUI #15224 le 3 août 2026. Les mises à jour Desktop et Cloud suivent les versions stables. Certaines fonctionnalités prises en charge par les versions nocturnes peuvent donc ne pas encore être disponibles.
Q : Mémoire insuffisante / utilisation élevée de la VRAM
- Utilisez le modèle de diffusion INT8 élagué (19,5 Go) au lieu du bf16
- Utilisez l'encodeur de texte NVFP4 AWQ (14,6 Go), qui fonctionne sur n'importe quel GPU
- Réduisez la résolution dans le nœud Sélecteur de résolution (réduisez les mégapixels) et raccourcissez la durée
- Le système de VRAM dynamique de ComfyUI et l'échange de blocs aident sur les machines disposant de beaucoup de RAM système
Q : La génération échoue à 256p ou à de très petites résolutions
H3 a une résolution minimale de 384p. La 256p échoue complètement. Utilisez les préréglages de résolution du modèle de flux de travail officiel.
Q : La vidéo de sortie n'a pas d'audio
Assurez-vous que les deux VAE sont chargés : minimax_h3_video_vae_fp16.safetensors (vidéo) et minimax_h3_audio_vae_fp32.safetensors (audio), et que le flux de travail comprend un nœud VAEDecodeAudio connecté à SaveVideo.
Q : Quel checkpoint dois-je utiliser pour l'image vers vidéo ?
Utilisez le checkpoint FL2VA pour T2V et I2V (première image, dernière image, ou les deux). Utilisez le checkpoint Ref2VA lorsque vous avez besoin d'une génération entièrement basée sur des références (identité, style, voix).
Q : Où puis-je signaler des bugs ?
- Erreurs d'exécution : ComfyUI/issues
- Problèmes d'interface utilisateur : ComfyUI_frontend/issues
Conseils de performance MiniMax H3
Réglages testés par la communauté pour générer plus vite avec les workflows officiels :
- Échantillonneur et planificateur :
res_multistepavec le planificateursimpleà 20 étapes est la référence la plus utilisée pour T2V et I2V. Réduire le nombre d'étapes fait gagner du temps, mais la qualité baisse nettement en dessous d'environ 15 étapes. Monter à 25 étapes donne un contenu d'image et un mouvement légèrement meilleurs, au prix d'un temps de génération plus long. - Attention Sage : lancez ComfyUI avec
--use-sage-attention(intégré, aucun nœud personnalisé requis). La communauté rapporte une génération jusqu'à environ 2 fois plus rapide sur les GPU de milieu de gamme, avec des gains décroissants à mesure que la résolution augmente ; les résultats varient selon le GPU. - Résolution : gardez le sélecteur de résolution autour de 0.4 MP (par exemple 768x512) pour des brouillons rapides. H3 fonctionne à son minimum de 384p, bien moins que ce que les modèles vidéo précédents exigeaient.
- Mémoire épinglée : sur ComfyUI 0.30.x, une régression de la mémoire épinglée peut rendre le chargement du modèle très lent. Lancer avec
--disable-pinned-memoryrétablirait un chargement rapide et réduirait nettement le temps de génération sur certaines configurations.
Modèles quantifiés MiniMax H3 de la communauté
Versions quantifiées par la communauté des checkpoints de diffusion MiniMax H3, chargeables dans ComfyUI standard. Ce sont des conversions tierces, pas des versions officielles de MiniMax ou Comfy-Org ; consultez le README de chaque dépôt pour la licence et la qualité.
INT8
| Modèle | Notes |
|---|---|
| DmitryDB/MiniMax-H3-INT8-Lean-ConvRot | INT8 Lean ConvRot orienté qualité, FL2VA et Ref2VA d'environ 20.9 Gio chacun, conçu comme premier choix pour GPU de 24 Go |
| Gluttony10/MiniMax-H3-INT8-CONVROT | FL2VA et Ref2VA en INT8 convrot, avec VAE audio/vidéo et encodeur de texte Qwen3-VL INT8 |
INT4
| Modèle | Notes |
|---|---|
| Merserk/MiniMax-H3-INT4-ConvRot | FL2VA et Ref2VA élagués de 11.3 Go chacun plus un encodeur de texte INT4, destiné aux GPU de 12 Go |
| tsolful/Minimax_H3_INT4MixedConvRot | FL2VA INT4 en précision mixte, avec variantes équilibrée (INT4BQ) et qualité (INT4Q) |
NVFP4
| Modèle | Notes |
|---|---|
| rockerBOO/minimax-h3-nvfp4 | Variantes NVFP4 et INT4 convrot élaguées de FL2VA |
| lilcheaty/MiniMax-H3-NVFP4 | Variantes NVFP4 de FL2VA et Ref2VA, y compris des checkpoints en précision mixte |
| ModelsLab/MiniMax-H3-ref2va-NVFP4 | Checkpoint Ref2VA NVFP4 pour le workflow de références |
FP8
| Modèle | Notes |
|---|---|
| rzgar/minimax_h3_fl2va_fp8_e4m3fn | FL2VA FP8 E4M3FN ; l'auteur rapporte un point idéal à 8 étapes avec dpmpp_2m / sgm_uniform |
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.