MiniMax H3 dans ComfyUI : Guide complet de génération vidéo

Maîtrisez MiniMax H3 dans ComfyUI avec les flux de travail officiels : modes T2V, I2V, R2V, audio stéréo natif et dépannage pour la génération vidéo par IA.

MiniMax H3 est un modèle de génération omni-modal à usage général qui comprend à la fois le texte, les images, la vidéo et l'audio, et génère des vidéos avec audio stéréo natif (voix, effets sonores et musique en une seule passe avant). Il a été open-sourcé le 3 août 2026, et la prise en charge native de ComfyUI a été fusionnée le même jour.

Aperçu du tutoriel

Ce tutoriel couvre tout ce dont vous avez besoin pour exécuter MiniMax H3 dans ComfyUI : l'installation des modèles, le chargement des flux de travail officiels, la compréhension des trois modes de génération (T2V, I2V, R2V), le choix de la bonne résolution et la résolution des problèmes courants.

Aperçu du modèle MiniMax H3

MiniMax H3 est le dernier modèle de la gamme vidéo Hailuo de MiniMax. Il génère jusqu'à 15 secondes de vidéo à 24 FPS avec un audio stéréo natif de 32 kHz, dans l'une des 11 langues, à une résolution allant jusqu'à 2K. Le modèle est propulsé par un transformer omni dense à flux unique de 33.1B avec un encodeur de texte Qwen3-VL-32B.

Capacités clés :

  • Audio stéréo natif : dialogues, effets sonores et musique générés en une seule passe avec la vidéo, sans modèle audio séparé
  • Contexte omni-modal : toute combinaison de texte, d'images, de vidéo et d'audio en entrée
  • Trois modes de tâches : texte-vers-vidéo (T2V), image-vers-vidéo (I2V) et référence-vers-vidéo (R2V)
  • 11 langues : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe, espagnol
  • Poids ouverts : licence Communauté MiniMax H3, inférence entièrement locale

La version ouverte couvre H3-Base sous forme de deux checkpoints : FL2VA (texte-vers-vidéo et conditionnement par première/dernière image) et Ref2VA (génération basée sur référence). Le système de prétraitement H3-Context-IR et le module de mise à l'échelle 2K H3-Regenerate-2K restent des API hébergées.

Installation du modèle

Téléchargez les fichiers suivants depuis Comfy-Org/MiniMax-H3 et placez-les dans leurs dossiers :

Modèle de diffusion (choisissez une variante) :

ModèleTailleRemarques
minimax_h3_fl2va_pruned_int8_convrot.safetensors19,5 GoRECOMMANDÉ : INT8 élagué, ~40 % plus petit, meilleur compromis pour T2V/I2V
minimax_h3_fl2va_int8_convrot.safetensors31,7 GoINT8 standard
minimax_h3_fl2va_bf16.safetensors61,7 GoPrécision complète
minimax_h3_ref2va_pruned_int8_convrot.safetensors19,5 GoUtilisez-le pour le mode référence-vers-vidéo (R2V)
minimax_h3_ref2va_bf16.safetensors61,7 GoPrécision complète R2V

Encodeur de texte (choisissez-en un) :

ModèleTailleRemarques
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors14,6 GoRECOMMANDÉ : NVFP4 AWQ, fonctionne sur n'importe quel GPU
qwen3vl_32b_minimax_h3_int8_convrot.safetensors25,3 GoINT8 convrot
qwen3vl_32b_minimax_h3_bf16.safetensors48,0 GoPrécision complète

VAE (les deux sont requis) :

ModèleTaille
minimax_h3_video_vae_fp16.safetensors4,9 Go
minimax_h3_audio_vae_fp32.safetensors0,6 Go
📂 ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Flux de travail officiels

Six modèles officiels sont disponibles via Comfy-Org/workflow_templates. Trois s'exécutent localement (poids ouverts) et trois appellent l'API MiniMax. Ce guide couvre les trois flux de travail locaux en détail, en suivant la documentation officielle de Comfy-Org.

Chargement des flux de travail

Méthode 1 : Galerie de modèles (recommandée)

Mettez à jour ComfyUI vers la dernière version, puis chargez via Flux de travail -> Parcourir les modèles -> Vidéo -> MiniMax H3.

Méthode 2 : Téléchargement et glisser-déposer

Téléchargez le JSON et glissez-le dans la fenêtre ComfyUI.

Réglage de la résolution de sortie

Chaque flux de travail utilise un nœud Sélecteur de résolution qui calcule width et height à partir de trois paramètres :

  • Format d'image : préréglages tels que 16:9 (Paysage), 9:16 (Portrait) ou 1:1 (Carré)
  • Mégapixels : nombre total de pixels cible ; des valeurs plus élevées produisent des images plus grandes, des valeurs plus faibles s'exécutent plus rapidement
  • Multiple : arrondi au multiple le plus proche de ce nombre ; conservez-le à 32 pour correspondre à la grille de résolution de H3

La toile native de H3 possède un bord court de 768 px, plafonné à 768 × 1344 pixels et arrondi à un multiple de 32. Le modèle est fourni avec une taille d'aperçu rapide ; pour une qualité complète, augmentez les Mégapixels à environ 1,0 en 16:9, ce qui donne environ 1344 × 768.

1. MiniMax H3 Text-to-Video (T2V)

Generate videos from text prompts with native stereo audio.

Model downloads (T2V)

ComponentFileDestination
Diffusion modelminimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Text encoderqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Model storage (T2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Prompting tips (T2V)

  • Describe the whole scene: state the overall scene first (location, character, what is happening), then break it into timed shots
  • Shots, camera, and audio: describe the shots, camera moves, and the accompanying audio (dialogue, SFX, music) in one prompt block
  • Duration: the duration input snaps to the model's 17-frame-per-block (17k+5) grid at 24 FPS
  • First/last frame: connect images to first_frame and/or last_frame on the MiniMaxH3ImageToVideo node to turn this workflow into first/last-frame image-to-video

2. MiniMax H3 Image-to-Video (I2V)

Générez des vidéos à partir d'une image d'entrée, avec des images clés facultatives pour la première et la dernière image.

Image d'entrée : Input Image - Téléchargez l'image d'entrée par défaut ou utilisez la vôtre.

Téléchargements de modèles (I2V)

ComposantFichierDestination
Modèle de diffusionminimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Encodeur de texteqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Stockage des modèles (I2V)

Même organisation que le flux de travail T2V (modèle de diffusion FL2VA + encodeur de texte NVFP4 + les deux VAE).

Conseils pour les prompts (I2V)

  • Images clés : les entrées first_frame et last_frame sont facultatives ; le modèle génère le mouvement entre elles
  • Prompt : décrivez les plans, le mouvement et l'audio qui l'accompagne (dialogues, effets sonores, musique) en un seul bloc
  • Durée : s'aligne sur la grille de 17 images par bloc (17k+5) à 24 FPS

3. MiniMax H3 Vidéo à partir de références (R2V)

Générez des vidéos qui conservent un personnage, un style, un mouvement, un déplacement de caméra ou une voix à partir de n'importe quel mélange d'images de référence, de vidéos et d'audio.

Images de référence :

  • Reference Image - référence de personnage pour le flux de travail, ou utilisez la vôtre
  • Reference Image - référence de style et de sujet pour le flux de travail, ou utilisez la vôtre

Téléchargements de modèles (R2V)

ComposantFichierDestination
Modèle de diffusionminimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
Encodeur de texteqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Stockage des modèles (R2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

Conseils pour les prompts (R2V)

  • Référence par balise : référencez chaque entrée par balise dans l'ordre exact où elle a été connectée, par exemple <Picture 1>, <Video 1>, <Audio 1>
  • Attribuez une tâche à chaque référence : indiquez quelle référence pilote quelle partie du plan (identité, style, mouvement, caméra, voix) ; les attributions explicites fonctionnent beaucoup mieux
  • Limites : jusqu'à 9 images de référence, 3 vidéos de référence (chacune peut contenir sa propre bande sonore) et 3 clips audio de référence autonomes
  • ref_image_size : match réduit les références à la résolution de génération pour plus de rapidité ; max conserve jusqu'à un petit côté de 2048 px pour une meilleure fidélité de l'identité, au prix de la rapidité
  • Sampler : res_multistep avec un scheduler beta ou normal tend à surpasser simple pour les prompts fortement basés sur des références
  • Remarque : R2V utilise le modèle de diffusion ref2va, un ensemble de poids différent du modèle fl2va utilisé par T2V et I2V.

API Workflows

Three additional official templates call the MiniMax API instead of running locally:

TemplateMode
api_minimax_h3_t2v.jsonAPI: text to video
api_minimax_h3_r2v.jsonAPI: reference to video
api_minimax_h3_flf2v.jsonAPI: first/last frame to video

Dépannage

Q : ComfyUI n'affiche pas les nœuds MiniMax H3

Mettez à jour ComfyUI vers la version 0.30.0 ou une version ultérieure. La prise en charge native a été fusionnée dans Comfy-Org/ComfyUI #15224 le 3 août 2026. Les mises à jour Desktop et Cloud suivent les versions stables. Certaines fonctionnalités prises en charge par les versions nocturnes peuvent donc ne pas encore être disponibles.

Q : Mémoire insuffisante / utilisation élevée de la VRAM

  • Utilisez le modèle de diffusion INT8 élagué (19,5 Go) au lieu du bf16
  • Utilisez l'encodeur de texte NVFP4 AWQ (14,6 Go), qui fonctionne sur n'importe quel GPU
  • Réduisez la résolution dans le nœud Sélecteur de résolution (réduisez les mégapixels) et raccourcissez la durée
  • Le système de VRAM dynamique de ComfyUI et l'échange de blocs aident sur les machines disposant de beaucoup de RAM système

Q : La génération échoue à 256p ou à de très petites résolutions

H3 a une résolution minimale de 384p. La 256p échoue complètement. Utilisez les préréglages de résolution du modèle de flux de travail officiel.

Q : La vidéo de sortie n'a pas d'audio

Assurez-vous que les deux VAE sont chargés : minimax_h3_video_vae_fp16.safetensors (vidéo) et minimax_h3_audio_vae_fp32.safetensors (audio), et que le flux de travail comprend un nœud VAEDecodeAudio connecté à SaveVideo.

Q : Quel checkpoint dois-je utiliser pour l'image vers vidéo ?

Utilisez le checkpoint FL2VA pour T2V et I2V (première image, dernière image, ou les deux). Utilisez le checkpoint Ref2VA lorsque vous avez besoin d'une génération entièrement basée sur des références (identité, style, voix).

Q : Où puis-je signaler des bugs ?

Ressources associées

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…