Poids ouverts de MiniMax H3 avec support natif de ComfyUI

ComfyUI Wikinews

Les poids ouverts de MiniMax H3 sont sur Hugging Face avec le support natif de ComfyUI. Fichiers bf16, INT8, pruned et NVFP4, plus six modèles officiels.

La sortie des poids ouverts de H3 de MiniMax, le modèle vidéo omni-modal derrière la gamme Hailuo, est maintenant en ligne. Les poids sont publiés sur Hugging Face et le support natif de ComfyUI est arrivé le même jour : la pull request Comfy-Org/ComfyUI #15224 a été fusionnée le 3 août, ajoutant la génération conjointe audio-vidéo avec quatre nouveaux nœuds et six modèles de workflow officiels.

H3 a été lancé le 31 juillet (lire l'article de lancement). La sortie des poids ouverts amène le transformateur de diffusion conjoint audio-vidéo de 33.1B sur les GPU locaux avec plusieurs options de quantification.

Image d'entrée d'exemple de la démo officielle de MiniMax

Image d'entrée d'exemple utilisée dans la démo officielle de contexte multimodal H3 de MiniMax

Vidéo générée par H3 combinant un clip de référence, une image et une piste audio dans un seul prompt (source : blog de MiniMax)

Vue d'ensemble du système

H3 est un système de génération omni-modal à usage général construit à partir de trois modules :

  • H3-Context-IR : un système de prétraitement et d'orchestration géré qui analyse le contexte multimodal (texte, images, vidéo, audio) et le convertit en une représentation intermédiaire structurée pour la génération. Il n'est pas inclus dans la publication open source ; MiniMax le fournit en API et publie un guide de rédaction de prompts pour construire le vôtre.
  • H3-Base : le transformateur omni de 33.1B à poids ouverts qui génère une vidéo 768p avec audio stéréo natif.
  • H3-Regenerate-2K : régénère la sortie 768p en résolution 2K in-context, en réutilisant le contexte multimodal original. Ce module n'est pas encore open source ; une API reproduit le pipeline complet 2K.

La publication ouverte couvre H3-Base sous forme de deux checkpoints spécifiques aux tâches : FL2VA (texte vers vidéo, première image, dernière image et première+dernière image) et Ref2VA (génération basée sur des références à partir d'images, de vidéo et d'audio).

Spécifications de sortie

ÉlémentSpécification
Durée4-15 secondes
Formats d'image21:9, 16:9, 4:3, 1:1, 3:4, 9:16
RésolutionBord court 768px par défaut ; 2K via H3-Regenerate-2K
Cadence24 FPS
AudioStéréo 32 kHz, généré dans la même passe
Langues11 stables (ar, zh, en, fr, de, it, ja, ko, pt, ru, es)

Modes d'entrée

FL2VA accepte 0, 1 ou 2 images : aucune image est texte vers vidéo, une image est une condition de première ou dernière image, et deux images sont une condition première+dernière image.

Ref2VA accepte jusqu'à 9 images de référence, 3 vidéos de référence (2-15 s chacune, 15 s maximum au total) et 3 clips audio de référence (2-15 s chacun, 15 s maximum au total, toujours accompagnés d'une image ou vidéo). L'entrée mixte est limitée à 12 fichiers au total.

Poids ouverts sur Hugging Face

Deux dépôts sont maintenant en ligne :

  • MiniMaxAI/MiniMax-H3 (Hugging Face) : la publication officielle au format Diffusers, avec les variantes FL2VA et Ref2VA, le code complet du modèle et les guides de rédaction de prompts (base / référence). Sous licence du contrat de licence communautaire MiniMax H3.
  • Comfy-Org/MiniMax-H3 (Hugging Face) : fichiers reconditionnés pour les nœuds natifs de ComfyUI, prêts à placer dans models/diffusion_models, models/text_encoders et models/vae.
ComposantFichiers
Modèle de diffusionminimax_h3_fl2va_bf16 (61,7 Go), minimax_h3_fl2va_int8_convrot (31,7 Go), minimax_h3_fl2va_pruned_int8_convrot (19,5 Go), plus les variantes ref2va_* correspondantes
Encodage de texteqwen3vl_32b_minimax_h3_bf16 (48,0 Go), int8_convrot (25,3 Go), nvfp4_awq (14,6 Go)
VAEminimax_h3_video_vae_fp16 (4,9 Go), minimax_h3_audio_vae_fp32 (0,6 Go)

Les checkpoints INT8 pruned sont environ 40% plus petits que les fichiers INT8 standard grâce aux tables de courbes adaLN précalculées, et l'encodeur de texte NVFP4 AWQ fonctionne sur n'importe quel GPU.

Support natif de ComfyUI fusionné

Le support natif a été fusionné dans Comfy-Org/ComfyUI #15224 le 3 août, intégrant un transformateur de diffusion à jetons empaquetés à flux unique qui débruite conjointement les latents vidéo et audio stéréo, conditionné par les états cachés de Qwen3-VL-32B avec des étiquettes de modalité par jeton. Quatre nouveaux nœuds gèrent le workflow : EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo et MiniMaxH3SigmaShift.

Les workflows officiels de texte vers vidéo et d'image vers vidéo sont disponibles en téléchargement :

Modèles de workflow officiels

Six modèles officiels ont été publiés via Comfy-Org/workflow_templates :

ModèleMode
video_minimax_h3_t2v.jsonLocal : texte vers vidéo
video_minimax_h3_i2v.jsonLocal : image vers vidéo
video_minimax_h3_r2v.jsonLocal : référence vers vidéo
api_minimax_h3_t2v.jsonAPI : texte vers vidéo
api_minimax_h3_r2v.jsonAPI : référence vers vidéo
api_minimax_h3_flf2v.jsonAPI : première/dernière image vers vidéo

Les guides pas à pas pour les workflows locaux à poids ouverts sont publiés sur la documentation officielle : tutoriel de workflow open source MiniMax H3.

Disponibilité

  • Poids ouverts : Disponibles sur Hugging Face (MiniMaxAI/MiniMax-H3) et reconditionnés pour ComfyUI sur Comfy-Org/MiniMax-H3.
  • ComfyUI : Support natif fusionné dans Comfy-Org/ComfyUI #15224 ; mettez à jour ComfyUI vers la dernière version pour obtenir les nouveaux nœuds.
  • Modèles officiels : Six workflows dans la galerie de modèles intégrée de ComfyUI.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Poids ouverts de MiniMax H3 avec support natif de ComfyUI | ComfyUI Wiki