MiniMax H3 : quantifications GGUF, INT4 et NVFP4 pour GPU grand public

ComfyUI Wikinews

Les quantifications communautaires de MiniMax H3 sont arrivées sur Hugging Face : fichiers GGUF Q2-Q5, INT4/INT8 élagués et NVFP4 avec flux de travail ComfyUI.

Les quantifications communautaires de MiniMax H3 ont commencé à débarquer sur Hugging Face le lendemain de la sortie des poids ouverts, réduisant le modèle vidéo omni-modal de 33,1B à des tailles adaptées aux GPU grand public. Quatre référentiels ont été publiés le 3 août, couvrant les formats GGUF Q2-Q5, INT4/INT8 élagués et NVFP4, la plupart avec des flux de travail ComfyUI inclus.

La sortie des poids ouverts elle-même a eu lieu le 3 août avec un support natif de ComfyUI (lire l'article sur les poids ouverts). Le réemballage officiel de Comfy-Org couvre les fichiers bf16, INT8 et INT8 élagués, mais la vague de quantifications communautaires va plus loin : des poids GGUF compatibles avec les chargeurs GGUF de ComfyUI, des fichiers INT4 d'environ 11-12 Go et des variantes NVFP4 pour les GPU Blackwell.

Image de démonstration tirée de la vidéo d'exemple du référentiel MiniMax H3 GGUF

Une image tirée de la vidéo d'exemple fournie avec le référentiel MiniMax-H3-GGUF d'Abiray

Ce qui a été publié

RéférentielFormatPoints clés
Abiray/MiniMax-H3-GGUFGGUFFL2VA + Ref2VA en Q3_K_M/S, Q4_0, Q4_K_M/S, Q5_0, Q5_K_M/S (15,6-23,9 Go) ; encodeurs de texte GGUF, INT4 et NVFP4 ; flux de travail FL2V inclus
realrebelai/MiniMax-H3_GGUFsGGUFFL2VA + Ref2VA en précision mixte Q2_K, Q3_K_M, Q4_K_M ; GGUFs d'encodeur de texte Q2_K et Q4_K_M ; flux de travail FL2V/Ref2V
Abiray/Minimax-H3-nvfp4-INT4-INT8-ConvrotINT4 / INT8 / NVFP4INT4 élagué (~11,3 Go), INT4/INT8 mixte (~15,5 Go), INT8 (~21 Go), NVFP4 (12,5 Go) avec un guide de sélection par GPU
lilcheaty/MiniMax-H3-NVFP4NVFP4Variantes NVFP4 élaguées/complètes/mixtes de FL2VA et Ref2VA avec des profils JSON ComfyUI

Adapter H3 à votre GPU

Les référentiels de quantification organisent leurs fichiers en fonction de votre GPU :

GPUFichiers recommandés
16 Go de VRAM (RTX 4070 Ti Super, RTX 4080)GGUF Q3/Q4 ou modèle de diffusion INT4 élagué / INT4-INT8 mixte + encodeur de texte INT4
24 Go de VRAM (RTX 3090, RTX 4090)GGUF Q5 ou modèle de diffusion INT8 élagué + encodeur de texte INT8
Blackwell (RTX 5090, PRO 6000)Modèle de diffusion NVFP4 élagué + encodeur de texte NVFP4 AWQ

Vous aurez toujours besoin des deux VAE : minimax_h3_video_vae_fp16.safetensors et minimax_h3_audio_vae_fp32.safetensors.

Exemple de sortie

Vidéo d'exemple fournie avec le référentiel MiniMax-H3-GGUF

Flux de travail ComfyUI

Les référentiels GGUF fournissent des flux de travail prêts à l'emploi. Le référentiel d'Abiray inclut minimax_fl2v_gguf_workflow.json pour la génération texte-vers-vidéo avec le modèle FL2VA quantifié :

Pour les flux de travail officiels bf16/INT8 de Comfy-Org, consultez l'article sur les poids ouverts ou la Galerie de modèles intégrée (video_minimax_h3_t2v, video_minimax_h3_i2v, video_minimax_h3_r2v).

Disponibilité

  • Abiray/MiniMax-H3-GGUFHugging Face, GGUF Q3-Q5 pour FL2VA et Ref2VA
  • realrebelai/MiniMax-H3_GGUFsHugging Face, GGUF Q2-Q4 avec flux de travail
  • Abiray/Minimax-H3-nvfp4-INT4-INT8-ConvrotHugging Face, INT4/INT8/NVFP4 élagués
  • lilcheaty/MiniMax-H3-NVFP4Hugging Face, variantes NVFP4

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 : quantifications GGUF, INT4 et NVFP4 pour GPU grand public | ComfyUI Wiki