MiniMax H3 : quantifications GGUF, INT4 et NVFP4 pour GPU grand public
Les quantifications communautaires de MiniMax H3 sont arrivées sur Hugging Face : fichiers GGUF Q2-Q5, INT4/INT8 élagués et NVFP4 avec flux de travail ComfyUI.
Les quantifications communautaires de MiniMax H3 ont commencé à débarquer sur Hugging Face le lendemain de la sortie des poids ouverts, réduisant le modèle vidéo omni-modal de 33,1B à des tailles adaptées aux GPU grand public. Quatre référentiels ont été publiés le 3 août, couvrant les formats GGUF Q2-Q5, INT4/INT8 élagués et NVFP4, la plupart avec des flux de travail ComfyUI inclus.
La sortie des poids ouverts elle-même a eu lieu le 3 août avec un support natif de ComfyUI (lire l'article sur les poids ouverts). Le réemballage officiel de Comfy-Org couvre les fichiers bf16, INT8 et INT8 élagués, mais la vague de quantifications communautaires va plus loin : des poids GGUF compatibles avec les chargeurs GGUF de ComfyUI, des fichiers INT4 d'environ 11-12 Go et des variantes NVFP4 pour les GPU Blackwell.
Une image tirée de la vidéo d'exemple fournie avec le référentiel MiniMax-H3-GGUF d'Abiray
Ce qui a été publié
| Référentiel | Format | Points clés |
|---|---|---|
| Abiray/MiniMax-H3-GGUF | GGUF | FL2VA + Ref2VA en Q3_K_M/S, Q4_0, Q4_K_M/S, Q5_0, Q5_K_M/S (15,6-23,9 Go) ; encodeurs de texte GGUF, INT4 et NVFP4 ; flux de travail FL2V inclus |
| realrebelai/MiniMax-H3_GGUFs | GGUF | FL2VA + Ref2VA en précision mixte Q2_K, Q3_K_M, Q4_K_M ; GGUFs d'encodeur de texte Q2_K et Q4_K_M ; flux de travail FL2V/Ref2V |
| Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot | INT4 / INT8 / NVFP4 | INT4 élagué (~11,3 Go), INT4/INT8 mixte (~15,5 Go), INT8 (~21 Go), NVFP4 (12,5 Go) avec un guide de sélection par GPU |
| lilcheaty/MiniMax-H3-NVFP4 | NVFP4 | Variantes NVFP4 élaguées/complètes/mixtes de FL2VA et Ref2VA avec des profils JSON ComfyUI |
Adapter H3 à votre GPU
Les référentiels de quantification organisent leurs fichiers en fonction de votre GPU :
| GPU | Fichiers recommandés |
|---|---|
| 16 Go de VRAM (RTX 4070 Ti Super, RTX 4080) | GGUF Q3/Q4 ou modèle de diffusion INT4 élagué / INT4-INT8 mixte + encodeur de texte INT4 |
| 24 Go de VRAM (RTX 3090, RTX 4090) | GGUF Q5 ou modèle de diffusion INT8 élagué + encodeur de texte INT8 |
| Blackwell (RTX 5090, PRO 6000) | Modèle de diffusion NVFP4 élagué + encodeur de texte NVFP4 AWQ |
Vous aurez toujours besoin des deux VAE : minimax_h3_video_vae_fp16.safetensors et minimax_h3_audio_vae_fp32.safetensors.
Exemple de sortie
Vidéo d'exemple fournie avec le référentiel MiniMax-H3-GGUF
Flux de travail ComfyUI
Les référentiels GGUF fournissent des flux de travail prêts à l'emploi. Le référentiel d'Abiray inclut minimax_fl2v_gguf_workflow.json pour la génération texte-vers-vidéo avec le modèle FL2VA quantifié :
Pour les flux de travail officiels bf16/INT8 de Comfy-Org, consultez l'article sur les poids ouverts ou la Galerie de modèles intégrée (video_minimax_h3_t2v, video_minimax_h3_i2v, video_minimax_h3_r2v).
Disponibilité
- Abiray/MiniMax-H3-GGUF — Hugging Face, GGUF Q3-Q5 pour FL2VA et Ref2VA
- realrebelai/MiniMax-H3_GGUFs — Hugging Face, GGUF Q2-Q4 avec flux de travail
- Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot — Hugging Face, INT4/INT8/NVFP4 élagués
- lilcheaty/MiniMax-H3-NVFP4 — Hugging Face, variantes NVFP4
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.