MiniMax H3: Quants GGUF, INT4 y NVFP4 para GPUs de consumo
Las cuantizaciones comunitarias de MiniMax H3 llegaron a Hugging Face: archivos GGUF Q2-Q5, INT4/INT8 podados y NVFP4 con flujos de trabajo de ComfyUI.
Las cuantizaciones comunitarias de MiniMax H3 comenzaron a llegar a Hugging Face al día siguiente de la publicación de los pesos abiertos, empaquetando el modelo de vídeo omni-modal de 33.1B en tamaños que caben en GPUs de consumo. Cuatro repositorios se publicaron el 3 de agosto, cubriendo formatos GGUF Q2-Q5, INT4/INT8 podados y NVFP4, la mayoría con flujos de trabajo de ComfyUI incluidos.
La publicación de pesos abiertos en sí llegó el 3 de agosto con soporte nativo de ComfyUI (lee la historia de los pesos abiertos). El reempaquetado oficial de Comfy-Org cubre archivos bf16, INT8 e INT8 podados, pero la ola de cuantización comunitaria va más allá: pesos GGUF que funcionan con los cargadores GGUF de ComfyUI, archivos INT4 de unos 11-12 GB y variantes NVFP4 para GPUs Blackwell.
Un fotograma del vídeo de muestra incluido en el repositorio MiniMax-H3-GGUF de Abiray
Qué se publicó
| Repositorio | Formato | Destacados |
|---|---|---|
| Abiray/MiniMax-H3-GGUF | GGUF | FL2VA + Ref2VA en Q3_K_M/S, Q4_0, Q4_K_M/S, Q5_0, Q5_K_M/S (15.6-23.9 GB); codificadores de texto GGUF, INT4 y NVFP4; flujo de trabajo FL2V incluido |
| realrebelai/MiniMax-H3_GGUFs | GGUF | FL2VA + Ref2VA en Q2_K de precisión mixta, Q3_K_M, Q4_K_M; GGUFs de codificador de texto Q2_K y Q4_K_M; flujos de trabajo FL2V/Ref2V |
| Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot | INT4 / INT8 / NVFP4 | INT4 podado (~11.3 GB), INT4/INT8 mixto (~15.5 GB), INT8 (~21 GB), NVFP4 (12.5 GB) con una guía de selección por GPU |
| lilcheaty/MiniMax-H3-NVFP4 | NVFP4 | Variantes NVFP4 FL2VA y Ref2VA podadas/completas/mixtas con JSONs de perfil de ComfyUI |
Cómo hacer que H3 quepa en tu GPU
Los repositorios de cuantización organizan sus archivos según la GPU que tengas:
| GPU | Archivos recomendados |
|---|---|
| 16 GB VRAM (RTX 4070 Ti Super, RTX 4080) | GGUF Q3/Q4 o modelo de difusión INT4 podado / INT4-INT8 mixto + codificador de texto INT4 |
| 24 GB VRAM (RTX 3090, RTX 4090) | GGUF Q5 o modelo de difusión INT8 podado + codificador de texto INT8 |
| Blackwell (RTX 5090, PRO 6000) | Modelo de difusión NVFP4 podado + codificador de texto NVFP4 AWQ |
Todos siguen necesitando ambos VAEs:
Comentarios
Inicia sesión con GitHub para unirte a la conversación.