MiniMax H3: Quants GGUF, INT4 y NVFP4 para GPUs de consumo

ComfyUI Wikinews

Las cuantizaciones comunitarias de MiniMax H3 llegaron a Hugging Face: archivos GGUF Q2-Q5, INT4/INT8 podados y NVFP4 con flujos de trabajo de ComfyUI.

Las cuantizaciones comunitarias de MiniMax H3 comenzaron a llegar a Hugging Face al día siguiente de la publicación de los pesos abiertos, empaquetando el modelo de vídeo omni-modal de 33.1B en tamaños que caben en GPUs de consumo. Cuatro repositorios se publicaron el 3 de agosto, cubriendo formatos GGUF Q2-Q5, INT4/INT8 podados y NVFP4, la mayoría con flujos de trabajo de ComfyUI incluidos.

La publicación de pesos abiertos en sí llegó el 3 de agosto con soporte nativo de ComfyUI (lee la historia de los pesos abiertos). El reempaquetado oficial de Comfy-Org cubre archivos bf16, INT8 e INT8 podados, pero la ola de cuantización comunitaria va más allá: pesos GGUF que funcionan con los cargadores GGUF de ComfyUI, archivos INT4 de unos 11-12 GB y variantes NVFP4 para GPUs Blackwell.

Fotograma de demostración del vídeo de muestra del repositorio MiniMax H3 GGUF

Un fotograma del vídeo de muestra incluido en el repositorio MiniMax-H3-GGUF de Abiray

Qué se publicó

RepositorioFormatoDestacados
Abiray/MiniMax-H3-GGUFGGUFFL2VA + Ref2VA en Q3_K_M/S, Q4_0, Q4_K_M/S, Q5_0, Q5_K_M/S (15.6-23.9 GB); codificadores de texto GGUF, INT4 y NVFP4; flujo de trabajo FL2V incluido
realrebelai/MiniMax-H3_GGUFsGGUFFL2VA + Ref2VA en Q2_K de precisión mixta, Q3_K_M, Q4_K_M; GGUFs de codificador de texto Q2_K y Q4_K_M; flujos de trabajo FL2V/Ref2V
Abiray/Minimax-H3-nvfp4-INT4-INT8-ConvrotINT4 / INT8 / NVFP4INT4 podado (~11.3 GB), INT4/INT8 mixto (~15.5 GB), INT8 (~21 GB), NVFP4 (12.5 GB) con una guía de selección por GPU
lilcheaty/MiniMax-H3-NVFP4NVFP4Variantes NVFP4 FL2VA y Ref2VA podadas/completas/mixtas con JSONs de perfil de ComfyUI

Cómo hacer que H3 quepa en tu GPU

Los repositorios de cuantización organizan sus archivos según la GPU que tengas:

GPUArchivos recomendados
16 GB VRAM (RTX 4070 Ti Super, RTX 4080)GGUF Q3/Q4 o modelo de difusión INT4 podado / INT4-INT8 mixto + codificador de texto INT4
24 GB VRAM (RTX 3090, RTX 4090)GGUF Q5 o modelo de difusión INT8 podado + codificador de texto INT8
Blackwell (RTX 5090, PRO 6000)Modelo de difusión NVFP4 podado + codificador de texto NVFP4 AWQ

Todos siguen necesitando ambos VAEs:

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3: Quants GGUF, INT4 y NVFP4 para GPUs de consumo | ComfyUI Wiki