MiniMax H3 社区量化模型:面向消费级 GPU 的 GGUF、INT4 与 NVFP4
MiniMax H3 社区量化版本在开放权重发布次日即登陆 Hugging Face:涵盖 GGUF Q2-Q5、精简 INT4/INT8 与 NVFP4 文件,并捆绑 ComfyUI 工作流。
MiniMax H3 的社区量化版本在开放权重发布次日便开始登陆 Hugging Face,将 33.1B 参数的全模态视频模型压缩到适合消费级 GPU 的尺寸。8 月 3 日共有四个仓库发布,涵盖 GGUF Q2-Q5、精简 INT4/INT8 与 NVFP4 格式,其中大多数捆绑了 ComfyUI 工作流。
开放权重版本本身于 8 月 3 日发布,原生支持 ComfyUI(阅读开放权重相关报道)。官方 Comfy-Org 重新打包版涵盖 bf16、INT8 与精简 INT8 文件,但社区量化浪潮更进一步:与 ComfyUI 的 GGUF 加载器兼容的 GGUF 权重、约 11-12 GB 的 INT4 文件,以及面向 Blackwell GPU 的 NVFP4 变体。
来自 Abiray 的 MiniMax-H3-GGUF 仓库中捆绑示例视频的一帧画面
发布内容
| 仓库 | 格式 | 亮点 |
|---|---|---|
| Abiray/MiniMax-H3-GGUF | GGUF | FL2VA + Ref2VA(Q3_K_M/S、Q4_0、Q4_K_M/S、Q5_0、Q5_K_M/S 量化,15.6-23.9 GB);GGUF、INT4 与 NVFP4 文本编码器;捆绑 FL2V 工作流 |
| realrebelai/MiniMax-H3_GGUFs | GGUF | FL2VA + Ref2VA(Q2_K 混合精度、Q3_K_M、Q4_K_M);Q2_K 与 Q4_K_M 文本编码器 GGUF;FL2V/Ref2V 工作流 |
| Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot | INT4 / INT8 / NVFP4 | 精简 INT4(约 11.3 GB)、混合 INT4/INT8(约 15.5 GB)、INT8(约 21 GB)、NVFP4(12.5 GB),附按 GPU 选择指南 |
| lilcheaty/MiniMax-H3-NVFP4 | NVFP4 | FL2VA 与 Ref2VA 的 NVFP4 精简/完整/混合变体,附 ComfyUI 档案 JSON |
让 H3 适配你的 GPU
量化仓库根据你拥有的 GPU 来组织文件:
| GPU | 推荐文件 |
|---|---|
| 16 GB VRAM(RTX 4070 Ti Super、RTX 4080) | GGUF Q3/Q4 或精简 INT4 / 混合 INT4-INT8 扩散模型 + INT4 文本编码器 |
| 24 GB VRAM(RTX 3090、RTX 4090) | GGUF Q5 或精简 INT8 扩散模型 + INT8 文本编码器 |
| Blackwell(RTX 5090、PRO 6000) | NVFP4 精简扩散模型 + NVFP4 AWQ 文本编码器 |
无论哪种方案,你仍然需要两个 VAE:minimax_h3_video_vae_fp16.safetensors 和 minimax_h3_audio_vae_fp32.safetensors。
示例输出
与 MiniMax-H3-GGUF 仓库捆绑的示例视频
ComfyUI 工作流
GGUF 仓库随附开箱即用的工作流。Abiray 的仓库包含 minimax_fl2v_gguf_workflow.json,用于配合量化 FL2VA 模型进行文生视频:
如需 Comfy-Org 官方 bf16/INT8 工作流,请参阅开放权重文章或内置模板图库(video_minimax_h3_t2v、video_minimax_h3_i2v、video_minimax_h3_r2v)。
获取方式
- Abiray/MiniMax-H3-GGUF: Hugging Face,适用于 FL2VA 与 Ref2VA 的 GGUF Q3-Q5
- realrebelai/MiniMax-H3_GGUFs: Hugging Face,附带工作流的 GGUF Q2-Q4
- Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot: Hugging Face,精简 INT4/INT8/NVFP4
- lilcheaty/MiniMax-H3-NVFP4: Hugging Face,NVFP4 变体
评论
使用 GitHub 登录后即可参与讨论。