Unsloth MiniMax H3 GGUF 量化模型:Q2-Q8 全范围,适用于本地使用
Unsloth 发布 MiniMax H3 的 GGUF 量化版本,涵盖 FL2VA 和 Ref2VA 从 Q2_K(6.3 GB)到 Q8_0(20 GB)的完整范围,以及 Qwen3-VL 文本编码器 GGUF,适用于 ComfyUI 和 stablediffusion.cpp。
Unsloth 于 8 月 10 日发布了 MiniMax H3 的 GGUF 量化版本,涵盖 H3 两个 denoise 模型的完整 Q2:Q8 范围,以及它们所需的 Qwen3-VL 文本编码器。这些文件兼容 ComfyUI、stablediffusion.cpp 和 Unsloth,为低显存用户提供了比最初社区量化浪潮更多的档位选择。
演示片段使用最小档位 UD-Q2_K_XL 生成:960x544、124 帧、24 FPS、8 步、引导 1.0(GIF 已降采样且不含音频;完整 MP4 包含 H3 原生 32 kHz 立体声音频)
发布内容
H3 包含两个 denoise 模型,两者采用相同的量化档位:
| 量化格式 | FL2VA 剪枝版 | Ref2VA 剪枝版 |
|---|---|---|
| Q2_K | 6.26 GiB | 6.22 GiB |
| UD-Q2_K_XL | 7.51 GiB | 无 |
| Q3_K | 8.16 GiB | 8.12 GiB |
| UD-Q3_K_XL | 8.90 GiB | 无 |
| Q4_K | 10.64 GiB | 10.60 GiB |
| Q5_0 | 12.97 GiB | 12.93 GiB |
| Q6_K | 15.45 GiB | 15.42 GiB |
| Q8_0 | 19.96 GiB | 19.94 GiB |
FL2VA 是首帧与末帧变体(文本加零帧、一帧或两帧);Ref2VA 是参考变体(文本加参考图片、视频和音频)。它们是相互独立的模型,请根据任务选择匹配的版本。
H3 所需的 Qwen3-VL 32B 文本编码器也提供 GGUF 版本:qwen3vl_32b_minimax_h3-Q2_K_M.gguf(12.20 GiB)和 qwen3vl_32b_minimax_h3-Q4_K_M.gguf(16.97 GiB)。
如何选择适合您显卡的文件
| 显存 | 推荐档位 |
|---|---|
| 8–12 GB | Q2_K 或 UD-Q2_K_XL |
| 12–16 GB | Q3_K / UD-Q3_K_XL 或 Q4_K |
| 16–24 GB | Q5_0 或 Q6_K |
| 24 GB 以上 | Q8_0 |
作为参考,上面的演示是在单张显卡上以 960x544 分辨率、UD-Q2_K_XL 档位运行的。
如何在 ComfyUI 中使用
diffusion 模型的 GGUF 文件通过标准的 ComfyUI GGUF 加载节点(ComfyUI-GGUF)加载,方式与早期社区发布的 H3 量化版本相同;文本编码器 GGUF 则通过 GGUF 文本编码器加载器加载。照常将文件与 MiniMax H3 的视频和音频 VAE 搭配使用即可。
获取方式
所有文件均可在 Hugging Face 上的 unsloth/MiniMax-H3-GGUF 获取。除 ComfyUI 之外,这些文件还可通过 stablediffusion.cpp 和 Unsloth 自己的运行时运行。
评论
使用 GitHub 登录后即可参与讨论。