Unsloth MiniMax H3 GGUF 量化模型:Q2-Q8 全范围,适用于本地使用

ComfyUI Wikinews

Unsloth 发布 MiniMax H3 的 GGUF 量化版本,涵盖 FL2VA 和 Ref2VA 从 Q2_K(6.3 GB)到 Q8_0(20 GB)的完整范围,以及 Qwen3-VL 文本编码器 GGUF,适用于 ComfyUI 和 stablediffusion.cpp。

Unsloth 于 8 月 10 日发布了 MiniMax H3 的 GGUF 量化版本,涵盖 H3 两个 denoise 模型的完整 Q2:Q8 范围,以及它们所需的 Qwen3-VL 文本编码器。这些文件兼容 ComfyUI、stablediffusion.cpp 和 Unsloth,为低显存用户提供了比最初社区量化浪潮更多的档位选择。

使用 UD-Q2_K_XL 生成的 MiniMax H3 GGUF 演示片段

演示片段使用最小档位 UD-Q2_K_XL 生成:960x544、124 帧、24 FPS、8 步、引导 1.0(GIF 已降采样且不含音频;完整 MP4 包含 H3 原生 32 kHz 立体声音频)

发布内容

H3 包含两个 denoise 模型,两者采用相同的量化档位:

量化格式FL2VA 剪枝版Ref2VA 剪枝版
Q2_K6.26 GiB6.22 GiB
UD-Q2_K_XL7.51 GiB
Q3_K8.16 GiB8.12 GiB
UD-Q3_K_XL8.90 GiB
Q4_K10.64 GiB10.60 GiB
Q5_012.97 GiB12.93 GiB
Q6_K15.45 GiB15.42 GiB
Q8_019.96 GiB19.94 GiB

FL2VA 是首帧与末帧变体(文本加零帧、一帧或两帧);Ref2VA 是参考变体(文本加参考图片、视频和音频)。它们是相互独立的模型,请根据任务选择匹配的版本。

H3 所需的 Qwen3-VL 32B 文本编码器也提供 GGUF 版本:qwen3vl_32b_minimax_h3-Q2_K_M.gguf(12.20 GiB)和 qwen3vl_32b_minimax_h3-Q4_K_M.gguf(16.97 GiB)。

如何选择适合您显卡的文件

显存推荐档位
8–12 GBQ2_K 或 UD-Q2_K_XL
12–16 GBQ3_K / UD-Q3_K_XL 或 Q4_K
16–24 GBQ5_0 或 Q6_K
24 GB 以上Q8_0

作为参考,上面的演示是在单张显卡上以 960x544 分辨率、UD-Q2_K_XL 档位运行的。

如何在 ComfyUI 中使用

diffusion 模型的 GGUF 文件通过标准的 ComfyUI GGUF 加载节点(ComfyUI-GGUF)加载,方式与早期社区发布的 H3 量化版本相同;文本编码器 GGUF 则通过 GGUF 文本编码器加载器加载。照常将文件与 MiniMax H3 的视频和音频 VAE 搭配使用即可。

获取方式

所有文件均可在 Hugging Face 上的 unsloth/MiniMax-H3-GGUF 获取。除 ComfyUI 之外,这些文件还可通过 stablediffusion.cpp 和 Unsloth 自己的运行时运行。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Unsloth MiniMax H3 GGUF 量化模型:Q2-Q8 全范围,适用于本地使用 | ComfyUI Wiki