MiniMax H3 w4a8:Kijai 的实验性 4 位权重落地 ComfyUI
Kijai 发布了实验性的 w4a8 量化 MiniMax H3 权重(12.5 GB FL2VA),并搭配 int8 convrot VAE。ComfyUI 核心支持已在 PR #15308 中合并。
Kijai 在 Hugging Face 上发布了实验性的 w4a8 量化 MiniMax H3 权重,并搭配了 int8 convrot VAE。这种非对称 4 位布局以每个元素约 0.56 字节存储权重,并通过 int8 GEMM 运行,将剪枝后的 FL2VA checkpoint 缩减至 12.5 GB(仓库)。
该格式得到了 ComfyUI 核心工作的支持:Comfy-Org/ComfyUI #15308("Support asym w4a8_int")已于 8 月 7 日合并,Comfy-Org/ComfyUI #15334 中的 int8 convrot VAE 支持已于 8 月 6 日合并。
这是一个仅用于测试的进行中版本。请将质量与速度数字视为早期数据,而非最终结果。
文件
| 文件 | 大小 | 角色 |
|---|---|---|
minimax_h3_fl2va_pruned_w4a8_mixed.safetensors | 12.5 GB | FL2VA 剪枝扩散模型(文生视频、首帧/尾帧) |
minimax_h3_ref2va_pruned_w4a8_mixed.safetensors | 11.8 GB | Ref2VA 剪枝扩散模型(参考图条件) |
minimax_h3_video_vae_int8_convrot.safetensors | 3.2 GB | int8 convrot 视频 VAE,比 fp16 VAE 快约 1.5 倍 |
w4a8 布局的工作原理
该布局来自 comfy-kitchen PR #90("Add optimized w4a8 with int8 codebook"),这是一种免校准的 4 位权重存储方案,通过 ConvRot 激活在 int8 GEMM 上运行:
- 经 ConvRot 旋转的 int4 权重,加上逐张量的 Lloyd-Max 码本与 fp8 分组缩放因子
- 反量化为分组 int8 后,送入 int8 CUTLASS GEMM
- 在真实 DiT 权重上,权重 relL2 误差约为 0.073(NVFP4 约为 0.094)
- 每个元素约 0.56 字节,比 int8 快约 1.09 倍,无需校准过程
- 后端:CUDA(分块融合的 int4 到 int8 反量化 + 跨步 INT8 GEMM),加上面向 AMD/CPU 的 Triton 与纯 PyTorch eager 路径
Kijai 在 RTX 5090 上使用 w4a8 的示例结果帧(分享自 comfy-kitchen PR #90)
在 ComfyUI 中使用
使用官方的 H3 工作流模板(video_minimax_h3_t2v 等)运行 w4a8 扩散模型,将模型加载器替换为 w4a8 checkpoint,并将 VAE 加载器替换为 minimax_h3_video_vae_int8_convrot.safetensors。int8 convrot VAE 需要 PR #15334 中已合并的 ComfyUI 核心支持。
获取方式
- 权重: Hugging Face 上的 Kijai/MiniMax-H3-experimental
- 核心支持: ComfyUI #15308(w4a8)和 ComfyUI #15334(int8 convrot VAE)
- 量化后端: comfy-kitchen #90
评论
使用 GitHub 登录后即可参与讨论。