MiniMax H3 混合模型合并:兼具 FL2VA 画质与 Ref2VA 参考支持
社区合并将 MiniMax H3 FL2VA 的画质与 Ref2VA 的参考条件控制整合于同一模型中,并附带专用的 ComfyUI Hybrid Loader 节点。
MiniMax H3 发布时包含两个架构相同的模型:FL2VA 的视觉和音频质量更高,Ref2VA 则是唯一支持参考驱动生成(图像、视频或音频参考条件控制)的变体,但其原始输出质量明显较差。现在,一个社区项目将两者合并为单一的 MiniMax H3 Hybrid 模型,并配套一个自定义节点,可直接在 ComfyUI 中加载。
官方项目 README 中推荐的 Hybrid Loader 设置
为什么需要合并
对两个官方模型进行逐张量比较后发现,绝大多数权重(注意力 QKV/输出投影、MLP、RMSNorm、补丁投影、旋转位置嵌入和 token 精炼器)在 FL2VA 与 Ref2VA 之间完全一致或极为接近(余弦相似度 ≥ 0.9997)。有意义的差异集中在每个模块的 adaln_proj 权重上:即 AdaLN 调制投影,负责将文本、音频、视频和参考模态信号路由到残差流中。
由于参考条件处理只集中在这些靠后模块的 AdaLN 权重上,而常规视觉/音频保真度存在于共享权重中,因此有针对性的合并比有损折中方案更有前景:以 FL2VA 作为其余部分的基础,并从 Ref2VA 提取 adaln_proj 权重,应用于可配置范围的靠后 Transformer 模块。
可用变体
合并是在张量层面完成的,无需额外训练。所有变体均以 FL2VA 为基础,区别仅在于 50 个 Transformer 模块中有多少个从 Ref2VA 获取其 adaln_proj 权重:
| 文件 | 取自 Ref2VA 的模块 | 取舍 |
|---|---|---|
minimax_h3_hybrid_fl2va_ref2va_b30-49.safetensors | 30–49(最后 20 个) | 最接近 FL2VA:输出质量最高,参考能力有所减弱 |
minimax_h3_hybrid_fl2va_ref2va_b25-49.safetensors | 25–49(最后 25 个) | 推荐的默认均衡方案 |
minimax_h3_hybrid_fl2va_ref2va_b20-49.safetensors | 20–49(最后 30 个) | 更接近 Ref2VA:参考遵循度更好,质量略降 |
minimax_h3_hybrid_fl2va_ref2va_b15-49.safetensors | 15–49(最后 35 个) | 参考能力最强,有一定质量损失 |
每个变体都是独立的完整模型,与来源模型的架构和张量布局完全相同(约 21 GB),加载后即可像普通扩散模型一样使用。
ComfyUI 使用方法
该混合模型无法通过 ComfyUI 自带的 Load Diffusion Model 节点加载,因为没有任何一个内置加载器知道如何合成两个模型。配套的 MiniMax H3 Hybrid Loader(ComfyUI_MinimaxH3HybridLoader)填补了这一空白:
- 将自定义节点安装到
ComfyUI/custom_nodes/目录并重新启动 ComfyUI。它将以MiniMax H3 Hybrid Loader的名称出现在 model/loaders 分类下。 - 将 基础模型 设置为 FL2VA 模型,叠加模型 设置为 Ref2VA 模型。
- 选择一个预设:
ref2va_adaln_over_fl2va(仅从 Ref2VA 获取每个模块的 AdaLN)或block_range_adaln,配合block_range_start/block_range_end实现更精细的控制(模块索引为 0–49)。 - 加载器会将合并后的状态字典交给 ComfyUI 自带的模型加载器处理,因此最终结果与通过
Load Diffusion Model加载的模型无法区分:相同的 patcher、相同的多GPU支持,对应的 int8.comfy_quant文件也会自动一并加载。
该加载器对内存非常友好:两个 safetensors 文件均以 mmap 方式打开,并逐个张量进行合并,因此峰值 RSS 仅维持在一个模型的量级,而非两个。
获取方式
- 权重文件:smhfacct/Minimax-H3-fl2va-ref2va-hybrid-models,托管于 Hugging Face(四种变体,每个约 21 GB)
- ComfyUI 节点:scottmudge/ComfyUI_MinimaxH3HybridLoader,托管于 GitHub,其中
minimax_h3_analysis.md包含完整的逐张量分析 - 两个来源模型均保持原样未修改;合并模型继承 MiniMax H3 的原始许可条款
评论
使用 GitHub 登录后即可参与讨论。