MiniMax H3 混合模型合并:兼具 FL2VA 画质与 Ref2VA 参考支持

ComfyUI Wikinews

社区合并将 MiniMax H3 FL2VA 的画质与 Ref2VA 的参考条件控制整合于同一模型中,并附带专用的 ComfyUI Hybrid Loader 节点。

MiniMax H3 发布时包含两个架构相同的模型:FL2VA 的视觉和音频质量更高,Ref2VA 则是唯一支持参考驱动生成(图像、视频或音频参考条件控制)的变体,但其原始输出质量明显较差。现在,一个社区项目将两者合并为单一的 MiniMax H3 Hybrid 模型,并配套一个自定义节点,可直接在 ComfyUI 中加载。

Recommended Hybrid Loader settings from the official README

官方项目 README 中推荐的 Hybrid Loader 设置

为什么需要合并

对两个官方模型进行逐张量比较后发现,绝大多数权重(注意力 QKV/输出投影、MLP、RMSNorm、补丁投影、旋转位置嵌入和 token 精炼器)在 FL2VA 与 Ref2VA 之间完全一致或极为接近(余弦相似度 ≥ 0.9997)。有意义的差异集中在每个模块的 adaln_proj 权重上:即 AdaLN 调制投影,负责将文本、音频、视频和参考模态信号路由到残差流中。

由于参考条件处理只集中在这些靠后模块的 AdaLN 权重上,而常规视觉/音频保真度存在于共享权重中,因此有针对性的合并比有损折中方案更有前景:以 FL2VA 作为其余部分的基础,并从 Ref2VA 提取 adaln_proj 权重,应用于可配置范围的靠后 Transformer 模块。

可用变体

合并是在张量层面完成的,无需额外训练。所有变体均以 FL2VA 为基础,区别仅在于 50 个 Transformer 模块中有多少个从 Ref2VA 获取其 adaln_proj 权重:

文件取自 Ref2VA 的模块取舍
minimax_h3_hybrid_fl2va_ref2va_b30-49.safetensors30–49(最后 20 个)最接近 FL2VA:输出质量最高,参考能力有所减弱
minimax_h3_hybrid_fl2va_ref2va_b25-49.safetensors25–49(最后 25 个)推荐的默认均衡方案
minimax_h3_hybrid_fl2va_ref2va_b20-49.safetensors20–49(最后 30 个)更接近 Ref2VA:参考遵循度更好,质量略降
minimax_h3_hybrid_fl2va_ref2va_b15-49.safetensors15–49(最后 35 个)参考能力最强,有一定质量损失

每个变体都是独立的完整模型,与来源模型的架构和张量布局完全相同(约 21 GB),加载后即可像普通扩散模型一样使用。

ComfyUI 使用方法

该混合模型无法通过 ComfyUI 自带的 Load Diffusion Model 节点加载,因为没有任何一个内置加载器知道如何合成两个模型。配套的 MiniMax H3 Hybrid LoaderComfyUI_MinimaxH3HybridLoader)填补了这一空白:

  1. 将自定义节点安装到 ComfyUI/custom_nodes/ 目录并重新启动 ComfyUI。它将以 MiniMax H3 Hybrid Loader 的名称出现在 model/loaders 分类下。
  2. 基础模型 设置为 FL2VA 模型,叠加模型 设置为 Ref2VA 模型。
  3. 选择一个预设:ref2va_adaln_over_fl2va(仅从 Ref2VA 获取每个模块的 AdaLN)或 block_range_adaln,配合 block_range_start / block_range_end 实现更精细的控制(模块索引为 0–49)。
  4. 加载器会将合并后的状态字典交给 ComfyUI 自带的模型加载器处理,因此最终结果与通过 Load Diffusion Model 加载的模型无法区分:相同的 patcher、相同的多GPU支持,对应的 int8 .comfy_quant 文件也会自动一并加载。

该加载器对内存非常友好:两个 safetensors 文件均以 mmap 方式打开,并逐个张量进行合并,因此峰值 RSS 仅维持在一个模型的量级,而非两个。

获取方式

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 混合模型合并:兼具 FL2VA 画质与 Ref2VA 参考支持 | ComfyUI Wiki