MiniMax H3 X2 Detail VAE:二合一的放大与细节增强发布
MiniMax H3 的一项实验性二合一发布:一个 2X 视频 VAE,加上一个用于引用的细节增强节点,并附带经过测试的 ComfyUI 工作流和一篇负面结果说明。
来自该发布对比片段的画面:一侧是普通的 2X VAE 解码,另一侧是同一 Latent 经过细节增强路径后的结果。
一个文件里的两个工具
wiki 上大部分的 H3 VAE 工作都在让解码变得更快。这次发布走的是相反方向,探讨解码能否变得更锐利,并把这次探索中幸存下来的成果发布出来。同一个 checkpoint,MiniMax-H3-X2-Detail-v1.safetensors,被用于两种不同的用途:
| 模式 | 输入 | 作用 | 是否需要自定义节点 |
|---|---|---|---|
| 2X VAE | H3 视频 Latent | 通过打包的 12 通道输出加 PixelShuffle,以双倍空间分辨率解码 | 是,仅快速解码节点需要 |
| 细节增强器 | RGB 引用图像 | 在参考生视频之前,从编码器的一个早期分支中重建额外的空间结构 | 是,随发布一并包含 |
这两种模式不可互换。2X 路径作用于已生成 Latent,不需要引用图像。细节路径则需要一张已有的 RGB 图像,因为它所使用的额外信息是在正常的 Latent 瓶颈之前从 H3 编码器中提取的。
模式 1:2X VAE 解码
将 checkpoint 放入 ComfyUI/models/vae/,并在标准的 加载VAE 节点中选择它。实际解码时,请将 ComfyUI 常规的 VAE 解码 节点替换为来自 TripleHeadedMonkey/ComfyUI-MiniMaxH3_LatentUpscaler 的 MiniMax H3 VAE Decode (fast),正是它把打包输出转换为全分辨率 RGB。
H3 video latent
↓
MiniMax H3 VAE Decode (fast) ← MiniMax-H3-X2-Detail-v1
↓
packed 12-channel X2 decode
↓
PixelShuffle ×2
↓
2X RGB / video frames该工作流附带了经过验证的起始配置:tiling = true,tile_size = 256,tile_overlap = 64,output_device = cpu,temporal_tiling = false。
该发布 README 中展示的必需 MiniMax H3 VAE Decode (fast) 节点。
模式 2:引用细节增强
对于图像引用工作流,同一个 checkpoint 会在 MiniMax H3 VAE 2X (Detailed Upscale) 中被第二次加载,这是一个以 ComfyUI-H3-X2-Detailed.zip 形式打包的小型自定义节点。它位于来源图像与 MiniMax H3 参考转视频 之间,detail_strength = 1.0 是经过测试的基线值。最终视频解码仍通过 MiniMax H3 VAE Decode (fast) 使用同一个 X2 VAE 完成。
示例工作流
该发布包含一个二合一节点图,能同时演示这两种用途:细节节点在参考生视频之前增强 RGB 引用,而生成的 H3 Latent 最后通过 MiniMax H3 VAE Decode (fast) 解码。
来自模型卡片的完整二合一工作流截图。
正面对比
下面两个片段都以匹配的生成设置运行同一模型在其两种已发布模式下的表现:左侧是单独的 2X VAE,右侧是 2X VAE 加上细节路径,其中引用会先经过 B32 细节分支处理。
对比 01:2X VAE 解码与带细节增强路径的 2X VAE 的对比。
对比 02:同样两种模式在第二个片段上的表现。
为什么没有 "HQ VAE"
这篇说明对结果的描述异常直白。起点是一个已经可用的 H3 2X VAE,它更大的输出并未带来成比例的真实细节,因此该项目着手让多出来的像素变得有意义。解码器侧的模块、细节目标损失、Latent "细节方向" 以及更强的渐进式解码器都以失败告终,其中几项虽然改善了数值损失,却产生了边缘光晕、雕刻般的结构,或者根本看不出任何可见变化。
唯一明确奏效的分支,是从冻结的 H3 编码器的 down.1.block.1 中提取出一个紧凑的 32 通道表示,它在全部十帧留出帧上都改善了 RMSE、HP3 和梯度指标。它还来自于 Latent 瓶颈之前的原始 RGB 图像,而这恰恰是 H3 在文生视频过程中生成全新 Latent 时所不存在的信息。作者的结论范围很窄,且表述得十分明确:这种细节增益无法仅从标准的已生成 H3 Latent 中复现,因此它无法成为项目最初追求的那种可直接替换、仅依赖 Latent 的 VAE。剩下的只是一个实验性的二合一工具,而不是一个已被解决的瓶颈。
依赖项与文件
MiniMax-H3-X2-Detail-v1.safetensors,即 5.2 GB 的 checkpoint,放入ComfyUI/models/vae/。- ComfyUI-MiniMaxH3_LatentUpscaler 提供
MiniMax H3 VAE Decode (fast),是 2X 工作流的必填项。 ComfyUI-H3-X2-Detailed.zip为引用路径添加可选的MiniMax H3 VAE 2X (Detailed Upscale)节点。H3_VAE_Detailed_and_2X_VAE_2in1.json是示例工作流。
获取方式
权重与资产: speach1sdef178/MiniMax-H3-X2-Detail-VAE
ComfyUI 文件: MiniMax-H3-X2-Detail-v1.safetensors,位于 models/vae/
必需的节点包: TripleHeadedMonkey/ComfyUI-MiniMaxH3_LatentUpscaler
基础模型: MiniMaxAI/MiniMax-H3
评论
使用 GitHub 登录后即可参与讨论。