MiniMax H3 训练版 2x Latent Upscaler 发布,随附 ComfyUI 节点
Tr1dae 为 MiniMax H3 发布了一款经过训练的干净 Latent 2x 放大器,配有 ComfyUI 节点,可在 sampler 之间保持音频不变。社区测试:0.5MP 到 1080p 不到 5 分钟。
Tr1dae 为 MiniMax H3 发布了一款经过训练的干净 Latent 2× 放大器,打包为 ComfyUI-MiniMaxH3_LatentUpscaler 自定义节点包,并在 Hugging Face 上提供了配套 checkpoint(h3_clean_latent_upscaler_film_epoch200.safetensors)。该节点将图像放大硬锁定为恰好 2×,并且完全在 Latent 空间中运行,因此工作流可以从低分辨率第一遍过渡到高分辨率第二遍,而无需离开 sampler。
它是什么
与传统的、对已完成渲染进行锐化的放大器不同,此工具在 MiniMax H3 sampler 之间 将空间 Latent 尺寸加倍:先以低分辨率低成本渲染,对干净 Latent 执行 2× upscale,然后以全分辨率继续 denoise。
- 仅加倍 空间 Latent 维度;时间长度不变。
- 默认使用 经过训练的 2× 网络(
method=learned model),该网络作为对双线性 Latent 插值的校正,对照像素放大后/重新编码的教师 Latent 学习,并包含解码器感知、SSIM、空间和时间损失。 - 保持音频流不变。
audio_denoise设为0会完全锁定第一遍的音频;设为1则让第二遍完全重新混音。不支持中间值。 - 在
sigmas[0]处执行 NestedTensor 感知的 CONST 重新加噪:内置的LatentUpscaleBy/AddNoise在 MiniMax 的联合音频-视频 Latent(video [B,24,T,H/16,W/16]+audio [B,32,2,T_audio])上会失效。
该节点包包含多个节点:MiniMax H3 Latent Upscale Combined(主要的应用节点)、保持范数的 Latent Blur / Sharpen / Contrast 辅助节点,以及一个 Save / Load Package + Upscale Collect 系统,用于暂存第一遍的 Latent 和条件,以便后续通过 HQ 时间线以及 MP4 / FCP7 XML 导出进行高质量放大。
安装
cd ComfyUI/custom_nodes
git clone https://github.com/Tr1dae/ComfyUI-MiniMaxH3_LatentUpscaler训练好的 checkpoint 会在首次运行 learned model 时自动下载(SHA-256 校验)到 ComfyUI/models/h3_latent_upscalers/。架构代码从同级的 ComfyUI-H3-Latent-Upscaler-Mamad8 安装中加载,此前的 2× Latent Upscaler 新闻 也引用了它。
社区测试结果
Banodoco 社区自 8 月中旬以来一直在对其做基准测试。foxydits 报告称,他的 Seed Hunter 工作流(基于此节点构建)可在 RTX 3090 上,将 0.5 MP 的底图渲染到 1080p,耗时不到 5 分钟(Discord)。DiXiao 将其与 ComfyUI-MiniMax-H3-SPEED 和 Turbo LoRA 结合,生成了 10 秒的 1344×768 视频,大约耗时 150-180 秒,并称其“比该节点原本使用的标准放大方法更好,速度几乎一样快”(Discord)。
来自 foxydits 早期 Seed Hunter 测试的对比显示了放大后的结果与 0.2 MP 原始画面的对比:
![]() | ![]() |
|---|---|
| Latent 放大后的 704×1216 | 原始 0.2 MP 渲染 |
背景
此次发布填补了 MiniMax 自家 H3 Regenerate-2K 放大器留下的空白。团队在 AMA 中表示,该放大器在开源之前仍在进行效率优化。与此同时,社区 Latent 放大器是切实可行的解决方案,而 Tr1dae 节点包在早期基于插值的方法之上,增加了经过训练的网络选项。


评论
使用 GitHub 登录后即可参与讨论。