MiniMax H3 Latent Upscaler 3D:使用ComfyUI自定义节点进行神经Latent放大
ComfyUI Wikinews
LBH-123发布了用于MiniMax H3的3D卷积神经Latent放大器,配备ComfyUI自定义节点,可就地放大24通道视频Latent,从而加速高分辨率生成。
Minimax H3 Latent Upscaler(Hugging Face | 自定义节点)是LBH-123于2026年8月17日发布的用于MiniMax H3视频生成的Latent空间神经放大器,并附带一对ComfyUI自定义节点。它直接放大24通道的H3 VAE Latent,因此高分辨率生成可以跳过昂贵的解码→像素放大→重新编码往返过程。
它是什么
该模型直接作用于MiniMax H3的24通道VAE Latent,在保留时间维度的同时放大空间分辨率(H × W)。经过训练的神经网络取代了简单的双线性/双三次Latent插值,避免了简单放大带来的重影和双重图像伪影。
其主要目的是加速高分辨率H3视频生成:
- 以低分辨率生成视频:Latent token数量少得多,速度也快得多。
- 使用训练好的放大器就地放大Latent。
- 在目标分辨率下重新采样或细化,以恢复细节。
通过跳过H3庞大的约50亿参数VAE中缓慢的解码→像素放大→编码往返过程,该流程可以节省大量生成时间。请注意,它节省的是时间,而不是显存:细化过程仍在目标分辨率下运行,因此峰值内存与直接生成高分辨率视频相当。
该自定义节点包在video/MinimaxH3类别下提供了两个节点变体:
- Minimax H3 Latent Upscaler(2D):2D ResBlock主干网络,带有时间维3D卷积层,轻量且快速,使用简单的
scale缩放系数(1.0倍到4.0倍)。 - Minimax H3 Latent Upscaler(3D):完全3D卷积的主干网络,联合处理整个时空体,以获得更强的时间连贯性,一个节点内置三种调整大小模式:
scale by multiplier(按倍数缩放)、target dimensions(目标尺寸)和megapixels(百万像素),并支持像素网格对齐和宽高比锁定。
两个节点都仅支持放大(effective scale >= 1.0),并提供fp32 / fp16 / bf16推理。最近的更新新增了用于长视频的enable_chunking开关(带时间分块边缘混合)、执行后自动CPU卸载,以及ROCm(AMD GPU)后端支持。
示例
该仓库附带了一个视频放大对比和一个图像放大对比:
视频放大对比(点击播放)
图像放大对比
ComfyUI使用方法
- 将
Comfyui_Minimax_h3_latent_Upscaler克隆到ComfyUI/custom_nodes/中,然后重新启动ComfyUI。无需额外的Python包。 - 将其中一个模型(bf16 / fp16,每个约691 MB,或fp32
.pth)下载到ComfyUI/models/latent_upscale_models/中。加载器会自动检测架构,因此一个模型即可同时用于2D和3D节点。
典型工作流:[Low-res H3 Latent] → [H3 Latent Upscaler] → [Refine / Re-sample] → [VAE Decode]。节点包中包含I2V和R2V示例工作流:
此前由Mamad8发布的H3 2倍Latent放大器针对采样后干净的Latent;本次发布采用了类似的Latent空间方法,但使用了更重型的3D主干网络,还支持直接按目标尺寸和百万像素调整大小。
评论
使用 GitHub 登录后即可参与讨论。