MiniMax H3 2x Latent 放大模型与 ComfyUI 节点
Mamad8 为 MiniMax H3 发布了一款 2x 干净 Latent 放大模型,配备两个 ComfyUI 节点,可在 VAE 解码之前将空间分辨率提升一倍,同时保持在 Latent 空间中。
Mamad8 于 8 月 8 日为 MiniMax H3 发布了一款 2× Latent 放大模型,同时提供了一对精简的 ComfyUI 节点(模型卡片、自定义节点)。该模型可将已完成 denoise 的 H3 视频 Latent 的空间尺寸提升一倍,因此工作流可以保持在 Latent 空间中,而无需承担 VAE 解码 → 像素调整大小 → VAE 重新编码的往返开销。
它是什么
这不是传统的图像或视频放大模型。它不会让已完成渲染的画面变得更加锐利,直接解码其输出可能看起来比原始画面更柔和。它的用途是将干净的 H3 视频 Latent 快速移动到 2× 更大的空间 Latent 网格上,以便高分辨率续写或第二次采样可以在更大的画布上进行。
- 仅将空间 Latent 尺寸提升一倍;时间长度保持不变。
- 通过配套节点使用时,H3 联合视频/音频 Latent 中的音频流会原样保留。
- 仅接受干净的 Latent:不支持将其应用于中间含噪波的 Latent。
训练方式
训练数据对由干净的 H3 Latent 构建:每个低分辨率 Latent 都通过 H3 VAE 解码,在像素空间中使用 Lanczos 放大 2×,然后以确定性方式重新编码,以提供教师 Latent。该轻量级网络在双线性 Latent 插值的基础上,利用 Latent 与解码器感知重建、SSIM、空间一致性和时间一致性损失学习校正项。H3 生成器本身未经过训练,也未被修改。
ComfyUI 使用方法
- 将
ComfyUI-H3-Latent-Upscaler-Mamad8克隆到ComfyUI/custom_nodes/中,然后重新启动 ComfyUI。无需额外的 Python 包。 - 将
h3_clean_latent_upscaler_v1_mamad8.safetensors(约 56 MB)下载到ComfyUI/models/h3_latent_upscalers/中。
该节点包提供两个节点:Load H3 Latent Upscaler 和 Upscale Clean H3 Latent 2x。将应用节点放置在采样完成之后、正常 VAE 解码之前:
H3 sampler → Upscale Clean H3 Latent 2x → VAE Decode例如,为 672×384 生成的干净 Latent 经过 2× Latent 放大后,可以在 1344×768 下解码。帧数和音频保持不变。在放大之后继续对 H3 进行 denoise 需要显式的重新加噪和高分辨率续写工作流,该功能被有意排除在这两个节点之外。
该仓库附带一个默认工作流,使用零依赖的 ComfyUI 核心视频与 VAE 节点:
社区反馈
Banodoco 社区成员当天就开始测试。RuneX 运行了一个两遍采样流程:先在低分辨率下进行完整的 25 步第一遍,再进行 2× Latent 放大,然后进行 8 步第二遍,并报告称音频明显更加丰富(测试记录)。mamad8 指出,此次发布在某种程度上抢先于 MiniMax 本身预计将为 H3 推出的官方放大模型。
对于采样器之间的放大(在单个工作流内重新加噪 + 第二遍),Tr1dae 的 ComfyUI-MiniMaxH3_LatentUpscaler 采用了不同的方法,通过 audio_denoise 控制参数来决定重新混入多少第一遍的音频。
评论
使用 GitHub 登录后即可参与讨论。