ComfyUI MiniMax H3图像VAE模型:直接单Latent图像解码
Mamad8发布实验性图像专用MiniMax H3 VAE,可直接将单个T=1时间Latent解码为图像,无需自定义节点。
Mamad8 在Hugging Face上发布了一款实验性图像专用MiniMax H3 VAE,并于8月9日在Reddit上分享。该checkpoint可将单个时间Latent(T=1)直接解码为一张图像,为H3 24通道Latent格式提供了一条可用的直接单Latent图像路径。模型以标准合并版H3 VAE checkpoint的形式分发,因此无需自定义节点或单独的解码头。
它是什么,不是什么
模型卡片明确说明了其中的权衡:
- 仅限图像。 图像专用解码器会显著降低多帧视频重建质量,并可能引入补丁网格重影和跨帧混合,因此不得在视频工作流中替代原始H3 VAE。
- 质量有限。 输出可能偏柔和,丢失精细文字、细微轮廓、头发、植被和微纹理。上方的示例图像展示的是实际效果,而非质量保证。这是一条实用路径,而非保真度声明。
其用途在于为H3提供可行的单图像往返转换,这对于需要将H3 Latent作为图像检查或编辑的工作流而言至关重要。
训练方式
原始H3编码器被冻结,同时对完整解码器和post_quant_conv进行微调,使其能够直接从单个H3时间Latent重建真实来源图像。训练采用渐进式256→384像素课程,共使用51,083张独立图像(41,259张Booru Essence图像和9,824张伪相机照片),并结合了解码器感知的目标函数,包含Charbonnier重建损失、边缘损失、SSIM损失以及低权重FDL/FDL-PIPS损失。已选择的step-1597解码器被合并回标准H3 VAE checkpoint中,因此可通过常规H3 VAE工具加载。
在均衡的未见512像素测试集(32张照片加32张艺术图像)上,该checkpoint测得PSNR为30.44 dB、SSIM为0.939、MAE为0.0168;在约1至3百万像素的部署测试中,PSNR达到31.55–33.43 dB。
ComfyUI使用方法
- 将
minimax_h3_t1_image_vae_step1597.safetensors(约5.2 GB)下载到ComfyUI/models/vae/目录 - 使用标准的加载VAE节点加载该模型,并使用常规的VAE编码/解码节点
- 该模型使用MiniMax H3的24通道Latent格式,专为单图像(
T=1)往返转换而设计
获取方式
该checkpoint可在Hugging Face上获取。它与Mamad8此前发布的2× Latent放大器配合使用,适用于H3 Latent空间工作流。
评论
使用 GitHub 登录后即可参与讨论。