ComfyUI MiniMax H3图像VAE模型:直接单Latent图像解码

ComfyUI Wikinews

Mamad8发布实验性图像专用MiniMax H3 VAE,可直接将单个T=1时间Latent解码为图像,无需自定义节点。

Mamad8 在Hugging Face上发布了一款实验性图像专用MiniMax H3 VAE,并于8月9日在Reddit上分享。该checkpoint可将单个时间Latent(T=1)直接解码为一张图像,为H3 24通道Latent格式提供了一条可用的直接单Latent图像路径。模型以标准合并版H3 VAE checkpoint的形式分发,因此无需自定义节点或单独的解码头。

来源图像(左)与VAE重建结果(右)

它是什么,不是什么

模型卡片明确说明了其中的权衡:

  • 仅限图像。 图像专用解码器会显著降低多帧视频重建质量,并可能引入补丁网格重影和跨帧混合,因此不得在视频工作流中替代原始H3 VAE。
  • 质量有限。 输出可能偏柔和,丢失精细文字、细微轮廓、头发、植被和微纹理。上方的示例图像展示的是实际效果,而非质量保证。这是一条实用路径,而非保真度声明。

其用途在于为H3提供可行的单图像往返转换,这对于需要将H3 Latent作为图像检查或编辑的工作流而言至关重要。

训练方式

原始H3编码器被冻结,同时对完整解码器和post_quant_conv进行微调,使其能够直接从单个H3时间Latent重建真实来源图像。训练采用渐进式256→384像素课程,共使用51,083张独立图像(41,259张Booru Essence图像和9,824张伪相机照片),并结合了解码器感知的目标函数,包含Charbonnier重建损失、边缘损失、SSIM损失以及低权重FDL/FDL-PIPS损失。已选择的step-1597解码器被合并回标准H3 VAE checkpoint中,因此可通过常规H3 VAE工具加载。

在均衡的未见512像素测试集(32张照片加32张艺术图像)上,该checkpoint测得PSNR为30.44 dBSSIM为0.939MAE为0.0168;在约1至3百万像素的部署测试中,PSNR达到31.55–33.43 dB。

ComfyUI使用方法

  1. minimax_h3_t1_image_vae_step1597.safetensors(约5.2 GB)下载到ComfyUI/models/vae/目录
  2. 使用标准的加载VAE节点加载该模型,并使用常规的VAE编码/解码节点
  3. 该模型使用MiniMax H3的24通道Latent格式,专为单图像(T=1)往返转换而设计

获取方式

该checkpoint可在Hugging Face上获取。它与Mamad8此前发布的2× Latent放大器配合使用,适用于H3 Latent空间工作流。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
ComfyUI MiniMax H3图像VAE模型:直接单Latent图像解码 | ComfyUI Wiki