MiniMax H3 Image VAE : décodage direct d'image depuis un seul latent

ComfyUI Wikinews

Mamad8 publie un VAE MiniMax H3 expérimental spécialisé dans l'image qui décode un seul latent temporel T=1 directement en une image, aucun nœud personnalisé requis.

Mamad8 a publié un VAE MiniMax H3 expérimental spécialisé dans l'image sur Hugging Face, partagé sur Reddit le 9 août. Le checkpoint décode un seul latent temporel (T=1) directement en une image, offrant un chemin d'image direct à latent unique utilisable pour le format latent à 24 canaux de H3. Il est distribué sous forme de checkpoint VAE H3 fusionné standard, donc aucun nœud personnalisé ni tête de décodage séparée n'est requis.

Images sources (gauche) et reconstructions VAE (droite)

Ce que c'est et ce que ce n'est pas

La fiche du modèle est explicite sur les compromis :

  • Images uniquement. Le décodeur spécialisé dans l'image dégrade considérablement la reconstruction vidéo multi-images et peut introduire des effets fantômes en grille de patchs ainsi qu'un mélange inter-images. Il ne doit donc pas remplacer le VAE H3 original dans les flux de travail vidéo.
  • Qualité limitée. Les sorties peuvent manquer de netteté et perdre les textes fins, les contours minces, les cheveux, le feuillage et la microtexture. L'image d'exemple ci-dessus montre le résultat réel sans impliquer de garantie de qualité : il s'agit d'un chemin utilitaire, pas d'une garantie de fidélité.

Son objectif est d'offrir à H3 un aller-retour d'image unique fonctionnel, ce qui importe pour les flux de travail qui souhaitent inspecter ou modifier un latent H3 sous forme d'image.

Comment il a été entraîné

L'encodeur H3 original a été figé pendant que le décodeur complet et post_quant_conv étaient affinés pour reconstruire l'image source réelle directement à partir d'un latent temporel H3. L'entraînement a utilisé un curriculum progressif de 256→384 px sur 51 083 images uniques (41 259 images Booru Essence et 9 824 photographies pseudo-caméra) avec un objectif tenant compte du décodeur combinant les pertes de reconstruction Charbonnier, de contours, de SSIM et de FDL/FDL-PIPS à faible poids. Le décodeur sélectionné de l'étape 1597 a été fusionné dans le checkpoint VAE H3 standard, de sorte qu'il se charge via les outils VAE H3 habituels.

Sur un ensemble inédit équilibré de 512 px (32 photos + 32 images artistiques), le checkpoint a mesuré 30,44 dB PSNR, 0,939 SSIM et 0,0168 MAE ; les vérifications de déploiement entre ~1 et 3 mégapixels ont atteint un PSNR de 31,55 à 33,43 dB.

Utilisation avec ComfyUI

  1. Téléchargez minimax_h3_t1_image_vae_step1597.safetensors (~5,2 Go) dans ComfyUI/models/vae/
  2. Chargez-le avec le nœud Charger VAE standard et utilisez les nœuds d'encodage et de décodage VAE habituels
  3. Le modèle attend le format latent à 24 canaux de MiniMax H3 et est conçu pour les allers-retours d'image unique (T=1)

Disponibilité

Le checkpoint est disponible sur Hugging Face. Il s'associe à l'upscaler latent 2× publié précédemment par Mamad8 pour les flux de travail dans l'espace latent de H3.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 Image VAE : décodage direct d'image depuis un seul latent | ComfyUI Wiki