MiniMax H3 Latent Upscaler 3D: upscaling neuronal avec ComfyUI

ComfyUI Wikinews

LBH-123 publie un upscaler latent neuronal 3D pour MiniMax H3 avec nœuds ComfyUI: il agrandit les latents vidéo 24 canaux pour accélérer la génération en haute résolution.

Minimax H3 Latent Upscaler (Hugging Face | Nœuds personnalisés) est un upscaler neuronal de l'espace latent pour la génération vidéo MiniMax H3, publié par LBH-123 le 17 août 2026, avec deux nœuds personnalisés ComfyUI. Il met directement à l'échelle le latent VAE 24 canaux de H3, ce qui permet à la génération haute résolution d'éviter le coûteux aller-retour décodage → mise à l'échelle des pixels → ré-encodage.

Ce que c'est

Le modèle travaille directement sur les latents VAE 24 canaux de MiniMax H3 pour mettre à l'échelle la résolution spatiale (H × W) tout en préservant la dimension temporelle. Un réseau neuronal entraîné remplace l'interpolation latente bilinéaire/bicubique naïve, ce qui évite les artefacts de type fantôme et de double image introduits par une mise à l'échelle naïve.

Son objectif principal est d'accélérer la génération vidéo H3 haute résolution :

  1. Générer la vidéo en basse résolution : bien moins de tokens latents, beaucoup plus rapide.
  2. Mettre le latent à l'échelle directement avec l'upscaler entraîné.
  3. Rééchantillonner ou affiner à la résolution cible pour retrouver les détails.

En évitant le lent aller-retour décodage → mise à l'échelle des pixels → encodage via le lourd VAE de H3 (~5 milliards de paramètres), ce pipeline permet d'économiser une quantité considérable de temps de génération. Notez qu'il économise du temps, pas de VRAM : la passe d'affinage s'exécute toujours à la résolution cible, la mémoire maximale est donc comparable à une génération directe en haute résolution.

Le pack de nœuds personnalisés propose deux variantes de nœuds sous la catégorie video/MinimaxH3 :

  • Minimax H3 Latent Upscaler (2D) : un backbone ResBlock 2D avec des calques temporels de convolution 3D, léger et rapide, utilisant un simple facteur scale (1,0× à 4,0×).
  • Minimax H3 Latent Upscaler (3D) : un backbone entièrement en convolution 3D qui traite conjointement le volume spatio-temporel pour une meilleure cohérence temporelle, avec trois modes de redimensionnement dans un seul nœud : scale by multiplier, target dimensions et megapixels (avec alignement sur la grille de pixels et verrouillage du rapport hauteur/largeur).

Les deux nœuds ne prennent en charge que la mise à l'échelle (effective scale >= 1.0) et proposent une inférence fp32 / fp16 / bf16. Les mises à jour récentes ont ajouté une option enable_chunking pour les vidéos longues (avec fusion des bords des segments temporels), le déchargement automatique vers le CPU après l'exécution, et la prise en charge du backend ROCm (GPU AMD).

Exemples

Le référentiel fournit une comparaison de mise à l'échelle en vidéo et en image :

Comparaison de mise à l'échelle vidéo (cliquez pour lancer la lecture)

Comparaison de mise à l'échelle d'image

Comparaison de mise à l'échelle d'image

Utilisation avec ComfyUI

  1. Cloner Comfyui_Minimax_h3_latent_Upscaler dans ComfyUI/custom_nodes/, puis redémarrer ComfyUI. Aucun package Python supplémentaire n'est requis.
  2. Télécharger l'un des checkpoints (bf16 / fp16, ~691 Mo chacun, ou le .pth fp32) dans ComfyUI/models/latent_upscale_models/. Le chargeur détecte automatiquement l'architecture, un seul checkpoint fonctionne donc pour les nœuds 2D et 3D.

Flux de travail typique : [Low-res H3 Latent] → [H3 Latent Upscaler] → [Refine / Re-sample] → [VAE Decode]. Le pack de nœuds inclut des exemples de flux de travail I2V et R2V :

Le précédent upscaler latent H3 2x de Mamad8 cible des latents propres après échantillonnage ; cette version adopte une approche similaire dans l'espace latent, avec un backbone 3D plus lourd qui prend également en charge le redimensionnement direct vers des dimensions cibles et en mégapixels.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 Latent Upscaler 3D: upscaling neuronal avec ComfyUI | ComfyUI Wiki