MiniMax H3 Latent Upscaler 3D: upscaling neuronal avec ComfyUI
LBH-123 publie un upscaler latent neuronal 3D pour MiniMax H3 avec nœuds ComfyUI: il agrandit les latents vidéo 24 canaux pour accélérer la génération en haute résolution.
Ce que c'est
Le modèle travaille directement sur les latents VAE 24 canaux de MiniMax H3 pour mettre à l'échelle la résolution spatiale (H × W) tout en préservant la dimension temporelle. Un réseau neuronal entraîné remplace l'interpolation latente bilinéaire/bicubique naïve, ce qui évite les artefacts de type fantôme et de double image introduits par une mise à l'échelle naïve.
Son objectif principal est d'accélérer la génération vidéo H3 haute résolution :
- Générer la vidéo en basse résolution : bien moins de tokens latents, beaucoup plus rapide.
- Mettre le latent à l'échelle directement avec l'upscaler entraîné.
- Rééchantillonner ou affiner à la résolution cible pour retrouver les détails.
En évitant le lent aller-retour décodage → mise à l'échelle des pixels → encodage via le lourd VAE de H3 (~5 milliards de paramètres), ce pipeline permet d'économiser une quantité considérable de temps de génération. Notez qu'il économise du temps, pas de VRAM : la passe d'affinage s'exécute toujours à la résolution cible, la mémoire maximale est donc comparable à une génération directe en haute résolution.
Le pack de nœuds personnalisés propose deux variantes de nœuds sous la catégorie video/MinimaxH3 :
- Minimax H3 Latent Upscaler (2D) : un backbone ResBlock 2D avec des calques temporels de convolution 3D, léger et rapide, utilisant un simple facteur
scale(1,0× à 4,0×). - Minimax H3 Latent Upscaler (3D) : un backbone entièrement en convolution 3D qui traite conjointement le volume spatio-temporel pour une meilleure cohérence temporelle, avec trois modes de redimensionnement dans un seul nœud :
scale by multiplier,target dimensionsetmegapixels(avec alignement sur la grille de pixels et verrouillage du rapport hauteur/largeur).
Les deux nœuds ne prennent en charge que la mise à l'échelle (effective scale >= 1.0) et proposent une inférence fp32 / fp16 / bf16. Les mises à jour récentes ont ajouté une option enable_chunking pour les vidéos longues (avec fusion des bords des segments temporels), le déchargement automatique vers le CPU après l'exécution, et la prise en charge du backend ROCm (GPU AMD).
Exemples
Le référentiel fournit une comparaison de mise à l'échelle en vidéo et en image :
Comparaison de mise à l'échelle vidéo (cliquez pour lancer la lecture)
Comparaison de mise à l'échelle d'image
Utilisation avec ComfyUI
- Cloner
Comfyui_Minimax_h3_latent_UpscalerdansComfyUI/custom_nodes/, puis redémarrer ComfyUI. Aucun package Python supplémentaire n'est requis. - Télécharger l'un des checkpoints (bf16 / fp16, ~691 Mo chacun, ou le
.pthfp32) dansComfyUI/models/latent_upscale_models/. Le chargeur détecte automatiquement l'architecture, un seul checkpoint fonctionne donc pour les nœuds 2D et 3D.
Flux de travail typique : [Low-res H3 Latent] → [H3 Latent Upscaler] → [Refine / Re-sample] → [VAE Decode]. Le pack de nœuds inclut des exemples de flux de travail I2V et R2V :
Le précédent upscaler latent H3 2x de Mamad8 cible des latents propres après échantillonnage ; cette version adopte une approche similaire dans l'espace latent, avec un backbone 3D plus lourd qui prend également en charge le redimensionnement direct vers des dimensions cibles et en mégapixels.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.