Upscaler latent 2x entraîné pour MiniMax H3 avec nœuds ComfyUI
Tr1dae publie un upscaler 2x entraîné pour latents propres pour MiniMax H3 avec des nœuds ComfyUI, préservant l'audio intact. Tests : de 0,5 MP à 1080p en moins de 5 minutes.
Tr1dae a publié un upscaler 2× entraîné pour latents propres pour MiniMax H3, fourni sous forme de pack de nœuds personnalisé ComfyUI-MiniMaxH3_LatentUpscaler avec un checkpoint compagnon sur Hugging Face (h3_clean_latent_upscaler_film_epoch200.safetensors). Le nœud verrouille la mise à l'échelle à exactement 2× et fonctionne entièrement dans l'espace latent, de sorte qu'un flux de travail peut passer d'une première passe en basse résolution à une seconde passe en haute résolution sans quitter l'échantillonneur.
Ce que c'est
Contrairement à un upscaler conventionnel qui affine un rendu terminé, cet outil double les dimensions latentes spatiales entre les échantillonneurs MiniMax H3 : on commence par un rendu en petite taille et à faible coût, on met à l'échelle le latent propre 2×, puis on poursuit le denoising en pleine résolution.
- Ne double que les dimensions latentes spatiales ; la longueur temporelle est inchangée.
- Utilise un réseau 2× entraîné par défaut (
method=learned model), appris comme une correction sur l'interpolation latente bilinéaire par rapport à des latents enseignants upscalés en pixels/ré-encodés, avec des pertes adaptées au décodeur, SSIM, spatiales et temporelles. - Préserve le flux audio inchangé.
audio_denoiseréglé sur0verrouille entièrement l'audio de la passe 1 ;1permet à la passe 2 de le remixer complètement. Les valeurs intermédiaires ne sont pas prises en charge. - Effectue un re-bruitage CONST compatible NestedTensor à
sigmas[0], là où lesLatentUpscaleBy/AddNoisestandard cassent sur les latents audio-vidéo conjoints de MiniMax (video [B,24,T,H/16,W/16]+audio [B,32,2,T_audio]).
Le pack fournit plusieurs nœuds : MiniMax H3 Latent Upscale Combined (le nœud d'application principal), des assistants Latent Blur / Sharpen / Contrast qui préservent la norme, et un système Save / Load Package + Upscale Collect qui stocke les latents et le conditionnement de la passe 1 pour une mise à l'échelle de haute qualité différée avec une timeline HQ et une exportation MP4 / FCP7 XML.
Installation
cd ComfyUI/custom_nodes
git clone https://github.com/Tr1dae/ComfyUI-MiniMaxH3_LatentUpscalerLe checkpoint entraîné se télécharge automatiquement lors de la première exécution learned model (vérifié par SHA-256) dans ComfyUI/models/h3_latent_upscalers/. Le code de l'architecture est chargé depuis l'installation voisine ComfyUI-H3-Latent-Upscaler-Mamad8, également citée dans l'actualité sur l'upscaler latent 2×.
Résultats de la communauté
La communauté Banodoco effectue des benchmarks sur ce pack depuis la mi-août. foxydits rapporte que son flux de travail Seed Hunter (construit sur ce nœud) fait passer un rendu de base de 0,5 MP à 1080p en moins de 5 minutes sur une RTX 3090 (discord). DiXiao l'a combiné avec ComfyUI-MiniMax-H3-SPEED et le LoRA Turbo, produisant une vidéo de 10 secondes en 1344×768 en environ 150-180 secondes, la qualifiant de « meilleure que la méthode de mise à l'échelle standard utilisée par le nœud et presque aussi rapide » (discord).
Une comparaison issue des premiers tests Seed Hunter de foxydits montre la passe mise à l'échelle par rapport à l'original de 0,2 MP :
![]() | ![]() |
|---|---|
| 704×1216 upscalé par latent | Rendu original 0,2 MP |
Contexte
Cette sortie comble le vide laissé par l'upscaler H3 Regenerate-2K de MiniMax, que l'équipe a indiqué, lors d'une AMA, être encore en cours d'optimisation pour des raisons d'efficacité avant d'être publié en open source. En attendant, les upscalers latents de la communauté constituent la solution pratique, et le pack de Tr1dae ajoute une option basée sur un réseau entraîné par-dessus les approches antérieures fondées sur l'interpolation.


Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.