MMH3 Ultimate Upscale : Vidéo H3 en mosaïque avec VRAM limitée
Un nœud ComfyUI agrandit les vidéos MiniMax H3 longues et haute résolution par tronçonnage temporel et mosaïque spatiale, VRAM bornée à une tuile. Variante expérimentale LTX-2.5.
Pourquoi cela compte
MiniMax H3 génère une vidéo comme un latent imbriqué qui regroupe 24 canaux vidéo et 32 canaux audio dans un seul tensor. Les nœuds de mise à l'échelle ComfyUI standards ne comprennent pas cette structure, et rééchantillonner un clip terminé à haute résolution provoque généralement un dépassement de mémoire sur les GPU plus petits : le Membre de la Communauté WiseDuck signale que le flux de travail d'upscaler H3 original manque instantanément de mémoire à 4 MP, tandis que le nœud en mosaïque atteint 2550×1920 (environ 5 MP) à 18 secondes sur la même machine : « Et je peux aller encore plus haut. Je n'ai simplement pas testé les limites encore. Je parie que la 4K est possible. »
Comment ça marche
MMH3 Ultimate Upscale enveloppe toute la boucle temporal split → latent upscale → spatial split → per-tile sampling → spatial stitch → temporal stitch dans un seul nœud :
- Tronçonnage temporel pour les vidéos longues. Un clip long est découpé en segments temporels chevauchants ; chaque segment est traité indépendamment et recousu ensemble. Une ancre frame-0 remplace la première image clé de chaque segment par la frame frontière rééchantillonnée du segment précédent (
anchor_strength, défaut 0.999), et les segments chevauchants sont mélangés avec un fondu linéaire pour que les transitions soient lisses plutôt que coupures nettes. - Mosaïque spatiale pour VRAM bornée. Chaque segment est divisé en tuiles et seule une tuile est échantillonnée à la fois. Les bandes de chevauchement partagées avec les voisins déjà recousus sont pré-remplies à partir du résultat accumulé et verrouillées avec un
noise_mask, afin que le rééchantillonnage soit autorisé à changer uniquement l'intérieur libre ; une écriture masquée garantit que la couture déjà cohérente n'est jamais écrasée. - Deux modes de mise à l'échelle. Le upscaler basé sur Modèle 3D H3 (
MMH3 Latent Upscale with Model Params, utilisant les points de contrôleminimax_h3_latent_upscaler_3d_*.safetensors), ou un chemin d'interpolation sans modèle (MMH3 Latent Upscale Params) qui redimensionne le latent spatialement sans modèle supplémentaire : imitant la fonction Mise à l'échelle Latente de ComfyUI tout en conservant la structure AV imbriquée. - Audio préservé. La partie audio du latent est transportée inchangée sur chaque segment et couture : elle n'est jamais rééchantillonnée.
- Gestion de modèle conviviale VRAM. Le upscaler 3D est reporté vers le CPU après chaque utilisation et le modèle de diffusion est déschargé pendant que le upscaler fonctionne, donc H3 et le upscaler ne sont jamais résidents en même temps.
- Étapes facultatives.
latent_upscale_param,temporal_split_parametspatial_split_paramsont tous facultatifs : laissez n'importe quel paramètre non connecté pour passer cette étape.
Prise en charge LTX-2.5 (expérimental)
Une mise à jour du 25 août ajoute un nœud expérimental LTX25 Ultimate Upscale construit sur le même pipeline, prenant en charge les latents audio-vidéo imbriqués LTX-2.5 (vidéo [B,128,T,H,W] + audio [B,C,time,freq]) dans un seul nœud : tronçonnage temporel → mise à l'échelle fixe 2× par modèle → interpolation vers la Résolution cible → tronçonnage spatial → échantillonnage par tuile → couture. Le README signale ces nœuds comme très expérimentaux : l'audio est toujours buggué, utilisez donc le latent audio original.
Installation
Installer via le Gestionnaire ComfyUI (Rechercher MMH3 Ultimate Upscale) ou Cloner dans ComfyUI/custom_nodes/ :
git clone https://github.com/bbaudio-2025/Comfyui-MMH3-UltimateUpscale.gitLe nœud s'appuie sur deux projets communautaires : Comfyui-MiniMax-H3-LatentSplit de bbaudio-2025 (tronçonnage temporel/spatial, mécanismes d'ancre et d'appendice) et Comfyui_Minimax_h3_latent_Upscaler de LBH-123-AI (le réseau upscaler 3D H3, couvert plus tôt ce mois-ci). L'exemple propre de l'upscaler ci-dessous montre le type de gain de détail que le chemin latent ajoute lors de la mise à l'échelle :
Exemple provenant de l'upscaler latent 3D H3 sous-jacent (LBH-123-AI).
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.