Upscaler latent 2x pour MiniMax H3 avec nœuds ComfyUI
Mamad8 publie un upscaler de latents propres 2x pour MiniMax H3 avec deux nœuds ComfyUI, doublant la résolution spatiale avant le décodage VAE tout en restant dans l'espace latent.
Mamad8 a publié un upscaler latent 2× pour MiniMax H3 le 8 août, accompagné d'une paire de nœuds ComfyUI minimaux (carte du modèle, nœuds personnalisés). Le modèle double les dimensions spatiales d'un latent vidéo H3 entièrement débruité, ce qui permet à un flux de travail de rester dans l'espace latent au lieu de payer un aller-retour décodage VAE → redimensionnement des pixels → ré-encodage VAE.
De quoi il s'agit
Ce n'est pas un upscaler d'image ou de vidéo conventionnel. Il ne rend pas un rendu terminé plus net, et un décodage direct de sa sortie peut sembler plus doux que l'original. Son but est de déplacer rapidement un latent vidéo H3 propre sur une grille latente spatiale 2× plus grande, afin qu'une continuation haute résolution ou un second passage d'échantillonnage puisse s'exécuter sur une toile plus grande.
- Double uniquement les dimensions latentes spatiales ; la longueur temporelle est inchangée.
- Utilisé via le nœud compagnon, le flux audio dans le latent vidéo/audio conjoint de H3 est préservé intact.
- N'accepte que des latents propres : son application à des latents intermédiaires bruités n'est pas prise en charge.
Comment il a été entraîné
Les paires d'entraînement ont été construites à partir de latents H3 propres : chaque latent basse résolution a été décodé avec le VAE H3, agrandi 2× dans l'espace pixel avec Lanczos, puis ré-encodé de manière déterministe pour fournir le latent enseignant. Le réseau léger a appris une correction par-dessus l'interpolation latente bilinéaire en utilisant des pertes de reconstruction tenant compte du latent et du décodeur, de SSIM, de cohérence spatiale et de cohérence temporelle. Le générateur H3 lui-même n'a pas été entraîné ni modifié.
Utilisation avec ComfyUI
- Clonez
ComfyUI-H3-Latent-Upscaler-Mamad8dansComfyUI/custom_nodes/et redémarrez ComfyUI. Aucun paquet Python supplémentaire n'est requis. - Téléchargez
h3_clean_latent_upscaler_v1_mamad8.safetensors(~56 Mo) dansComfyUI/models/h3_latent_upscalers/.
Le paquet de nœuds fournit deux nœuds : Load H3 Latent Upscaler et Upscale Clean H3 Latent 2x. Placez le nœud d'application après la fin de l'échantillonnage et avant le décodage VAE normal :
H3 sampler → Upscale Clean H3 Latent 2x → VAE DecodePar exemple, un latent propre produit pour 672×384 est décodé à 1344×768 après une mise à l'échelle latente 2×. Le nombre d'images et l'audio sont inchangés. Continuer le débruitage H3 après la mise à l'échelle nécessite un flux de travail explicite de re-bruitage et de continuation haute résolution, qui est volontairement laissé hors des deux nœuds.
Le référentiel fournit un flux de travail par défaut qui utilise les nœuds vidéo et VAE de base de ComfyUI, sans dépendances :
Notes de la communauté
Les membres de la communauté Banodoco ont commencé à le tester le jour même. RuneX a exécuté une configuration en deux passes : un premier passage complet de 25 étapes en basse résolution, une mise à l'échelle latente 2×, puis un second passage de 8 étapes, et a rapporté que l'audio ressortait nettement plus riche (notes de test). mamad8 a noté que cette publication devance partiellement un upscaler officiel que MiniMax devrait lui-même livrer pour H3.
Pour une mise à l'échelle entre échantillonneurs (re-bruitage + second passage dans un seul flux de travail), le ComfyUI-MiniMaxH3_LatentUpscaler de Tr1dae adopte une approche différente avec un contrôle audio_denoise pour déterminer quelle quantité de l'audio de la passe 1 doit être remixée.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.