ComfyUI MiniMax H3 SPEED V2 : résolution progressive

ComfyUI Wikinews

ComfyUI-MiniMax-H3-SPEED V2 ajoute Euler, Heun, DPM2 et RES Multistep, un Sigma Harvest conscient de l'échantillonneur, et corrige le redimensionnement des images clés I2V.

ComfyUI-MiniMax-H3-SPEED répartit une exécution d'échantillonnage MiniMax H3 sur plusieurs résolutions : les premières étapes, les plus bruitées, s'exécutent sur une grille basse résolution peu coûteuse, puis la grille est agrandie à mesure que les détails plus fins commencent à compter. La version 2 supprime la restriction à Euler uniquement, rend la calibration consciente de l'échantillonneur et corrige le redimensionnement des images clés qui rendait les exécutions image-to-video plus floues après chaque transition.
Trois images d'un même clip : référence pleine résolution, 3 étapes et 4 étapes

Même graine et même prompt, 960x544 à 24 fps, 10,125 s. Gauche : référence pleine résolution, sans SPEED (571,49 s). Milieu : 3 étapes à delta 0,005 (438,85 s). Droite : 4 étapes à delta 0,05 (237,57 s).

Comment SPEED découpe la planification

MiniMax H3 paie le coût spatial complet à chaque étape de débruitage, y compris les premières où le latent est dominé par le bruit et où aucun détail haute fréquence n'existe encore. SPEED déplace ces étapes vers une grille plus petite puis remonte progressivement : l'échantillonneur débruit à une fraction de la résolution cible, puis fait passer le latent vers une grille plus grande pour les étapes restantes.

Le nœud fournit trois échelles automatiques, sélectionnées par une seule valeur stages :

stagesÉchelle de résolution
20.5 à 1.0
30.33 à 0.66 à 1.0
40.25 à 0.5 à 0.75 à 1.0

Tolérance (Delta), noise_amplitude et noise_decay_exponent décident du moment de chaque transition ; les valeurs par défaut fournies proviennent de l'ajustement de calibration de l'auteur lui-même, et le README recommande de ne pas y toucher sauf si vous lancez une calibration Harvest. Les bandes haute fréquence exposées par une augmentation de résolution sont remplies à partir d'un champ gaussien déterministe, initialisé par la transition, sous la politique de bruit direct_coarse par défaut. Une seconde politique, coupled_full_grid, dérive ces bandes d'un unique champ de bruit pleine résolution ; l'auteur n'a pas confirmé qu'elle améliore la qualité et ce n'est pas la valeur par défaut.

SPEED s'applique uniquement à MiniMax H3, et le flux audio de H3 reste toujours en pleine résolution.

Ce qui a changé dans la V2

Le CHANGELOG.md du référentiel liste cette version comme 2.0.0. Les changements substantiels :

  • Prise en charge des échantillonneurs. SPEED n'est plus lié à Euler. La V2 accepte Euler, Heun, DPM2, Exp Heun 2 X0 et RES Multistep. Les échantillonneurs sans état utilisent les objets échantillonneurs propres à ComfyUI ; RES Multistep conserve l'historique des étapes précédentes, donc la V2 l'exécute via un adaptateur limité à l'exécution et efface cet état chaque fois que SPEED change de résolution, plutôt que de transporter l'historique vers un latent de taille différente.
  • Sigma Harvest conscient de l'échantillonneur. Le nœud de calibration rapporte désormais les paramètres de l'échantillonneur que vous avez réellement sélectionné au lieu de supposer Euler, et il utilise par défaut la même tolérance de 0,005 que le chemin automatique.
  • Planification unifiée. Les modes Automatique et Manuel partagent une seule implémentation de planification et de validation. Le mode Automatique calcule désormais les transitions à partir du planning sigma en direct et des dimensions du latent en cours.
  • Correction des images clés I2V. Les latents d'images clés sont redimensionnés depuis leur copie pleine résolution d'origine au lieu de redimensionner un tenseur déjà redimensionné, et ils sont restaurés avant l'étape finale ainsi qu'après une exécution en échec. Résumé de l'auteur : l'image-to-video ne devrait plus devenir progressivement plus floue à chaque changement de résolution.
  • Mémoire Harvest allégée. La V1 conservait chaque tenseur résiduel pleine résolution jusqu'à la fin de l'exécution et les analysait ensuite. La V2 réduit chaque résiduel à un petit profil de puissance DCT radial dans le callback et jette le tenseur.
  • Progression et aperçus continus. Une exécution SPEED est désormais rapportée comme une seule génération au lieu de plusieurs appels d'échantillonneur sans lien.
  • Couverture de régression élargie à la sélection des échantillonneurs, à l'état RES, à l'I2V, aux transitions, à Harvest, aux flux de travail et aux politiques de bruit.

Accélérations mesurées

Le référentiel publie un dossier de preuves contenant les temps qui étayent ces affirmations : une RTX 5080 avec 128 Go de RAM système, une sortie 960x544 à 24 fps pendant 10,125 secondes, même graine et même prompt sur chaque ligne. La référence Euler pleine résolution est de 571,49 s.

Tolérance (Delta)2 étapes3 étapes4 étapes
0.005462,96 s (1,23x)438,85 s (1,30x)435,21 s (1,31x)
0.010450,38 s (1,27x)409,83 s (1,39x)384,13 s (1,49x)
0.050278,44 s (2,05x)262,32 s (2,18x)237,57 s (2,41x)

Le même dossier énonce clairement les limites de ces chiffres. Il s'agit d'un ensemble de référence Euler uniquement : ils n'établissent pas la parité de vitesse ou de qualité pour les quatre échantillonneurs ajoutés par la V2, et ils ne doivent pas être lus comme la preuve qu'une politique de bruit en surpasse une autre. La consigne de l'auteur est de relancer la calibration Harvest et de comparer votre propre combinaison d'échantillonneur, de modèle et de scheduler.

Les trois nœuds

NœudCe qu'il fait
Nœud SPEED principal (Automatique)Choisit l'échelle à 2, 3 ou 4 étapes et gère les transitions depuis le planning sigma en direct
Échantillonneur SPEED (Parcours pas à pas, Manuel)Jusqu'à quatre paires explicites (goal, resolution) ; ratio_mode traite un objectif comme un index d'étape global (steps) ou comme une fraction de 0 à 1 de la planification (ratio). Les résolutions actives doivent augmenter et la dernière doit être 1.0
Sigma HarvestS'exécute avec votre flux de travail existant pour mesurer l'échantillonneur que vous comptez utiliser, et renvoie les valeurs sampler_name, delta, noise_amplitude et noise_decay_exponent à copier dans le nœud correspondant

L'installation consiste à cloner le package dans ComfyUI/custom_nodes/ puis à redémarrer. Dans un flux de travail, remplacez SamplerCustomAdvanced par le nœud échantillonneur SPEED et connectez les mêmes entrées noise, guider, sigmas et latent_image ; un KSampler tout-en-un doit d'abord être scindé en composants d'échantillonnage avancés de ComfyUI.

Flux de travail

Le référentiel fournit trois flux de travail au format frontend. La variante calculée exécute Sigma Harvest à l'intérieur du graphique afin que les valeurs de calibration arrivent automatiquement ; la variante manuelle expose l'échelle pour un réglage manuel.

Le flux de travail calculé encapsule un graphique H3 image-to-video dans un sous-graphique et règle l'échantillonneur SPEED sur stages = 3, direct_coarse, delta = 0.005, noise_amplitude = 12.105, noise_decay_exponent = 0.773, seed_offset = 10000 et sampler = euler. Ses notes pointent vers le checkpoint fl2va convrot int8 élagué, l'encodeur de texte nvfp4 Qwen3-VL 32B et les VAE vidéo et audio séparés de H3.

Disponibilité

Le référentiel avait accumulé 85 étoiles au moment de la rédaction. Le fil d'annonce s'est déroulé dans r/comfyui, et une grande partie des discussions demandait des sorties côte à côte plutôt que le tableau de temps ; l'auteur a orienté les lecteurs vers le dossier de preuves et vers une comparaison de vitesse tierce distincte. Aucune reproduction indépendante de l'ensemble d'échantillonneurs de la V2 n'avait été publiée au moment de la rédaction.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
ComfyUI MiniMax H3 SPEED V2 : résolution progressive | ComfyUI Wiki