H3 Motion Context v0.2.0 : enchaînement fluide de clips MiniMax H3
H3 Motion Context v0.2.0 enchaîne les clips MiniMax H3 : le mouvement et l'audio se poursuivent entre les coupes, avec le mode référence et une jonction sans couture.
H3 Motion Context a publié la v0.2.0 le 9 août. Le pack de nœuds personnalisés enchaîne les clips MiniMax H3 dans ComfyUI afin que le mouvement et l'audio se poursuivent réellement à travers la coupe : générez le clip A, transmettez ses dernières images et son audio au nœud, et le clip B reprend là où A s'est arrêté. Même mouvement, même vitesse, même direction, avec un audio poursuivi plutôt que re-synthétisé.
Nouveautés de v0.2.0
- Plus de couture visible. Avec
context_latentconnecté, les images épinglées sont découpées directement dans le latent du clip précédent au lieu d'être décodées en pixels puis ré-encodées. Pas de dérive de couleur, pas de saut de contraste à la jonction, et c'est plus rapide car cela évite un décodage, un redimensionnement et un passage VAE. - Le mode référence fonctionne avec l'enchaînement. Un graphique Ref2VA conserve désormais ses propres références d'images, de vidéos et d'audio pendant que l'audio de continuation est ajouté à leurs côtés. Auparavant, le nœud écrasait la liste de références, donc l'activation de l'enchaînement supprimait silencieusement toutes les références. La conception est de seitanism (du fil Banodoco MiniMax H3 seamless-extension), d'abord implémentée dans le fork de @ethanfel ; cette implémentation est indépendante mais crédite les deux.
- Fenêtre de contexte de 56 images, aux côtés de 5, 22 et 39.
- Deux paramètres au lieu de six.
context_lengthetaudio_context_length; le reste est constitué de constantes avec des valeurs par défaut claires. - L'audio épinglé s'aligne sur la grille audio, corrigeant un décalage d'un tiers de pas pour certaines combinaisons de fenêtre et de longueur de clip.
- Les correctifs s'installent à la première utilisation, pas à l'importation, et sont limités aux graphiques de ce pack, afin que les autres flux de travail H3 ne soient pas affectés.
- La résolution ne peut pas changer en cours de chaîne lors de l'utilisation de
context_latent: le nœud refuse et nomme les deux résolutions plutôt que de retomber silencieusement sur le chemin avec perte.
Fonctionnement
MiniMax H3 peut épingler une image à une coordonnée temporelle et la réinjecter à chaque étape d'échantillonnage ; le seul obstacle à l'enchaînement était une vérification dans ComfyUI qui rejetait toute image épinglée autre que la première ou la dernière. Le pack lève cette restriction avec un correctif à l'exécution (aucun fichier sur disque n'est modifié), et les correctifs vérifient leurs hypothèses par rapport au code ComfyUI en direct à chaque démarrage : un refus explicite vaut mieux qu'un rendu silencieusement erroné.
La partie la plus difficile est l'audio, puisque H3 génère l'image et le son ensemble : le nœud transporte le contexte audio du clip précédent afin que le segment suivant poursuive le même audio plutôt que de produire un son similaire.
Flux de travail
La version v0.2.0 est livrée avec un flux de travail combiné qui exécute à la fois les chemins fl2va et ref2va dans un seul graphique :
Disponibilité
Installez en déposant le dossier dans ComfyUI/custom_nodes/ puis en redémarrant. Notez que les valeurs des widgets ont changé dans 0.2.0 : les flux de travail enregistrés avec 0.1 chargeront les nombres dans les mauvais emplacements. Supprimez donc le nœud Motion Context et réajoutez-le. Exécutez également un seul pack d'enchaînement H3 à la fois : plusieurs packs lèvent la même restriction concernant la première/dernière image clé, et ce nœud refuse désormais de s'exécuter si un autre pack l'a déjà revendiquée.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.