MiniMax H3 Motion Adapter : Mouvement réel 240fps pour action rapide

ComfyUI Wikinews

MATLOWAI publie un adaptateur de mouvement de rang 16 pour le passage dé-rope H3 de ComfyUI-MAINodes, entraîné sur des images 240fps, plus les nœuds Repair/Splice et DyRoPE.

MiniMax-H3 Motion Adapter (Hugging Face | GitHub) est un LoRA de rang-16 qui fait fonctionner correctement le passage de dé-rope dans ComfyUI-MAINodes sur les mouvements rapides. La mise à jour suivante temporal-expansion ladder réentraîne la même recette contre des images réelles du jeu de données public GOPRO_Large 240 fps, réduisant l'erreur de token retenu d'environ la moitié par rapport à une interpolation simple.

Le problème

Le Motion Lab de MAINodes régénère la portion rapide d'un clip MiniMax H3 sur une horloge étirée (le « dé-rope ») et la récupère vers le temps réel. Sur un mouvement très rapide, le modèle de base produit trop : le résultat alterne entre avance et coupure image par image, et le passage invente environ 40 % de mouvement en plus que ce que la prise de vue demandait (taux mesuré 1,416 au lieu de 1,0).

L'adaptateur de mouvement est un delta de poids de rang-16 simple : aucun calcul supplémentaire, aucun nœud personnalisé requis. Il a été entraîné exactement sur cette tâche : isoler les images à l'intérieur d'une rafale de mouvement, garder le reste comme contexte propre, et prédire les tokens retenus. L'horloge supplémentaire provient toujours des nœuds de dé-rope ; le LoRA change simplement la façon dont le modèle se comporte sur cette horloge étirée.

Mesuré sur quatre clips que l'adaptateur n'a jamais vus pendant l'entraînement (combat, anneau d'épée anime, échange de personnage, gros plan de dialogue), contre le même graphique sans l'adaptateur :

  • l'alternance avance/coupure est passée de 0,370 à 0,134 et la production excessive image par image de ~1,4× à ~1,01× (rendu 63,6 s → 49,9 s sur la même portion) ;
  • choix opérateur aveugle, adaptateur vs pas d'adaptateur, même graine : 7 pour, 0 contre, 1 sans préférence ;
  • il se transfère au checkpoint Ref2VA, donc un fichier sert à la fois aux graphiques fl2va et ref2va.

La comparaison ci-dessous montre la plaque source, le passage étiré du modèle de base et le passage de l'adaptateur côte à côte :

Sans l'adaptateur, les combattants avancent et coupent image par image ; avec lui (bas-droite), ils continuent de bouger à la vitesse demandée par la prise de vue.

L'échelle d'expansion temporelle

La publication suivante (2026-08-24) réentraîne la même construction rang-16, attention uniquement, contre des images intermédiaires réelles : fenêtres découpées du jeu de deblur public GOPRO_Large (source 240 fps), décimée à la fréquence d'images de travail et ré-expansée, afin que les tokens retenus soient notés contre des images qu'une caméra réelle a effectivement capturées. L'horloge mondiale dans l'entraînement est véridique : chaque token est étiqueté avec le temps réel qu'il couvre.

Chaque 25ème étape d'entraînement est publiée (temporal_expansion/step025step375, plus warm100, 63 Mo chacune). Erreur de token retenu, scènes que l'adaptateur n'a jamais vues (baseline sans adaptateur 1,23, interpolation simple 0,26) :

Étape25100175250375
Erreur0,1580,1330,1160,1050,086

La courbe ne tourne jamais, mais les chiffres et l'œil ne sont pas d'accord sur où s'arrêter : l'étape 100 est le choix de lecture (mouvement rapide lisse, le clip semble encore être lui-même), tandis que l'étape 375 mesure le mieux mais peut sembler trop lisse. Sur une sonde de contenu statique, la famille n'invente pas de mouvement : elle se situe sous le plancher d'interpolation plutôt qu'au-dessus.

Mise à jour MAINodes

La même mise à jour ajoute de nouveaux nœuds alpha à ComfyUI-MAINodes (2026-08-24) : H3 Repair Plan / Repair Splice (rerendre une mauvaise plage d'images, aligné sur des tokens entiers, régénérer à travers la coupe de prise de vue la plus proche, recoller tout le reste bit-exact), H3 DyRoPE (préréglages d'horloge par bloc : blocs « fidélité temporelle » 30–49, « scintillement minimal » 40–49), gelage du préfixe audio sur H3 V2V Init, H3 Drift Control (les chaînes cessent de se délavent, les jonctions maintiennent 0,85–0,89 sur 4 liens), H3 Delta Color Carry (annule le fonçage aller-retour VAE), et un constructeur de deck de comparaison pour les pages de revue A/B.

Utilisation dans ComfyUI

Déposez un fichier dans models/loras/minimax_h3/ et chargez-le avec un LoraLoaderModelOnly standard à force 1,0 sur le modèle qui alimente le passage de dé-rope : pas le premier passage texte-vers-vidéo. Un graphique prêt est livré dans ComfyUI-MAINodes sous forme de examples/motion_pipeline_adapter_api.json.

Paramètres qui fonctionnent (issus de la carte du modèle) :

  • Force 1.0 est le paramètre de lisser ; 0,75 invente moins d'objets.
  • Inject est le bouton : 0,45 pour le personnage/dialogue où la base produit trop fortement ; 0,30 où l'identité ou les accessoires sont le livrable.
  • Gardez le guide de queue activé ; appliquez l'adaptateur uniquement au passage de dé-rope.
  • Bords rugueux : cela coûte environ 1 dB de fidélité d'ancre sur les images clés natives, corrige excessivement les chaînes calmes (gardez-le désactivé sur le contenu calme), et atténue la couleur forte / amincit les effets de particules : pire sur Ref2VA et les passages de clip complet.

L'adaptateur est sous licence MIT ; son utilisation avec le modèle de base est soumise à l'Accord de Licence Communautaire MiniMax H3.

Liens

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 Motion Adapter : Mouvement réel 240fps pour action rapide | ComfyUI Wiki