MiniMax H3 RefMods: adaptateurs sans entrainement

ComfyUI Wikinews

RefMods, des adaptateurs de conditionnement d'environ 1 Mo pour MiniMax H3 : encodez un personnage une fois, chargez-le comme un LoRA dans ComfyUI et reutilisez-le sans limite.

Un projet communautaire baptisé RefMods (Reference Latent Adapters) apporte une nouvelle façon de préserver la cohérence des personnages dans les vidéos MiniMax H3 : au lieu de fournir une image ou une vidéo de référence à chaque génération, vous encodez la référence une seule fois dans un petit fichier .safetensors (environ 1 Mo à 1,6 Mo), que vous chargez ensuite comme un LoRA dès que nécessaire. Le projet émane de l'utilisateur Reddit malcolmrey, qui a publié la bibliothèque complète des poids RefMods sur Hugging Face ainsi qu'un guide d'installation et d'utilisation.

Le côté ComfyUI est pris en charge par le pack de nœuds open source ComfyUI-MiniMaxH3Mod (MIT, 99 étoiles), qui extrait, charge et applique les RefMods via le chemin de conditionnement.

Flux de travail de l'éditeur RefMods

Ce que sont réellement les RefMods

Les RefMods sont des adaptateurs pré-encodés agissant au niveau du conditionnement : la référence (image, vidéo ou GIF) est encodée par VAE une seule fois, réduite à ses informations d'identité, puis enregistrée sous forme de fichier autonome. Lors de la génération, l'adaptateur est injecté directement dans le flux de conditionnement H3. Ainsi :

  • Aucun encodage VAE en direct d'une référence à chaque exécution
  • Aucune balise d'image positionnelle du type <Picture 1> dans les prompts
  • Aucune fuite de l'apparence de la référence vers des parties sans rapport avec la scène
  • Aucune boucle d'entraînement : l'extraction se fait en une seule passe, contrairement à l'entraînement LoRA

Le pack de nœuds : extraire, charger, appliquer

ComfyUI-MiniMaxH3Mod fournit cinq nœuds (v0.1.0) :

NœudFonction
Extract H3 RefModConvertit une image / une vidéo / un GIF en un mod .safetensors, avec les modes training (vignettes poolées du concept et de l'identité) et encode (VAE en pleine résolution)
Load H3 RefModsLignes de type chargeur LoRA, jusqu'à 8 emplacements, chacun doté d'une force et d'un multiplicateur de répétition de tokens copies
Load H3 RefMod AxisCurseur A/B signé : les valeurs négatives sélectionnent le mod A, les valeurs positives sélectionnent le mod B
Load H3 RefMod FolderChaque image / vidéo d'un dossier devient une liste de références ordonnée
Apply H3 RefModInjecte les mods dans le conditionnement, avec des réglages de rétention et de courbe par étape
Chargement des RefMods dans l'éditeur

Un nœud séparé, H3 RefMod Step Curve, contrôle à quel moment du denoising la référence est la plus forte, avec des directions de courbe telles que concept_at_start, concept_at_middle et concept_at_ends, plus un scramble_seed à graine réglable qui permute les mods multi-références entre les exécutions.

Intégration dans un flux de travail H3

Les deux nœuds RefMod se placent entre le chargeur de conditionnement et l'étape du guide ou du contexte de mouvement :

[ MiniMaxH3ImageToVideo / ReferenceToVideo ] (conditioning out)
                    |
                    v
          [ MiniMaxH3RefModApply ] <--- [ MiniMaxH3RefModsLoader ]
                    | (conditioning out)
                    v
     [ BasicGuider ] / [ MiniMaxH3MotionContext ]

Les prompts utilisent des balises de sujet ordinaires (<Subject 1>, <Subject 2>) accompagnées de descriptions biométriques ; pour les scènes multi-personnages, vous affectez un mod par emplacement du chargeur et l'adaptateur mappe chaque identité sans collision de tokens.

Exemples de sorties

RefMod Adam DriverRefMod Adele

La bibliothèque de poids

La bibliothèque Hugging Face héberge actuellement des centaines de RefMods prêts à l'emploi, d'environ 1,1 Mo à 1,6 Mo par fichier, couvrant des personnalités publiques, des personnages fictifs et des adaptateurs d'anatomie/concept, le tout sous licence Apache-2.0. Les fichiers se placent dans ComfyUI/models/refmods/, où le nœud du chargeur remplit automatiquement ses menus déroulants. Le projet fournit également une bibliothèque de vidéos d'exemple et une collection de flux de travail couvrant les pipelines T2V, I2V, R2V et C2V.

Disponibilité

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 RefMods: adaptateurs sans entrainement | ComfyUI Wiki