MiniMax H3 RefMods: adaptateurs sans entrainement
RefMods, des adaptateurs de conditionnement d'environ 1 Mo pour MiniMax H3 : encodez un personnage une fois, chargez-le comme un LoRA dans ComfyUI et reutilisez-le sans limite.
Un projet communautaire baptisé RefMods (Reference Latent Adapters) apporte une nouvelle façon de préserver la cohérence des personnages dans les vidéos MiniMax H3 : au lieu de fournir une image ou une vidéo de référence à chaque génération, vous encodez la référence une seule fois dans un petit fichier .safetensors (environ 1 Mo à 1,6 Mo), que vous chargez ensuite comme un LoRA dès que nécessaire. Le projet émane de l'utilisateur Reddit malcolmrey, qui a publié la bibliothèque complète des poids RefMods sur Hugging Face ainsi qu'un guide d'installation et d'utilisation.
Le côté ComfyUI est pris en charge par le pack de nœuds open source ComfyUI-MiniMaxH3Mod (MIT, 99 étoiles), qui extrait, charge et applique les RefMods via le chemin de conditionnement.
Ce que sont réellement les RefMods
Les RefMods sont des adaptateurs pré-encodés agissant au niveau du conditionnement : la référence (image, vidéo ou GIF) est encodée par VAE une seule fois, réduite à ses informations d'identité, puis enregistrée sous forme de fichier autonome. Lors de la génération, l'adaptateur est injecté directement dans le flux de conditionnement H3. Ainsi :
- Aucun encodage VAE en direct d'une référence à chaque exécution
- Aucune balise d'image positionnelle du type
<Picture 1>dans les prompts - Aucune fuite de l'apparence de la référence vers des parties sans rapport avec la scène
- Aucune boucle d'entraînement : l'extraction se fait en une seule passe, contrairement à l'entraînement LoRA
Le pack de nœuds : extraire, charger, appliquer
ComfyUI-MiniMaxH3Mod fournit cinq nœuds (v0.1.0) :
| Nœud | Fonction |
|---|---|
| Extract H3 RefMod | Convertit une image / une vidéo / un GIF en un mod .safetensors, avec les modes training (vignettes poolées du concept et de l'identité) et encode (VAE en pleine résolution) |
| Load H3 RefMods | Lignes de type chargeur LoRA, jusqu'à 8 emplacements, chacun doté d'une force et d'un multiplicateur de répétition de tokens copies |
| Load H3 RefMod Axis | Curseur A/B signé : les valeurs négatives sélectionnent le mod A, les valeurs positives sélectionnent le mod B |
| Load H3 RefMod Folder | Chaque image / vidéo d'un dossier devient une liste de références ordonnée |
| Apply H3 RefMod | Injecte les mods dans le conditionnement, avec des réglages de rétention et de courbe par étape |
Un nœud séparé, H3 RefMod Step Curve, contrôle à quel moment du denoising la référence est la plus forte, avec des directions de courbe telles que concept_at_start, concept_at_middle et concept_at_ends, plus un scramble_seed à graine réglable qui permute les mods multi-références entre les exécutions.
Intégration dans un flux de travail H3
Les deux nœuds RefMod se placent entre le chargeur de conditionnement et l'étape du guide ou du contexte de mouvement :
[ MiniMaxH3ImageToVideo / ReferenceToVideo ] (conditioning out)
|
v
[ MiniMaxH3RefModApply ] <--- [ MiniMaxH3RefModsLoader ]
| (conditioning out)
v
[ BasicGuider ] / [ MiniMaxH3MotionContext ]Les prompts utilisent des balises de sujet ordinaires (<Subject 1>, <Subject 2>) accompagnées de descriptions biométriques ; pour les scènes multi-personnages, vous affectez un mod par emplacement du chargeur et l'adaptateur mappe chaque identité sans collision de tokens.
Exemples de sorties
| RefMod Adam Driver | RefMod Adele |
|---|---|
La bibliothèque de poids
La bibliothèque Hugging Face héberge actuellement des centaines de RefMods prêts à l'emploi, d'environ 1,1 Mo à 1,6 Mo par fichier, couvrant des personnalités publiques, des personnages fictifs et des adaptateurs d'anatomie/concept, le tout sous licence Apache-2.0. Les fichiers se placent dans ComfyUI/models/refmods/, où le nœud du chargeur remplit automatiquement ses menus déroulants. Le projet fournit également une bibliothèque de vidéos d'exemple et une collection de flux de travail couvrant les pipelines T2V, I2V, R2V et C2V.
Disponibilité
- Pack de nœuds : Luisacaotica/ComfyUI-MiniMaxH3Mod sur GitHub (MIT)
- Poids : malcolmrey/minimaxh3 sur Hugging Face (Apache-2.0)
- Guide : Guide d'installation et d'utilisation des RefMods
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.