MiniMax H3 LoRA Transformation : morphing entre deux images

ComfyUI Wikinews

Un LoRA MiniMax H3 qui transforme une image en une autre : éléments, matériaux et sujets se métamorphosent les uns en les autres dans une transition fluide entre deux images.

Tr@nsf0rmation_style (Hugging Face) est un LoRA communautaire pour MiniMax H3 qui transforme une image en une autre. À partir d'une image de début et d'une image cible, il déconstruit la première scène, élément par élément, puis réassemble les pièces dans la seconde : les sujets se dissolvent les uns dans les autres, les matériaux changent au fil du trajet et les contours se redessinent en chemin. Ashmotv a publié les poids le 25 septembre avec deux checkpoints, dix clips d'exemple et le format de prompt attendu par l'adaptateur.
Une image extraite d'une transformation de scène multi-éléments générée avec le LoRA de transformation MiniMax H3

Une image issue de l'un des clips de démonstration, où chaque sujet de la première image se voit attribuer son propre équivalent dans la seconde.

Ce qu'il fait

La voie première-et-dernière image de MiniMax H3 lit normalement deux images comme les extrémités d'un même plan continu : la caméra ou le sujet se déplace, et la scène reste reconnaissable. Cet adaptateur fait au contraire des deux images un état de départ et un état final. Tout ce qui se trouve entre elles constitue la transition, et le modèle est entraîné à faire traverser des éléments visuels individuels plutôt qu'à appliquer un fondu enchaîné sur l'image entière.

Comme la correspondance est explicitée dans le prompt, un seul mouvement peut porter plusieurs transformations à la fois. Dans l'exemple ci-dessous, la personne en t-shirt gris devient la fille de la seconde image, la personne en chemise jaune devient l'herbe jaune, et la personne en chemise verte devient un arrière-plan vide, le tout dans un seul clip.

Le format de prompt

L'adaptateur utilise un mot déclencheur suivi d'un connecteur d'action, et fonctionne mieux lorsque le prompt précise comment chaque sujet, matériau ou élément se transforme en son équivalent :

  • Mot déclencheur : Tr@nsf0rmation_style
  • Connecteur d'action : Tr@nsf0rmation into

Le gabarit recommandé est le suivant :

integrated_multimodal_description: [Shot 1] Tr@nsf0rmation_style, Picture 1 Tr@nsf0rmation into Picture 2 with individual elements and subjects Tr@nsf0rmation into one another.

Un exemple plus précis, tiré de la carte du modèle :

integrated_multimodal_description: [Shot 1] Tr@nsf0rmation_style, Picture 1 Tr@nsf0rmation into Picture 2 with individual elements and subjects Tr@nsf0rmation into one another. The bald person in grey T-shirt and blue jeans from <Picture 1> Tr@nsf0rmation into the Girl in <Picture 2>. The person in the Yellow shirt from <Picture 1> Tr@nsf0rmation into the yellow grass from <Picture 2>. The person in the green shirt from <Picture 1> Tr@nsf0rmation into the blank background in <Picture 2>.

Exemples

Réassemblage d'une scène multi-éléments : chaque personne de la première image est transformée en un élément différent de la seconde.

Une transformation visuelle directe entre deux scènes.

Évolution de traits de crayon, avec la variante de prompt plus précise où chaque trait de crayon se transforme en un autre.

Sept autres clips, couvrant des transitions fluides, du morphing sémantique, des échanges de sujets complexes et un flux haute fidélité, sont disponibles sur la carte du modèle.

Paramètres recommandés

paramètrevaleur
poids de baseMiniMax H3 FL2VA ou Ref2V, tel que minimax_h3_fl2va_pruned_int8_convrot.safetensors de Comfy-Org/MiniMax-H3
checkpointsTransformation_style_c1-st2500 est celui pleinement convergé, -st1600 est plus doux et plus léger
Force du LoRA (st2500)1.0 à 1.2
Force du LoRA (st1600)1.0 à 1.4
configuration empiléest2500 à 1.2 plus st1600 à 1.4, utilisée pour les clips de démonstration
échantillonneur / planificateurres_multistep ou euler avec simple ; ResMultistep donne les transitions les plus stables
étapes12 avec un adaptateur DMD turbo, ou 25 à 30 en standard
décalage sigmashift_video 8.0 et shift_audio 3.0
résolution852 × 480 ou 1024 × 576, upscalable jusqu'à 1080p

L'utiliser dans ComfyUI

Les fichiers sont distribués avec la nomenclature ComfyUI (Transformation_style_*_comfyui.safetensors), aucun Nœud personnalisé n'est donc requis :

  1. Téléchargez le checkpoint souhaité dans ComfyUI/models/loras/.
  2. Ajoutez un Nœud LoraLoaderModelOnly après votre chargeur UNet MiniMax H3 et réglez strength_model entre 1.0 et 1.2.
  3. Alimentez les Nœuds de conditionnement première-et-dernière image avec l'image de début et l'image cible.
  4. Rédigez le prompt avec le déclencheur Tr@nsf0rmation_style et le connecteur Tr@nsf0rmation into, comme indiqué ci-dessus.

Disponibilité

Télécharger Transformation_style_c1-st2500_comfyui.safetensors (36 MB)

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 LoRA Transformation : morphing entre deux images | ComfyUI Wiki