LoRA MiniMax H3 360 Orbit pour ComfyUI : une orbite complète
Un LoRA communautaire pour MiniMax H3 FL2VA transforme une photo en orbite caméra complète à 360 degrés, qui revient sur sa première image, avec les réglages ComfyUI.
Quatre orbites distinctes, chacune générée à partir d'une photo utilisée comme première et dernière image clé. Source : MiniMax-H3-360-Orbit-LoRA.
Ce que fait le LoRA
MiniMax H3 dispose de deux voies vidéo, et c'est l'écart entre elles que cet adaptateur comble. La génération référence-vers-vidéo traite ses images d'entrée comme de simples références d'apparence : un clip ne se termine donc pas sur une image connue et deux clips ne peuvent pas être assemblés proprement. La génération à partir de la première et de la dernière image épingle les deux extrémités, ce qui rend les jointures exactes, mais telle quelle, elle ne bouge presque pas lorsque les première et dernière images sont la même photo, car le modèle interprète la requête comme une image fixe.
L'adaptateur apprend au modèle une véritable orbite géométriquement cohérente. La scène est déclarée figée, seule la caméra se déplace, et comme l'image de fin est épinglée à l'image de début, le mouvement se referme en boucle.
Une orbite rendue à partir d'une seule photo, avec la même image utilisée comme première et dernière image clé.
Comparaison avec le modèle de base
Chaque comparaison ci-dessous rend la même entrée trois fois avec une graine, un prompt, une résolution et un nombre d'étapes identiques. De gauche à droite : le modèle de base avec seulement la première image, le modèle de base avec la première et la dernière image, puis le modèle de base plus ce LoRA avec la première et la dernière image.
Une scène de skate : le modèle de base soit s'éloigne de la vue d'ouverture, soit se fige, tandis que le LoRA effectue l'orbite complète et revient à la première image.
La même comparaison à trois volets autour d'une silhouette debout.
MP4 pleine résolution de la comparaison à trois volets ci-dessus.
Le LoRA seul, sans les panneaux du modèle de base à côté.
Le prompt
L'auteur demande que ce prompt soit utilisé mot pour mot :
One frozen instant. Only the camera moves. In a continuous 360 orbit. Preserve every person and object in exactly the same world position, orientation, shape and pose throughout the shot. Airborne objects remain suspended at the captured height and angle: no wobbling, shaking, spinning, drifting, falling or continued action. Keep faces, hands, clothing, liquids and the background motionless while retaining their natural appearance. Camera parallax is the only source of apparent movement. No cuts, zoom, morphing or added objects.Paramètres recommandés
| paramètre | valeur |
|---|---|
| poids de base | MiniMax H3 FL2VA pruned, le repack INT8 ConvRot de Comfy-Org/MiniMax-H3 |
| images clés | la même image comme première et dernière image, pour une boucle complète à 360 degrés |
| résolution | 768 × 768 |
| images | 73 (environ 3 s à 24 fps) |
| étapes | 28 |
| guidance | aucun. MiniMax H3 est distillé par guidance : il n'y a donc ni CFG ni prompt négatif |
| force du LoRA | 1.0 |
| audio | désactivé |
L'exécuter dans ComfyUI
L'adaptateur est un LoRA unique de type model-only avec la nomenclature ComfyUI (clés diffusion_model.*), aucun nœud personnalisé n'est donc requis :
- Téléchargez
minimax_h3_flf2v_lora_v1.safetensorsdansComfyUI/models/loras/. - Ouvrez un flux de travail MiniMax H3 première-et-dernière-image et pointez-le vers le modèle de base FL2VA INT8 pruned avec son text encoder et les VAE vidéo et audio de H3.
- Appliquez le LoRA à une force de 1.0 via un chargeur de LoRA de type model-only.
- Chargez une image dans les deux emplacements d'image clé et collez le prompt ci-dessus sans modification.
La fiche précise que le LoRA a été entraîné et testé avec ostris/ai-toolkit et son extension minimax_h3, et que l'adaptateur d'entraînement utilisé pendant l'entraînement n'est pas nécessaire au moment de l'inférence.
Comment il a été entraîné
Le jeu de données est délibérément monotone. Chaque clip montre le mouvement que le LoRA doit apprendre et rien d'autre, de sorte que le modèle ne voit jamais un sujet bouger :
- 28 rendus d'orbite autour de Gaussian splats humains sélectionnés à la main. Comme les splats sont des scènes 3D statiques, chaque image est géométriquement cohérente par construction, et la caméra est la seule chose qui change d'une image à l'autre.
- Format des clips : 768 × 768, 73 images, 24 fps, une légende pour tous les clips (le prompt ci-dessus), dropout de légende 0.05, pas d'audio.
- Adaptateur : rang 16, alpha 16, appliqué à toutes les couches linéaires du transformer sauf
adaln_proj, soit 208 modules au total. - Entraînement : 3 000 étapes (environ 107 époques), taille de lot 1, AdamW 8-bit à lr 1e-4, bf16 avec gradient checkpointing, timesteps décalés en flow-matching, perte MSE. Un NVIDIA A100 80 Go a mis 10 h 24 min, soit environ 12,5 s par étape.
Limites
L'auteur est explicite sur l'étroitesse de cette publication :
- Le domaine est étroit. L'entraînement a utilisé 28 clips carrés centrés sur l'humain de 73 images. Les autres sujets, les autres ratios d'image et les autres longueurs de clip n'ont pas été testés.
- De petits mouvements peuvent subsister. Certains mouvements subtils, les clignements d'yeux en particulier, peuvent encore apparaître même si la scène est censée être figée.
Disponibilité
- Poids du LoRA : pablodawson/MiniMax-H3-360-Orbit-LoRA
- Repack du modèle de base : Comfy-Org/MiniMax-H3
- Outil d'entraînement : ostris/ai-toolkit
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.