CrossView-Warp LoRA : nouveaux angles de caméra pour H3
LoRA CrossView-Warp pour MiniMax H3 : un adaptateur Ref2VA et un nœud ComfyUI qui re-rend une séquence depuis un nouvel angle grâce à un warp de profondeur MoGe.
Il s'agit de la troisième publication de la famille CrossView, après les versions IC-LoRA LTX-2.3, et la première construite sur MiniMax H3 Ref2VA plutôt que sur des phrases de caméra guidées par prompt. Au lieu de décrire où déplacer la caméra, le nœud déforme la séquence existante avec de la géométrie réelle et transmet le résultat au modèle comme guide, afin que le nouvel angle se place là où la carte de profondeur l'indique.
Chaque clip de la page du modèle est une comparaison en trois panneaux : le warp de profondeur, la séquence originale et le résultat généré.
![]() | ![]() |
|---|---|
| Un second mouvement de caméra | Un troisième mouvement de caméra |
Les clips de comparaison complets sont disponibles sur la page du modèle : 00010, 00014.
Fonctionnement
Le LoRA lit deux vidéos à la fois. La première est un warp de profondeur de votre clip, produit par le nœud CrossViewWarp qui exécute une inférence géométrique MoGe, et c'est elle qui porte le changement de point de vue. La seconde est le clip lui-même, qui porte l'identité, l'éclairage et l'apparence. Le warp entre dans le chemin de guidage du modèle à la frame 0, le clip source entre dans le chemin de référence, et le mot déclencheur crossview active l'adaptateur.
Comme la géométrie provient du warp et non d'un prompt texte, le décalage de caméra se règle numériquement dans le nœud, avec la même surface de contrôle que la version LTX. Les zones que la caméra d'origine n'a jamais vues sont signalées dans l'aperçu du nœud, et vous pouvez décrire par prompt ce qui doit y apparaître.
Prompt et paramètres
Le mot déclencheur est crossview. La force du LoRA va de 0,8 à 1,0, avec 0,8 recommandé sur le chemin distillé en quatre étapes.
| Paramètre | Valeur |
|---|---|
| Mot déclencheur | crossview |
| Force du LoRA | 0,8 (0,8 à 1,0) |
| Frames | 124 |
| Première passe | 0,5 MP, 16:9 |
| Seconde passe | 1,5 MP, 16:9 |
| Échantillonneur / étapes | res_multistep, 8 étapes avec le LoRA turbo DMD 8 étapes |
| Sigma shift | 12 vidéo / 3 audio |
La vidéo de démonstration du nœud couvre les contrôles de caméra, et les paramètres ci-dessus sont ceux avec lesquels les exemples publiés ont été générés.
Détails de l'entraînement
| Paramètre | Valeur |
|---|---|
| Modèle de base | MiniMax H3, ref2va |
| Framework | musubi-tuner (branche minimax-h3) |
| Stratégie | Ref2VA avec aligned_guide_indices = [0] |
| Checkpoint publié | étape 3 500 sur 6 000 |
| Rang / alpha du LoRA | 32 / 32 |
| Optimiseur | adamw8bit, 1e-4 |
| Précision de base | INT8 ConvRot |
| Résolution d'entraînement | 512x512, 73 frames |
| Planification | 6 000 étapes, lot de 1 |
| Mesuré | 20,35 s/étape, 33 h 55 min sur une RTX PRO 6000 Blackwell |
Le jeu d'entraînement est constitué des mêmes 719 scènes Blender que celles utilisées pour la version LTX v2, rendues sur différents décalages de caméra afin que l'adaptateur apprenne la relation entre un warp et la vue qu'il implique.
Disponibilité
L'adaptateur est publié sous forme d'un seul fichier safetensors et se charge sur le checkpoint H3 ref2va. Les notes de publication soulignent que les régions que la caméra d'origine n'a jamais vues sont signalées dans l'aperçu du nœud, et que des images de référence ou des prompts peuvent servir à orienter ce qui y est généré.
LoRA : Cseti/MiniMax-H3_Ref2VA-LoRA-CrossView-Warp_v1
Nœud : cseti007/ComfyUI-CrossViewWarp
Modèle de base : MiniMaxAI/MiniMax-H3


Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.