CrossView-Warp LoRA : nouveaux angles de caméra pour H3

ComfyUI Wikinews

LoRA CrossView-Warp pour MiniMax H3 : un adaptateur Ref2VA et un nœud ComfyUI qui re-rend une séquence depuis un nouvel angle grâce à un warp de profondeur MoGe.

CrossView-Warp v1 est le portage MiniMax H3 de l'adaptateur de re-vue caméra de Cseti. Fournissez-lui un clip ainsi qu'un décalage d'azimut et d'élévation, et il rend la même scène depuis ce nouveau point de vue. Il est livré avec un nœud ComfyUI assorti et un flux de travail d'exemple.

Il s'agit de la troisième publication de la famille CrossView, après les versions IC-LoRA LTX-2.3, et la première construite sur MiniMax H3 Ref2VA plutôt que sur des phrases de caméra guidées par prompt. Au lieu de décrire où déplacer la caméra, le nœud déforme la séquence existante avec de la géométrie réelle et transmet le résultat au modèle comme guide, afin que le nouvel angle se place là où la carte de profondeur l'indique.

Warp, original et résultat côte à côte

Chaque clip de la page du modèle est une comparaison en trois panneaux : le warp de profondeur, la séquence originale et le résultat généré.

Second mouvement de caméraTroisième mouvement de caméra
Un second mouvement de caméraUn troisième mouvement de caméra

Les clips de comparaison complets sont disponibles sur la page du modèle : 00010, 00014.

Fonctionnement

Le LoRA lit deux vidéos à la fois. La première est un warp de profondeur de votre clip, produit par le nœud CrossViewWarp qui exécute une inférence géométrique MoGe, et c'est elle qui porte le changement de point de vue. La seconde est le clip lui-même, qui porte l'identité, l'éclairage et l'apparence. Le warp entre dans le chemin de guidage du modèle à la frame 0, le clip source entre dans le chemin de référence, et le mot déclencheur crossview active l'adaptateur.

Comme la géométrie provient du warp et non d'un prompt texte, le décalage de caméra se règle numériquement dans le nœud, avec la même surface de contrôle que la version LTX. Les zones que la caméra d'origine n'a jamais vues sont signalées dans l'aperçu du nœud, et vous pouvez décrire par prompt ce qui doit y apparaître.

Prompt et paramètres

Le mot déclencheur est crossview. La force du LoRA va de 0,8 à 1,0, avec 0,8 recommandé sur le chemin distillé en quatre étapes.

ParamètreValeur
Mot déclencheurcrossview
Force du LoRA0,8 (0,8 à 1,0)
Frames124
Première passe0,5 MP, 16:9
Seconde passe1,5 MP, 16:9
Échantillonneur / étapesres_multistep, 8 étapes avec le LoRA turbo DMD 8 étapes
Sigma shift12 vidéo / 3 audio

La vidéo de démonstration du nœud couvre les contrôles de caméra, et les paramètres ci-dessus sont ceux avec lesquels les exemples publiés ont été générés.

Détails de l'entraînement

ParamètreValeur
Modèle de baseMiniMax H3, ref2va
Frameworkmusubi-tuner (branche minimax-h3)
StratégieRef2VA avec aligned_guide_indices = [0]
Checkpoint publiéétape 3 500 sur 6 000
Rang / alpha du LoRA32 / 32
Optimiseuradamw8bit, 1e-4
Précision de baseINT8 ConvRot
Résolution d'entraînement512x512, 73 frames
Planification6 000 étapes, lot de 1
Mesuré20,35 s/étape, 33 h 55 min sur une RTX PRO 6000 Blackwell

Le jeu d'entraînement est constitué des mêmes 719 scènes Blender que celles utilisées pour la version LTX v2, rendues sur différents décalages de caméra afin que l'adaptateur apprenne la relation entre un warp et la vue qu'il implique.

Disponibilité

L'adaptateur est publié sous forme d'un seul fichier safetensors et se charge sur le checkpoint H3 ref2va. Les notes de publication soulignent que les régions que la caméra d'origine n'a jamais vues sont signalées dans l'aperçu du nœud, et que des images de référence ou des prompts peuvent servir à orienter ce qui y est généré.

LoRA : Cseti/MiniMax-H3_Ref2VA-LoRA-CrossView-Warp_v1
Nœud : cseti007/ComfyUI-CrossViewWarp
Modèle de base : MiniMaxAI/MiniMax-H3

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
CrossView-Warp LoRA : nouveaux angles de caméra pour H3 | ComfyUI Wiki