LoRA CrossView-Warp: новые ракурсы камеры для видео MiniMax H3
Cseti переносит CrossView-Warp на MiniMax H3: LoRA Ref2VA и нода ComfyUI, которые перерисовывают имеющееся видео с нового ракурса камеры с помощью warp по карте глубины MoGe.
Это третий выпуск в семействе CrossView, после версий IC-LoRA для LTX-2.3, и первый, построенный на MiniMax H3 Ref2VA, а не на управляющих фразах о камере в промпте. Вместо описания того, куда двигать камеру, нода деформирует имеющееся видео реальной геометрией и передаёт результат модели в качестве направляющей, так что новый ракурс оказывается там, где указывает карта глубины.
Каждый клип на странице модели это сравнение из трёх панелей: warp по глубине, оригинальное видео и сгенерированный результат.
![]() | ![]() |
|---|---|
| Второе движение камеры | Третье движение камеры |
Полные клипы сравнения доступны на странице модели: 00010, 00014.
Как это работает
LoRA читает два видео одновременно. Первое это warp по глубине вашего клипа, созданный нодой CrossViewWarp, которая выполняет геометрический вывод MoGe, и он несёт изменение точки обзора. Второе это сам клип, который несёт идентичность, освещение и внешний вид. Warp подаётся в направляющий путь модели на кадре 0, исходный клип идёт в путь референса, а триггерное слово crossview включает адаптер.
Поскольку геометрия берётся из warp, а не из текстового промпта, смещение камеры задаётся численно в ноде, с той же панелью управления, что и в релизе для LTX. Области, которые оригинальная камера никогда не видела, отмечены в предпросмотре ноды, и вы можете задать промптом, что там должно появиться.
Промпт и настройки
Триггерное слово: crossview. Сила LoRA варьируется от 0.8 до 1.0, при этом 0.8 рекомендуется на четырёхшаговом дистиллированном пути.
| Настройка | Значение |
|---|---|
| Триггерное слово | crossview |
| Сила LoRA | 0.8 (от 0.8 до 1.0) |
| Кадры | 124 |
| Первый проход | 0.5 MP, 16:9 |
| Второй проход | 1.5 MP, 16:9 |
| Сэмплер / шаги | res_multistep, 8 шагов с 8-шаговой turbo LoRA DMD |
| Sigma shift | 12 видео / 3 аудио |
В видео-обзоре ноды разбираются элементы управления камерой, а приведённые выше настройки это те, с которыми были сгенерированы опубликованные примеры.
Детали обучения
| Параметр | Значение |
|---|---|
| Базовая модель | MiniMax H3, ref2va |
| Фреймворк | musubi-tuner (ветка minimax-h3) |
| Стратегия | Ref2VA с aligned_guide_indices = [0] |
| Выпущенный checkpoint | шаг 3 500 из 6 000 |
| Ранг / альфа LoRA | 32 / 32 |
| Оптимизатор | adamw8bit, 1e-4 |
| Базовая точность | INT8 ConvRot |
| Разрешение обучения | 512x512, 73 кадра |
| Расписание | 6 000 шагов, пакет 1 |
| Измерено | 20.35 с/шаг, 33 ч 55 мин на RTX PRO 6000 Blackwell |
Обучающий набор это те же 719 сцен Blender, что использовались для релиза LTX v2, отрендеренных с разными смещениями камеры, чтобы адаптер выучил связь между warp и подразумеваемым им ракурсом.
Доступность
Адаптер опубликован как один файл safetensors и загружается поверх checkpoint H3 ref2va. В примечаниях к релизу отмечено, что области, которые оригинальная камера никогда не видела, указываются в предпросмотре ноды, и что для управления тем, что там будет сгенерировано, можно использовать референсные изображения или промпты.
LoRA: Cseti/MiniMax-H3_Ref2VA-LoRA-CrossView-Warp_v1
Нода: cseti007/ComfyUI-CrossViewWarp
Базовая модель: MiniMaxAI/MiniMax-H3


Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.