CrossView-Warp LoRA:为 MiniMax H3 视频带来全新相机角度

ComfyUI Wikinews

Cseti 将 CrossView-Warp 移植到 MiniMax H3:一个 Ref2VA LoRA,外加一个 ComfyUI 节点,借助 MoGe 深度变形从新的相机角度重新渲染现有素材。

CrossView-Warp v1 是 Cseti 相机重视角适配器的 MiniMax H3 移植版。给它一段片段再加上方位角与俯仰角偏移,它就能从那个新视角渲染同一场景。它附带一个配套的 ComfyUI 节点 和一个示例工作流。

这是 CrossView 系列的第三个版本,前两个是 LTX-2.3 IC-LoRA 版本;它也是首个基于 MiniMax H3 Ref2VA 构建、而非依赖提示词驱动的相机描述语的版本。该节点不再靠文字描述相机该往哪里移动,而是用真实几何关系对现有素材进行变形,并把结果作为引导交给模型,因此新角度会落在深度图所指示的位置上。

变形、原始画面与结果并排对比

模型页面上的每段片段都是三联对比:深度变形、原始素材和已生成结果。

第二个相机运动第三个相机运动
第二个相机运动第三个相机运动

完整的对比片段在模型页面上:0001000014

工作原理

该 LoRA 会同时读取段视频。第一段是你片段的深度变形,由运行 MoGe 几何推理的 CrossViewWarp 节点生成,它承载视角变化。第二段是片段本身,它承载身份、光照与外观。变形结果在第 0 帧进入模型的引导路径,来源片段进入引用路径,而 crossview 触发词会启用该适配器。

由于几何信息来自变形而非文本提示词,相机偏移在节点中以数值方式设定,其控制界面与 LTX 版本相同。原始相机从未看到的区域会在节点预览中被标记出来,你可以通过提示词指定那里应出现的内容。

提示词与设置

触发词为 crossview。LoRA 强度范围为 0.8 到 1.0,在四步蒸馏路径上推荐使用 0.8

设置数值
触发词crossview
LoRA 强度0.8(0.8 到 1.0)
帧数124
第一遍0.5 MP,16:9
第二遍1.5 MP,16:9
采样器 / 步数res_multistep,配合 DMD 8 步 turbo LoRA 使用 8 步
Sigma 偏移视频 12 / 音频 3

该节点的操作演示视频讲解了相机控制,上面的设置正是发布示例所用的那套设置。

训练详情

参数数值
基础模型MiniMax H3,ref2va
框架musubi-tuner(minimax-h3 分支)
策略Ref2VA,aligned_guide_indices = [0]
已发布的 checkpoint6,000 步中的第 3,500 步
LoRA 秩 / alpha32 / 32
优化器adamw8bit,1e-4
基础精度INT8 ConvRot
训练分辨率512x512,73 帧
训练计划6,000 步,批处理大小为 1
实测单步 20.35 秒,在 RTX PRO 6000 Blackwell 上耗时 33 小时 55 分钟

训练集与 LTX v2 版本所用的相同,为 719 个 Blender 场景,按不同相机偏移渲染,使适配器学习变形与其所隐含视角之间的关系。

获取方式

该适配器以单个 safetensors 文件发布,可加载到 H3 ref2va checkpoint 上。发布说明指出,原始相机从未看到的区域会在节点预览中被特别标出,并且可以使用引用图像或提示词来引导这些区域生成的内容。

LoRA: Cseti/MiniMax-H3_Ref2VA-LoRA-CrossView-Warp_v1
节点: cseti007/ComfyUI-CrossViewWarp
基础模型: MiniMaxAI/MiniMax-H3

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
CrossView-Warp LoRA:为 MiniMax H3 视频带来全新相机角度 | ComfyUI Wiki