SCoPE:Wan2.2 视频生成的相机控制

ComfyUI Wikinews

腾讯 ARC 发布 SCoPE,为 Wan2.2-I2V-A14B 添加视线坐标位置编码,使视频在保持图生视频先验的同时跟随相机轨迹。

SCoPEHuggingFace | GitHub | 项目页面)是腾讯 ARC 的研究发布,通过将每个视频 token 的相机光线编码为位置坐标,为 Wan2.2-I2V-A14B 视频扩散 Transformer 添加了相机轨迹控制

概览

SCoPE(视线坐标位置编码)将每个视频 token 的相机光线视为第二位置坐标,这是坐标系的一个属性,而不是额外添加的控制模块。给定第一帧、文本提示和相机轨迹,它会在保留原始图生视频先验的同时,生成遵循所需相机运动的视频。

SCoPE teaser

SCoPE 概览:相机轨迹驱动已生成的视频(来源:模型卡片)

这种改造保持 RoPE 逐位精确,从未更改的预训练 DiT 出发,并增加 不到 0.1% 的新参数。Normalize-Gate-Inject 方案使编码在 metric 和 up-to-scale 姿态来源上均可训练,因此 SCoPE 可以使用来自不同重建流程的姿态。

工作原理

  • 相机运动作为坐标。 每个视频 token 通过 Plücker 坐标与其相机光线绑定;无需训练额外的控制分支。
  • 对异构姿态来源具有鲁棒性。 逐剪辑近深度归一化加上可学习的缩放门控(scale gate),使 SCoPE 能够使用来自不同重建流程和场景缩放的姿态。
  • 自包含发布。 模型仓库打包了推理所需的一切,用户无需下载第二个 Wan2.2 checkpoint(总计约 67 GB)。
SCoPE camera-control demo

示例输出:一个薄雾森林场景跟随向右横移(truck-right)的相机轨迹(来源:GitHub)

演示视频

SCoPE 概览演示短片,带有相机视锥体叠加层(视频来自官方图库)

可用性

SCoPE 是一个研究性发布,带有自己的推理流程,目前还没有原生 ComfyUI 支持。它需要 Python 3.11、支持 CUDA 的 GPU,以及固定的 PyTorch 2.9.1(CUDA 12.8)环境:

git clone https://github.com/TencentARC/SCoPE.git
cd SCoPE
uv sync
source .venv/bin/activate
python inference.py \
  --model_path checkpoints/SCoPE \
  --case omni-misty-forest \
  --trajectory truck_right \
  --output_path outputs/omni-misty-forest.mp4

相机姿态使用 OpenCV 的相机到世界坐标,形状为 [81, 3, 4][81, 4, 4]x_fov 是以弧度表示的水平视野。训练数据来自 RealEstate10K、DL3DV、PanShot 和 OmniWorld。

关键详情

项目详情
基础模型Wan2.2-I2V-A14B(自包含,约 67 GB)
输出81 帧视频,遵循所请求的轨迹(例如 480x832)
新参数不到预训练 DiT 的 0.1%
训练数据RealEstate10K、DL3DV、PanShot、OmniWorld
许可证Apache-2.0

链接

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
SCoPE:Wan2.2 视频生成的相机控制 | ComfyUI Wiki