SCoPE:Wan2.2 视频生成的相机控制
ComfyUI Wikinews
腾讯 ARC 发布 SCoPE,为 Wan2.2-I2V-A14B 添加视线坐标位置编码,使视频在保持图生视频先验的同时跟随相机轨迹。
SCoPE(HuggingFace | GitHub | 项目页面)是腾讯 ARC 的研究发布,通过将每个视频 token 的相机光线编码为位置坐标,为 Wan2.2-I2V-A14B 视频扩散 Transformer 添加了相机轨迹控制。
概览
SCoPE(视线坐标位置编码)将每个视频 token 的相机光线视为第二位置坐标,这是坐标系的一个属性,而不是额外添加的控制模块。给定第一帧、文本提示和相机轨迹,它会在保留原始图生视频先验的同时,生成遵循所需相机运动的视频。
SCoPE 概览:相机轨迹驱动已生成的视频(来源:模型卡片)
这种改造保持 RoPE 逐位精确,从未更改的预训练 DiT 出发,并增加 不到 0.1% 的新参数。Normalize-Gate-Inject 方案使编码在 metric 和 up-to-scale 姿态来源上均可训练,因此 SCoPE 可以使用来自不同重建流程的姿态。
工作原理
- 相机运动作为坐标。 每个视频 token 通过 Plücker 坐标与其相机光线绑定;无需训练额外的控制分支。
- 对异构姿态来源具有鲁棒性。 逐剪辑近深度归一化加上可学习的缩放门控(scale gate),使 SCoPE 能够使用来自不同重建流程和场景缩放的姿态。
- 自包含发布。 模型仓库打包了推理所需的一切,用户无需下载第二个 Wan2.2 checkpoint(总计约 67 GB)。
示例输出:一个薄雾森林场景跟随向右横移(truck-right)的相机轨迹(来源:GitHub)
演示视频
SCoPE 概览演示短片,带有相机视锥体叠加层(视频来自官方图库)
可用性
SCoPE 是一个研究性发布,带有自己的推理流程,目前还没有原生 ComfyUI 支持。它需要 Python 3.11、支持 CUDA 的 GPU,以及固定的 PyTorch 2.9.1(CUDA 12.8)环境:
git clone https://github.com/TencentARC/SCoPE.git
cd SCoPE
uv sync
source .venv/bin/activatepython inference.py \
--model_path checkpoints/SCoPE \
--case omni-misty-forest \
--trajectory truck_right \
--output_path outputs/omni-misty-forest.mp4相机姿态使用 OpenCV 的相机到世界坐标,形状为 [81, 3, 4] 或 [81, 4, 4];x_fov 是以弧度表示的水平视野。训练数据来自 RealEstate10K、DL3DV、PanShot 和 OmniWorld。
关键详情
| 项目 | 详情 |
|---|---|
| 基础模型 | Wan2.2-I2V-A14B(自包含,约 67 GB) |
| 输出 | 81 帧视频,遵循所请求的轨迹(例如 480x832) |
| 新参数 | 不到预训练 DiT 的 0.1% |
| 训练数据 | RealEstate10K、DL3DV、PanShot、OmniWorld |
| 许可证 | Apache-2.0 |
评论
使用 GitHub 登录后即可参与讨论。