SCoPE: Wan2.2動画生成のためのカメラ制御
Tencent ARCがSCoPEを公開。Wan2.2-I2V-A14Bに視線座標の位置エンコーディングを追加し、画像から動画への事前分布を維持しながらカメラ軌道に沿った動画を生成します。
概要
SCoPE(Sightline-Coordinate Positional Encoding)は、各動画トークンのカメラ光線を2つ目の位置座標として扱います。これは、追加の制御モジュールではなく座標系の特性です。最初のフレーム、テキストプロンプト、カメラ軌道が与えられると、オリジナルの画像から動画への事前分布を維持しながら、要求されたカメラモーションに従う動画を生成します。
SCoPE概要: カメラ軌道が生成済み動画を駆動します(ソース: モデルカード)
この改造はRoPEをビット完全に保ち、変更されていない事前学習済みDiTから開始して、0.1%未満の新しいパラメータを追加します。Normalize-Gate-Inject方式により、メトリック(絶対スケール)とスケール不定(up-to-scale)の両方のポーズソースでエンコーディングをトレーニング可能にし、SCoPEは異なる再構築パイプラインからのポーズを利用できます。
仕組み
- 座標としてのカメラモーション。 各動画トークンはPlücker座標を介してカメラ光線に結び付けられ、個別の制御ブランチはトレーニングされません。
- 異種のポーズソースに対するロバスト性。 クリップごとの近接深度正規化と学習されたスケールゲートにより、SCoPEは異なる再構築パイプラインやシーンスケールからのポーズを利用できます。
- 自己完結型リリース。 モデルリポジトリには推論に必要なすべてが同梱されており、ユーザーは2つ目のWan2.2チェックポイント(合計約67GB)をダウンロードする必要はありません。
出力例: 霧の森のシーンで右方向へのトラック移動カメラ軌道に従う動画(ソース: GitHub)
デモ動画
カメラ視錐台オーバーレイ付きのSCoPE概要デモリール(公式ギャラリーの動画)
利用方法
SCoPEは独自の推論パイプラインを持つ研究リリースであり、ネイティブのComfyUIサポートはまだありません。Python 3.11、CUDA対応GPU、ピン留めされたPyTorch 2.9.1(CUDA 12.8)環境が必要です:
git clone https://github.com/TencentARC/SCoPE.git
cd SCoPE
uv sync
source .venv/bin/activatepython inference.py \
--model_path checkpoints/SCoPE \
--case omni-misty-forest \
--trajectory truck_right \
--output_path outputs/omni-misty-forest.mp4カメラポーズは、形状が[81, 3, 4]または[81, 4, 4]のOpenCVカメラtoワールド座標を使用します。x_fovはラジアン単位の水平視野角です。RealEstate10K、DL3DV、PanShot、OmniWorldでトレーニングされています。
主な詳細
| 項目 | 詳細 |
|---|---|
| ベースモデル | Wan2.2-I2V-A14B(自己完結型、約67GB) |
| 出力 | 要求された軌道に従う81フレームの動画(例: 480x832) |
| 新しいパラメータ | 事前学習済みDiTの0.1%未満 |
| トレーニングデータ | RealEstate10K、DL3DV、PanShot、OmniWorld |
| ライセンス | Apache-2.0 |
コメント
GitHubでサインインしてディスカッションに参加しましょう。