SCoPE: Wan2.2 비디오 생성을 위한 카메라 제어
Tencent ARC가 SCoPE를 공개합니다. Wan2.2-I2V-A14B에 시선 좌표 위치 인코딩을 추가하여 이미지 기반 비디오 생성 사전(prior)을 유지하면서 카메라 궤적을 따르는 비디오를 생성합니다.
개요
SCoPE(시선 좌표 위치 인코딩, Sightline-Coordinate Positional Encoding)는 각 비디오 토큰의 카메라 광선을 두 번째 위치 좌표로 취급합니다. 이는 별도의 제어 모듈이 아니라 좌표계의 속성입니다. 첫 번째 프레임, 텍스트 프롬프트, 카메라 궤적이 주어지면 원본 이미지 기반 비디오 생성 사전(prior)을 보존하면서 요청된 카메라 움직임을 따르는 비디오를 생성합니다.
SCoPE 개요: 카메라 궤적이 생성된 비디오를 구동합니다 (출처: 모델 카드)
이 리트로핏은 RoPE의 비트 수준 정확성(bit-exact)을 유지하며, 변경되지 않은 사전 학습된 DiT에서 시작하여 0.1% 미만의 새 파라미터만 추가합니다. Normalize-Gate-Inject 방식은 metric 및 up-to-scale 포즈 소스 모두에서 인코딩을 학습 가능하게 하므로 SCoPE는 서로 다른 재구성 pipeline의 포즈를 사용할 수 있습니다.
작동 방식
- 카메라 움직임을 좌표로. 각 비디오 토큰은 플뤼커(Plücker) 좌표를 통해 카메라 광선에 연결됩니다. 별도의 제어 분기는 학습되지 않습니다.
- 이종 포즈 소스에 대한 강건성. 클립별 근거리 깊이 정규화와 학습된 스케일 게이트를 통해 SCoPE는 서로 다른 재구성 pipeline과 장면 스케일의 포즈를 사용할 수 있습니다.
- 자체 포함 릴리스. 모델 저장소에는 추론에 필요한 모든 것이 포함되어 있습니다. 사용자는 두 번째 Wan2.2 checkpoint(총 약 67GB)를 다운로드할 필요가 없습니다.
출력 예시: truck-right 카메라 궤적을 따르는 안개 낀 숲 장면 (출처: GitHub)
데모 비디오
카메라 절두체 오버레이가 포함된 SCoPE 개요 데모 릴 (공식 갤러리 영상)
사용 가능 여부
SCoPE는 자체 추론 pipeline을 갖춘 연구용 릴리스이며, 아직 네이티브 ComfyUI 지원이 없습니다. Python 3.11, CUDA 지원 GPU, 그리고 고정된 PyTorch 2.9.1(CUDA 12.8) 환경이 필요합니다:
git clone https://github.com/TencentARC/SCoPE.git
cd SCoPE
uv sync
source .venv/bin/activatepython inference.py \
--model_path checkpoints/SCoPE \
--case omni-misty-forest \
--trajectory truck_right \
--output_path outputs/omni-misty-forest.mp4카메라 포즈는 OpenCV 카메라-월드 좌표를 사용하며 형태는 [81, 3, 4] 또는 [81, 4, 4]입니다. x_fov는 라디안 단위의 수평 시야각입니다. RealEstate10K, DL3DV, PanShot, OmniWorld 데이터로 학습되었습니다.
주요 세부 정보
| 항목 | 세부 정보 |
|---|---|
| 베이스 모델 | Wan2.2-I2V-A14B (자체 포함, 약 67GB) |
| 출력 | 요청된 궤적을 따르는 81프레임 비디오 (예: 480x832) |
| 새 파라미터 | 사전 학습된 DiT의 0.1% 미만 |
| 학습 데이터 | RealEstate10K, DL3DV, PanShot, OmniWorld |
| 라이선스 | Apache-2.0 |
댓글
GitHub로 로그인하고 토론에 참여하세요.