SCoPE: Control de cámara para la generación de vídeo con Wan2.2
Tencent ARC lanza SCoPE, que añade codificación posicional de coordenadas de línea de visión a Wan2.2-I2V-A14B para que los vídeos sigan una trayectoria de cámara.
Descripción general
SCoPE (Sightline-Coordinate Positional Encoding) trata el rayo de cámara de cada token de vídeo como una segunda coordenada posicional: una propiedad del sistema de coordenadas en lugar de un módulo de control añadido. Dado un primer fotograma, un prompt de texto y una trayectoria de cámara, genera un vídeo que sigue el movimiento de cámara solicitado conservando el prior original de imagen a vídeo.
Descripción general de SCoPE: las trayectorias de cámara impulsan el vídeo generado (fuente: tarjeta del modelo)
La adaptación mantiene RoPE bit-exacto, parte del DiT preentrenado sin cambios y añade menos de un 0,1% de parámetros nuevos. Un esquema Normalize-Gate-Inject hace que la codificación sea entrenable tanto con fuentes de pose métricas como con fuentes de escala no definida (up-to-scale), lo que permite a SCoPE consumir poses de diferentes pipelines de reconstrucción.
Cómo funciona
- Movimiento de cámara como coordenadas. Cada token de vídeo está vinculado a su rayo de cámara mediante coordenadas de Plücker; no se entrena ninguna rama de control separada.
- Robusto ante fuentes de pose heterogéneas. La normalización de profundidad cercana por clip junto con una compuerta de escala aprendida permiten a SCoPE consumir poses de diferentes pipelines de reconstrucción y escalas de escena.
- Lanzamiento autocontenido. El repositorio del modelo incluye todo lo necesario para la inferencia; los usuarios no necesitan descargar un segundo checkpoint de Wan2.2 (aproximadamente 67 GB en total).
Salida de ejemplo: una escena de bosque brumoso que sigue una trayectoria de cámara con desplazamiento lateral hacia la derecha (fuente: GitHub)
Vídeo de demostración
Reel de demostración de SCoPE con superposiciones de frustum de cámara (vídeo de la galería oficial)
Disponibilidad
SCoPE es un lanzamiento de investigación con su propio pipeline de inferencia; todavía no tiene soporte nativo en ComfyUI. Requiere Python 3.11, una GPU compatible con CUDA y el entorno con la versión fijada de PyTorch 2.9.1 (CUDA 12.8):
git clone https://github.com/TencentARC/SCoPE.git
cd SCoPE
uv sync
source .venv/bin/activatepython inference.py \
--model_path checkpoints/SCoPE \
--case omni-misty-forest \
--trajectory truck_right \
--output_path outputs/omni-misty-forest.mp4Las poses de cámara utilizan coordenadas camera-to-world de OpenCV con forma [81, 3, 4] o [81, 4, 4]; x_fov es el campo de visión horizontal en radianes. Entrenado en RealEstate10K, DL3DV, PanShot y OmniWorld.
Detalles clave
| Elemento | Detalle |
|---|---|
| Modelo base | Wan2.2-I2V-A14B (autocontenido, ~67 GB) |
| Salida | Vídeo de 81 fotogramas que sigue la trayectoria solicitada (p. ej., 480x832) |
| Parámetros nuevos | Menos del 0,1% del DiT preentrenado |
| Datos de entrenamiento | RealEstate10K, DL3DV, PanShot, OmniWorld |
| Licencia | Apache-2.0 |
Comentarios
Inicia sesión con GitHub para unirte a la conversación.