SCoPE: Control de cámara para la generación de vídeo con Wan2.2

ComfyUI Wikinews

Tencent ARC lanza SCoPE, que añade codificación posicional de coordenadas de línea de visión a Wan2.2-I2V-A14B para que los vídeos sigan una trayectoria de cámara.

SCoPE (HuggingFace | GitHub | Página del proyecto) es un lanzamiento de investigación de Tencent ARC que añade control de trayectoria de cámara al transformer de diffusion de vídeo Wan2.2-I2V-A14B codificando el rayo de cámara de cada token de vídeo como una coordenada posicional.

Descripción general

SCoPE (Sightline-Coordinate Positional Encoding) trata el rayo de cámara de cada token de vídeo como una segunda coordenada posicional: una propiedad del sistema de coordenadas en lugar de un módulo de control añadido. Dado un primer fotograma, un prompt de texto y una trayectoria de cámara, genera un vídeo que sigue el movimiento de cámara solicitado conservando el prior original de imagen a vídeo.

Teaser de SCoPE

Descripción general de SCoPE: las trayectorias de cámara impulsan el vídeo generado (fuente: tarjeta del modelo)

La adaptación mantiene RoPE bit-exacto, parte del DiT preentrenado sin cambios y añade menos de un 0,1% de parámetros nuevos. Un esquema Normalize-Gate-Inject hace que la codificación sea entrenable tanto con fuentes de pose métricas como con fuentes de escala no definida (up-to-scale), lo que permite a SCoPE consumir poses de diferentes pipelines de reconstrucción.

Cómo funciona

  • Movimiento de cámara como coordenadas. Cada token de vídeo está vinculado a su rayo de cámara mediante coordenadas de Plücker; no se entrena ninguna rama de control separada.
  • Robusto ante fuentes de pose heterogéneas. La normalización de profundidad cercana por clip junto con una compuerta de escala aprendida permiten a SCoPE consumir poses de diferentes pipelines de reconstrucción y escalas de escena.
  • Lanzamiento autocontenido. El repositorio del modelo incluye todo lo necesario para la inferencia; los usuarios no necesitan descargar un segundo checkpoint de Wan2.2 (aproximadamente 67 GB en total).
Demostración de control de cámara con SCoPE

Salida de ejemplo: una escena de bosque brumoso que sigue una trayectoria de cámara con desplazamiento lateral hacia la derecha (fuente: GitHub)

Vídeo de demostración

Reel de demostración de SCoPE con superposiciones de frustum de cámara (vídeo de la galería oficial)

Disponibilidad

SCoPE es un lanzamiento de investigación con su propio pipeline de inferencia; todavía no tiene soporte nativo en ComfyUI. Requiere Python 3.11, una GPU compatible con CUDA y el entorno con la versión fijada de PyTorch 2.9.1 (CUDA 12.8):

git clone https://github.com/TencentARC/SCoPE.git
cd SCoPE
uv sync
source .venv/bin/activate
python inference.py \
  --model_path checkpoints/SCoPE \
  --case omni-misty-forest \
  --trajectory truck_right \
  --output_path outputs/omni-misty-forest.mp4

Las poses de cámara utilizan coordenadas camera-to-world de OpenCV con forma [81, 3, 4] o [81, 4, 4]; x_fov es el campo de visión horizontal en radianes. Entrenado en RealEstate10K, DL3DV, PanShot y OmniWorld.

Detalles clave

ElementoDetalle
Modelo baseWan2.2-I2V-A14B (autocontenido, ~67 GB)
SalidaVídeo de 81 fotogramas que sigue la trayectoria solicitada (p. ej., 480x832)
Parámetros nuevosMenos del 0,1% del DiT preentrenado
Datos de entrenamientoRealEstate10K, DL3DV, PanShot, OmniWorld
LicenciaApache-2.0

Enlaces

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
SCoPE: Control de cámara para la generación de vídeo con Wan2.2 | ComfyUI Wiki