JoyAI-Video-Edit: Edición de vídeo en tiempo real de JD Open Source

ComfyUI Wikinews

JD Open Source publica JoyAI-Video-Edit, un modelo de difusión autoregresivo de 16B que edita flujos de vídeo en vivo en tiempo real a 30 FPS y 720p.

JD Open Source publicó JoyAI-Video-Edit, un sistema de edición de vídeo en tiempo real guiado por instrucciones para flujos de vídeo abiertos. Dado un flujo de cámara en vivo o un vídeo subido y una instrucción de edición en lenguaje natural, edita los fotogramas de forma causal a medida que llegan, sin esperar al vídeo completo, sin requerir una longitud predefinida ni revisar fotogramas futuros. En el benchmark de despliegue, el pipeline completo de extremo a extremo alcanza 30.19 FPS a 720×1280, impulsando la edición de vídeo desde el procesamiento por lotes offline hacia la generación interactiva en streaming.

JoyAI-Video-Edit caso 1: fuente vs editado

Caso 1: salida editada del conjunto de ejemplos oficial

Edición en tiempo real de flujos abiertos

El sistema combina un codificador de condiciones basado en MLLM, un VAE de vídeo causal y un transformador de difusión multimodal de 16B parámetros. Se entrena y despliega como un editor de difusión autoregresivo, y se acelera con destilación de emparejamiento de distribuciones autoregresivas alineadas, optimización de horizonte largo, inferencia con estado KV acotado y programación orientada al despliegue para mantener una edición 720p de alto rendimiento mientras se reduce el desajuste entre entrenamiento e inferencia y la deriva temporal acumulada.

CapacidadDetalle
TareaEdición de vídeo guiada por instrucciones en flujos en vivo o subidos
ArquitecturaCodificador de condiciones MLLM + VAE de vídeo causal + MMDiT de 16B
Tipos de ediciónEdición de sujetos, edición local, cambios de fondo, transferencia de estilo, cambios de movimiento, edición guiada por referencias
Rendimiento30.19 FPS de extremo a extremo a 720×1280
LicenciaApache-2.0
JoyAI-Video-Edit caso 2: fuente vs editado

Caso 2: salida editada del conjunto de ejemplos oficial

Cómo funciona

JoyAI-Video-Edit procesa el vídeo como un flujo causal: cada bloque de fotogramas se codifica y edita usando solo el contexto pasado, por lo que la latencia de generación se mantiene acotada independientemente de la duración del vídeo. El diseño de difusión autoregresiva permite que el modelo mantenga la coherencia en flujos largos, mientras que la inferencia con estado KV acotado mantiene estables la memoria y el cómputo por bloque durante el despliegue. La destilación (emparejamiento de distribuciones autoregresivas alineadas) y la optimización de horizonte largo reducen la brecha entre el comportamiento en entrenamiento y en inferencia, disminuyendo la deriva que normalmente se acumula a lo largo de muchos fotogramas editados.

JoyAI-Video-Edit caso 3: fuente vs editado

Caso 3: salida editada del conjunto de ejemplos oficial

Disponibilidad

JoyAI-Video-Edit aún no tiene soporte nativo para ComfyUI; se ejecuta mediante el pipeline de despliegue oficial en Python. El repositorio del proyecto proporciona la configuración completa:

  1. Instala las dependencias con Python 3.10+ y pip install -r requirements.txt
  2. Descarga los pesos publicados desde Hugging Face en deploy/deps/checkpoints/JoyAI-Video-Edit/ (el checkpoint DIT y el VAE). Los archivos del detector MiMo-VL y ONNX son dependencias externas de ejecución. Consulta DEPLOYMENT.md para más detalles
  3. Inicia el servidor con cd deploy && bash run_server.sh y luego abre http://localhost:8080

Para máquinas remotas, vincula el servidor a 0.0.0.0 y abre el puerto seleccionado, o usa el reenvío de puertos SSH. Los despliegues personalizados pueden editar deploy/run_server.sh para configurar las rutas de los checkpoints, la asignación de dispositivos CUDA, el host y el puerto.

El informe técnico cubre en detalle la arquitectura, la destilación y las técnicas de despliegue.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
JoyAI-Video-Edit: Edición de vídeo en tiempo real de JD Open Source | ComfyUI Wiki