JoyAI-Video-Edit: Edición de vídeo en tiempo real de JD Open Source
JD Open Source publica JoyAI-Video-Edit, un modelo de difusión autoregresivo de 16B que edita flujos de vídeo en vivo en tiempo real a 30 FPS y 720p.
JD Open Source publicó JoyAI-Video-Edit, un sistema de edición de vídeo en tiempo real guiado por instrucciones para flujos de vídeo abiertos. Dado un flujo de cámara en vivo o un vídeo subido y una instrucción de edición en lenguaje natural, edita los fotogramas de forma causal a medida que llegan, sin esperar al vídeo completo, sin requerir una longitud predefinida ni revisar fotogramas futuros. En el benchmark de despliegue, el pipeline completo de extremo a extremo alcanza 30.19 FPS a 720×1280, impulsando la edición de vídeo desde el procesamiento por lotes offline hacia la generación interactiva en streaming.
Caso 1: salida editada del conjunto de ejemplos oficial
Edición en tiempo real de flujos abiertos
El sistema combina un codificador de condiciones basado en MLLM, un VAE de vídeo causal y un transformador de difusión multimodal de 16B parámetros. Se entrena y despliega como un editor de difusión autoregresivo, y se acelera con destilación de emparejamiento de distribuciones autoregresivas alineadas, optimización de horizonte largo, inferencia con estado KV acotado y programación orientada al despliegue para mantener una edición 720p de alto rendimiento mientras se reduce el desajuste entre entrenamiento e inferencia y la deriva temporal acumulada.
| Capacidad | Detalle |
|---|---|
| Tarea | Edición de vídeo guiada por instrucciones en flujos en vivo o subidos |
| Arquitectura | Codificador de condiciones MLLM + VAE de vídeo causal + MMDiT de 16B |
| Tipos de edición | Edición de sujetos, edición local, cambios de fondo, transferencia de estilo, cambios de movimiento, edición guiada por referencias |
| Rendimiento | 30.19 FPS de extremo a extremo a 720×1280 |
| Licencia | Apache-2.0 |
Caso 2: salida editada del conjunto de ejemplos oficial
Cómo funciona
JoyAI-Video-Edit procesa el vídeo como un flujo causal: cada bloque de fotogramas se codifica y edita usando solo el contexto pasado, por lo que la latencia de generación se mantiene acotada independientemente de la duración del vídeo. El diseño de difusión autoregresiva permite que el modelo mantenga la coherencia en flujos largos, mientras que la inferencia con estado KV acotado mantiene estables la memoria y el cómputo por bloque durante el despliegue. La destilación (emparejamiento de distribuciones autoregresivas alineadas) y la optimización de horizonte largo reducen la brecha entre el comportamiento en entrenamiento y en inferencia, disminuyendo la deriva que normalmente se acumula a lo largo de muchos fotogramas editados.
Caso 3: salida editada del conjunto de ejemplos oficial
Disponibilidad
JoyAI-Video-Edit aún no tiene soporte nativo para ComfyUI; se ejecuta mediante el pipeline de despliegue oficial en Python. El repositorio del proyecto proporciona la configuración completa:
- Instala las dependencias con Python 3.10+ y
pip install -r requirements.txt - Descarga los pesos publicados desde Hugging Face en
deploy/deps/checkpoints/JoyAI-Video-Edit/(el checkpoint DIT y el VAE). Los archivos del detector MiMo-VL y ONNX son dependencias externas de ejecución. ConsultaDEPLOYMENT.mdpara más detalles - Inicia el servidor con
cd deploy && bash run_server.shy luego abrehttp://localhost:8080
Para máquinas remotas, vincula el servidor a 0.0.0.0 y abre el puerto seleccionado, o usa el reenvío de puertos SSH. Los despliegues personalizados pueden editar deploy/run_server.sh para configurar las rutas de los checkpoints, la asignación de dispositivos CUDA, el host y el puerto.
El informe técnico cubre en detalle la arquitectura, la destilación y las técnicas de despliegue.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.