JoyAI-Video-Edit : Montage vidéo en temps réel de JD Open Source
JD Open Source publie JoyAI-Video-Edit, un modèle de diffusion autoregressif de 16B qui édite des flux vidéo en direct en temps réel à 30 FPS en 720p.
JD Open Source a publié JoyAI-Video-Edit, un système de montage vidéo en temps réel guidé par instructions, conçu pour les flux vidéo ouverts. À partir d'un flux caméra en direct ou d'une vidéo téléchargée et d'une instruction d'édition en langage naturel, il édite les images de manière causale à mesure qu'elles arrivent, sans attendre la vidéo complète, sans exiger de longueur prédéfinie ni revisiter les images futures. Dans le benchmark de déploiement, le pipeline complet de bout en bout atteint 30,19 FPS en 720×1280, faisant passer le montage vidéo du traitement par lot hors ligne à la génération interactive en streaming.
Cas 1 : sortie éditée du jeu d'exemples officiel
Montage de flux ouverts en temps réel
Le système combine un encodeur de conditions basé sur un MLLM, un VAE vidéo causal et un transformateur de diffusion multimodal de 16B paramètres. Il est entraîné et déployé comme un éditeur de diffusion autoregressif, puis accéléré grâce à une distillation par correspondance de distribution autoregressive alignée, une optimisation à long horizon, une inférence à état KV borné et une planification orientée déploiement, afin de maintenir un montage 720p à haut débit tout en réduisant l'écart entre l'entraînement et l'inférence ainsi que la dérive temporelle accumulée.
| Capacité | Détail |
|---|---|
| Tâche | Montage vidéo guidé par instructions sur flux en direct ou téléchargés |
| Architecture | Encodeur de conditions MLLM + VAE vidéo causal + MMDiT 16B |
| Types d'édition | Modifications de sujet, modifications locales, changements d'arrière-plan, transfert de style, modifications de mouvement, édition guidée par référence |
| Débit | 30,19 FPS de bout en bout en 720×1280 |
| Licence | Apache-2.0 |
Cas 2 : sortie éditée du jeu d'exemples officiel
Comment ça fonctionne
JoyAI-Video-Edit traite la vidéo comme un flux causal : chaque bloc d'images est encodé et édité en utilisant uniquement le contexte passé, de sorte que la latence de génération reste bornée quelle que soit la longueur de la vidéo. La conception par diffusion autoregressive permet au modèle de maintenir la cohérence sur les longs flux, tandis que l'inférence à état KV borné maintient la mémoire et le calcul par bloc stables pendant le déploiement. La distillation (correspondance de distribution autoregressive alignée) et l'optimisation à long horizon comblent l'écart entre le comportement à l'entraînement et à l'inférence, réduisant la dérive qui s'accumule généralement sur de nombreuses images éditées.
Cas 3 : sortie éditée du jeu d'exemples officiel
Disponibilité
JoyAI-Video-Edit ne dispose pas encore d'un support natif dans ComfyUI ; il s'exécute via le pipeline de déploiement Python officiel. Le référentiel du projet fournit la configuration complète :
- Installer les dépendances avec Python 3.10+ en exécutant
pip install -r requirements.txt - Télécharger les poids publiés depuis Hugging Face dans
deploy/deps/checkpoints/JoyAI-Video-Edit/(le checkpoint DIT et le VAE). Les fichiers MiMo-VL et les fichiers de détecteur ONNX sont des dépendances d'exécution externes. ConsultezDEPLOYMENT.mdpour plus de détails. - Lancer le serveur avec
cd deploy && bash run_server.sh, puis ouvrirhttp://localhost:8080
Pour les machines distantes, liez le serveur à 0.0.0.0 et ouvrez le port sélectionné, ou utilisez la redirection de port SSH. Les déploiements personnalisés peuvent modifier deploy/run_server.sh pour définir les chemins des checkpoints, le placement des périphériques CUDA, l'hôte et le port.
Le rapport technique couvre en détail l'architecture, la distillation et les techniques de déploiement.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.