JoyAI-Video-Edit:JD 开源的 16B 参数实时视频编辑模型,支持 30 FPS 720p
JD 开源发布了 JoyAI-Video-Edit,这是一个 16B 自回归 diffusion 模型,能够以 720p 30 FPS 实时编辑实时视频流。
JD 开源发布了 JoyAI-Video-Edit,这是一个面向开放式视频流的实时指令引导视频编辑系统。给定实时相机流或上传的视频以及自然语言编辑指令,它会在帧到达时以因果方式编辑每一帧,无需等待完整视频、无需预定义长度,也无需回溯未来帧。在部署基准测试中,完整的端到端 pipeline 达到了 720×1280 下 30.19 FPS,将视频编辑从离线批处理推向交互式流式生成。
案例 1:来自官方示例集的编辑输出
实时开放式编辑
该系统结合了基于 MLLM 的条件编码器、因果视频 VAE 和 16B 参数多模态 diffusion Transformer。它作为自回归 diffusion 编辑器进行训练和部署,并通过对齐自回归分布匹配蒸馏、长视界优化、有界 KV 状态推理和面向部署的调度进行加速,以维持高吞吐量 720p 编辑,同时减少训练与推理不匹配以及累积的时间漂移。
| 能力 | 详情 |
|---|---|
| 任务 | 对实时或上传的视频流进行指令引导编辑 |
| 架构 | MLLM 条件编码器 + 因果视频 VAE + 16B MMDiT |
| 编辑类型 | 主体编辑、局部编辑、背景更改、风格迁移、运动变化、参考引导编辑 |
| 吞吐量 | 端到端 30.19 FPS(720×1280) |
| 许可证 | Apache-2.0 |
案例 2:来自官方示例集的编辑输出
工作原理
JoyAI-Video-Edit 将视频作为因果流处理:每个帧块仅使用过去的上下文进行编码和编辑,因此无论视频长度如何,生成延迟都保持有界。自回归 diffusion 设计让模型能够在长视频流中保持一致性,而有界 KV 状态推理则在部署期间保持内存使用和每个帧块的计算量稳定。蒸馏(对齐自回归分布匹配)和长视界优化缩小了训练与推理行为之间的差距,减少了在大量编辑帧上通常会累积的漂移。
案例 3:来自官方示例集的编辑输出
可用性
JoyAI-Video-Edit 尚不支持原生 ComfyUI;它通过官方 Python 部署 pipeline 运行。项目仓库提供了完整的安装说明:
- 在 Python 3.10+ 环境中安装依赖项,并运行
pip install -r requirements.txt - 从 Hugging Face 将已发布的权重下载到
deploy/deps/checkpoints/JoyAI-Video-Edit/(DIT checkpoint 和 VAE)。MiMo-VL 和 ONNX 检测器文件是外部运行时依赖项,详情请参阅DEPLOYMENT.md - 使用
cd deploy && bash run_server.sh启动服务器,然后打开http://localhost:8080
对于远程机器,请将服务器绑定到 0.0.0.0 并开放所选端口,或使用 SSH 端口转发。自定义部署可以编辑 deploy/run_server.sh 来设置 checkpoint 路径、CUDA 设备放置、主机和端口。
技术报告详细介绍了架构、蒸馏和部署技术。
评论
使用 GitHub 登录后即可参与讨论。