JoyAI-Video-Edit: редактирование видео в реальном времени
JD Open Source выпускает JoyAI-Video-Edit — авторегрессивную диффузионную модель на 16B параметров для редактирования видеопотоков в реальном времени (30 FPS, 720p).
JD Open Source выпустила JoyAI-Video-Edit, систему редактирования видео в реальном времени по текстовым инструкциям для видеопотоков произвольной длины. Получив живой поток с камеры или загруженное видео и инструкцию по редактированию на естественном языке, система редактирует кадры каузально по мере их поступления: она не ждет полного видео, не требует заданной длины и не обращается к будущим кадрам. В бенчмарке развертывания полный сквозной конвейер достигает 30,19 FPS при разрешении 720×1280, переводя редактирование видео из пакетной офлайн-обработки в интерактивную потоковую генерацию.
Пример 1: результат редактирования из официального набора примеров
Редактирование потоков произвольной длины в реальном времени
Система объединяет MLLM-энкодер условий, каузальный видео-VAE и мультимодальный диффузионный трансформер с 16B параметров. Она обучается и развертывается как авторегрессивный диффузионный редактор, а затем ускоряется с помощью дистилляции на основе выровненного авторегрессивного согласования распределений, оптимизации на длинном горизонте, вывода с ограниченным KV-состоянием и планирования, ориентированного на развертывание. Это позволяет поддерживать высокопроизводительное редактирование в 720p и одновременно снижать расхождение между обучением и выводом и накопленный временной дрейф.
| Возможность | Детали |
|---|---|
| Задача | Редактирование видео по инструкциям на живых или загруженных потоках |
| Архитектура | MLLM-энкодер условий + каузальный видео-VAE + 16B MMDiT |
| Типы редактирования | Изменение объектов, локальные правки, изменение фона, перенос стиля, изменение движения, редактирование по референсу |
| Производительность | 30,19 FPS end-to-end при 720×1280 |
| Лицензия | Apache-2.0 |
Пример 2: результат редактирования из официального набора примеров
Как это работает
JoyAI-Video-Edit обрабатывает видео как каузальный поток: каждый фрагмент кадров кодируется и редактируется с использованием только прошлого контекста, поэтому задержка генерации остается ограниченной независимо от длины видео. Авторегрессивная диффузионная архитектура позволяет модели сохранять согласованность на длинных потоках, а вывод с ограниченным KV-состоянием обеспечивает стабильность памяти и вычислительной нагрузки на фрагмент при развертывании. Дистилляция (выровненное авторегрессивное согласование распределений) и оптимизация на длинном горизонте устраняют разрыв между поведением при обучении и при выводе, снижая дрейф, который обычно накапливается при редактировании большого числа кадров.
Пример 3: результат редактирования из официального набора примеров
Доступность
JoyAI-Video-Edit пока не имеет нативной поддержки ComfyUI; он работает через официальный конвейер развертывания на Python. В репозитории проекта приведена полная процедура настройки:
- Установите зависимости в окружении Python 3.10+ с помощью команды
pip install -r requirements.txt - Скачайте опубликованные веса с Hugging Face в папку
deploy/deps/checkpoints/JoyAI-Video-Edit/(чекпойнт DIT и VAE). Файлы MiMo-VL и ONNX-детектора являются внешними зависимостями времени выполнения; подробности см. вDEPLOYMENT.md - Запустите сервер командой
cd deploy && bash run_server.sh, затем откройтеhttp://localhost:8080
Для удаленных машин привяжите сервер к адресу 0.0.0.0 и откройте выбранный порт либо используйте проброс портов по SSH. При пользовательском развертывании можно отредактировать deploy/run_server.sh, чтобы задать пути к чекпойнтам, размещение CUDA-устройств, хост и порт.
В техническом отчете подробно описаны архитектура, дистилляция и методы развертывания.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.