Qwen-Video-Edit: редактирование видео по инструкциям с нодами ComfyUI
Qwen-Video-Edit переиспользует DiT от Qwen-Image-Edit для редактирования видео-латентов Wan 2.1 по текстовым инструкциям, с нодами ComfyUI и чекпоинтами 360P/480P/720P.
Qwen-Video-Edit — модель редактирования видео по текстовым инструкциям, которая переиспользует DiT от Qwen-Image-Edit, чтобы напрямую редактировать латентное пространство видео-VAE Wan 2.1, без необходимости в предобученном на видео трансформере. Первый релиз состоялся 14 августа (код, статья, чекпоинт 360P); 20 августа проект получил официальную поддержку ComfyUI и новые чекпоинты 480P и 720P.
Работа принадлежит Yunpeng Bai (UT Austin), Yossi Gandelsman, Michaël Gharbi (Adobe) и Qixing Huang (UT Austin), с статьёй и страницей проекта, полной демо «до/после».
Длинное видео, отредактированное по чанкам с разными инструкциями: слева исходник, справа результат.
Как это работает
Вместо адаптации видео-диффузионного трансформера Qwen-Video-Edit учит модель редактирования изображений работать с видео-латентами:
- Warm-started проекции — две крошечные обучаемые проекции соединяют 16-канальные видео-латентные пространства Wan 2.1 с токен-пространством DiT, инициализируясь от входных/выходных слоёв самого DiT, так что статичное видео встраивается так же, как изображение Qwen
- Сеточное позиционное кодирование — латентные кадры раскладываются как тайлы одного виртуального большого изображения, повторяя априорные представления модели изображений
- Промпт + превью кадров — ветка Qwen2.5-VL кодирует инструкцию вместе с превью исходных кадров
Замороженный VAE Wan 2.1 отвечает за кодирование и декодирование, а опциональный этап улучшения через денойзинг Wan 2.2 (из Ditto) дочищает отредактированные латенты.
«Преврати видео в пастельную иллюстрацию из детской книги» — результат из галереи страницы проекта.
Ноды ComfyUI
Репозиторий одновременно является пакетом кастомных нод ComfyUI с тремя нодами в категории QwenVideoEdit, работающими в семантике одного чанка (один вызов сэмплера редактирует окно num_frames):
| Нода | Роль |
|---|---|
Qwen-Video-Edit Loader | Загружает DiT, текстовый энкодер, VAE и ваш дообученный чекпоинт |
Qwen-Video-Edit Sampler (one chunk) | Редактирует чанк кадров: prompt, num_frames, max_pixels, steps, cfg_scale, seed |
Wan2.2 Enhance (Ditto) | Обязательный этап улучшения с wan22_ckpt_dir |
Чекпоинты
Все дообученные чекпоинты лежат на Hugging Face, рекомендуемые также продублированы на ModelScope. Имена папок кодируют обучающий поднабор (Ditto-1M) и поддерживаемое число кадров.
| Чекпоинт | Данные обучения | Кадры | Макс. пикселей |
|---|---|---|---|
360P/step-30000 ⭐ | global + local | 45 | 245760 |
480P/global_45/step-6000 | global | 45 | 399360 |
480P/local_45/step-11000 | local | 45 | 399360 |
480P/sim2real_45/step-7000 | sim2real | 45 | 399360 |
480P/global_local_81/step-6500 ⭐ | global + local | 81 | 399360 |
720P/global_local_45/step-3500 | global + local | 45 | 921600 |
«Преврати сцену в цифровую картину тушью» — результат из галереи страницы проекта.
Доступность
Qwen-Video-Edit распространяется как пакет кастомных нод ComfyUI: склонируйте yunpeng1998/Qwen-Video-Edit в ComfyUI/custom_nodes/, установите зависимости и ComfyUI-VideoHelperSuite, затем загрузите пример воркфлоу (comfyui_workflows/qwen_video_edit_chunk.json). При первом запуске скачается около 55 ГБ базовых весов (DiT Qwen-Image-Edit, текстовый энкодер, VAE Wan 2.1); для этапа улучшения Wan 2.2 дополнительно нужен Wan-AI/Wan2.2-T2V-A14B. Параметры чекпоинта latent_mode / pe_mode / zero_cond_t должны соответствовать загруженному чекпоинту. Для рекомендуемых чекпоинтов доступно зеркало ModelScope.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.