Qwen-Video-Edit: редактирование видео по инструкциям с нодами ComfyUI

ComfyUI Wikinews

Qwen-Video-Edit переиспользует DiT от Qwen-Image-Edit для редактирования видео-латентов Wan 2.1 по текстовым инструкциям, с нодами ComfyUI и чекпоинтами 360P/480P/720P.

Qwen-Video-Edit — модель редактирования видео по текстовым инструкциям, которая переиспользует DiT от Qwen-Image-Edit, чтобы напрямую редактировать латентное пространство видео-VAE Wan 2.1, без необходимости в предобученном на видео трансформере. Первый релиз состоялся 14 августа (код, статья, чекпоинт 360P); 20 августа проект получил официальную поддержку ComfyUI и новые чекпоинты 480P и 720P.

Работа принадлежит Yunpeng Bai (UT Austin), Yossi Gandelsman, Michaël Gharbi (Adobe) и Qixing Huang (UT Austin), с статьёй и страницей проекта, полной демо «до/после».

Демо редактирования длинного видео

Длинное видео, отредактированное по чанкам с разными инструкциями: слева исходник, справа результат.

Как это работает

Вместо адаптации видео-диффузионного трансформера Qwen-Video-Edit учит модель редактирования изображений работать с видео-латентами:

  • Warm-started проекции — две крошечные обучаемые проекции соединяют 16-канальные видео-латентные пространства Wan 2.1 с токен-пространством DiT, инициализируясь от входных/выходных слоёв самого DiT, так что статичное видео встраивается так же, как изображение Qwen
  • Сеточное позиционное кодирование — латентные кадры раскладываются как тайлы одного виртуального большого изображения, повторяя априорные представления модели изображений
  • Промпт + превью кадров — ветка Qwen2.5-VL кодирует инструкцию вместе с превью исходных кадров

Замороженный VAE Wan 2.1 отвечает за кодирование и декодирование, а опциональный этап улучшения через денойзинг Wan 2.2 (из Ditto) дочищает отредактированные латенты.

«Преврати видео в пастельную иллюстрацию из детской книги» — результат из галереи страницы проекта.

Ноды ComfyUI

Репозиторий одновременно является пакетом кастомных нод ComfyUI с тремя нодами в категории QwenVideoEdit, работающими в семантике одного чанка (один вызов сэмплера редактирует окно num_frames):

НодаРоль
Qwen-Video-Edit LoaderЗагружает DiT, текстовый энкодер, VAE и ваш дообученный чекпоинт
Qwen-Video-Edit Sampler (one chunk)Редактирует чанк кадров: prompt, num_frames, max_pixels, steps, cfg_scale, seed
Wan2.2 Enhance (Ditto)Обязательный этап улучшения с wan22_ckpt_dir
Демо воркфлоу ComfyUI для Qwen-Video-Edit

Чекпоинты

Все дообученные чекпоинты лежат на Hugging Face, рекомендуемые также продублированы на ModelScope. Имена папок кодируют обучающий поднабор (Ditto-1M) и поддерживаемое число кадров.

ЧекпоинтДанные обученияКадрыМакс. пикселей
360P/step-30000global + local45245760
480P/global_45/step-6000global45399360
480P/local_45/step-11000local45399360
480P/sim2real_45/step-7000sim2real45399360
480P/global_local_81/step-6500global + local81399360
720P/global_local_45/step-3500global + local45921600

«Преврати сцену в цифровую картину тушью» — результат из галереи страницы проекта.

Доступность

Qwen-Video-Edit распространяется как пакет кастомных нод ComfyUI: склонируйте yunpeng1998/Qwen-Video-Edit в ComfyUI/custom_nodes/, установите зависимости и ComfyUI-VideoHelperSuite, затем загрузите пример воркфлоу (comfyui_workflows/qwen_video_edit_chunk.json). При первом запуске скачается около 55 ГБ базовых весов (DiT Qwen-Image-Edit, текстовый энкодер, VAE Wan 2.1); для этапа улучшения Wan 2.2 дополнительно нужен Wan-AI/Wan2.2-T2V-A14B. Параметры чекпоинта latent_mode / pe_mode / zero_cond_t должны соответствовать загруженному чекпоинту. Для рекомендуемых чекпоинтов доступно зеркало ModelScope.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Qwen-Video-Edit: редактирование видео по инструкциям с нодами ComfyUI | ComfyUI Wiki