Qwen-Video-Edit:基于指令的视频编辑,支持 ComfyUI 节点

ComfyUI Wikinews

Qwen-Video-Edit 复用 Qwen-Image-Edit 的 DiT 直接编辑 Wan 2.1 视频潜空间,支持文本指令驱动的视频编辑,提供官方 ComfyUI 自定义节点与 360P/480P/720P 检查点。

Qwen-Video-Edit 是一款基于指令的视频编辑模型,它复用 Qwen-Image-Edit 的 DiT 直接编辑 Wan 2.1 视频 VAE 潜空间,无需视频预训练 Transformer。项目于 8 月 14 日首次发布(代码、论文、360P 检查点);8 月 20 日新增官方 ComfyUI 支持以及 480P、720P 检查点。

该工作由 Yunpeng Bai(德州大学奥斯汀分校)、Yossi Gandelsman、Michaël Gharbi(Adobe)和 Qixing Huang(德州大学奥斯汀分校)完成,并提供论文和包含大量前后对比演示的项目主页

长视频编辑演示

分块编辑的长视频演示:左侧为源视频,右侧为编辑结果。

工作原理

Qwen-Video-Edit 不去适配视频扩散 Transformer,而是让图像编辑模型直接处理视频潜空间:

  • 热启动投影 — 两个极小的可训练投影将 Wan 2.1 的 16 通道视频潜空间桥接到 DiT 的 token 空间,并从 DiT 自身的输入/输出层初始化,使静态视频的嵌入与 Qwen 图像完全一致
  • 网格位置编码 — 将潜在帧排列成一张虚拟大图的瓦片,与图像模型的先验对齐
  • 提示词 + 帧网格预览 — Qwen2.5-VL 分支将指令与源帧预览一起编码

冻结的 Wan 2.1 VAE 负责编解码,可选的 Wan 2.2 去噪增强阶段(来自 Ditto)用于清理编辑后的潜空间。

"将视频转换为粉彩童话绘本插画风格" — 项目主页画廊中的编辑结果。

ComfyUI 节点

该仓库同时就是一个 ComfyUI 自定义节点包,在 QwenVideoEdit 分类下提供三个节点,采用单块语义(一次采样调用编辑一个 num_frames 窗口):

节点作用
Qwen-Video-Edit Loader加载 DiT、文本编码器、VAE 和微调检查点
Qwen-Video-Edit Sampler (one chunk)编辑一个帧块:prompt、num_frames、max_pixels、steps、cfg_scale、seed
Wan2.2 Enhance (Ditto)必需的去噪增强节点,配置 wan22_ckpt_dir
Qwen-Video-Edit ComfyUI 工作流演示

检查点

所有微调检查点都发布在 Hugging Face 上,推荐检查点同时镜像到 ModelScope。目录名编码了训练子集(Ditto-1M)和支持的帧数。

检查点训练数据帧数最大像素
360P/step-30000global + local45245760
480P/global_45/step-6000global45399360
480P/local_45/step-11000local45399360
480P/sim2real_45/step-7000sim2real45399360
480P/global_local_81/step-6500global + local81399360
720P/global_local_45/step-3500global + local45921600

"将场景转换为数字水墨画风格" — 项目主页画廊中的编辑结果。

可用性

Qwen-Video-Edit 以 ComfyUI 自定义节点包的形式提供:将 yunpeng1998/Qwen-Video-Edit 克隆到 ComfyUI/custom_nodes/,安装依赖及 ComfyUI-VideoHelperSuite,然后加载示例工作流(comfyui_workflows/qwen_video_edit_chunk.json)。首次运行会下载约 55GB 基础权重(Qwen-Image-Edit DiT、文本编码器、Wan 2.1 VAE);Wan2.2 增强阶段还需要 Wan-AI/Wan2.2-T2V-A14B。检查点的 latent_mode / pe_mode / zero_cond_t 设置必须与所加载的检查点一致。推荐检查点提供 ModelScope 镜像

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Qwen-Video-Edit:基于指令的视频编辑,支持 ComfyUI 节点 | ComfyUI Wiki