CoinVE-Edit:基于 Wan2.1 的多指令视频编辑模型
腾讯发布 CoinVE-Edit,一个基于 Wan2.1-T2V-14B 与 Qwen3-VL-8B 的 22B 组合式视频编辑模型,可在单次前向传播中同时执行 2-5 个区域感知编辑。
腾讯智能创作平台团队于 8 月 18 日发布了 CoinVE-Edit,一个可在单次前向传播中同时执行多条编辑指令的组合式指令视频编辑模型。该模型基于 Wan2.1-T2V-14B 视频 DiT 与 Qwen3-VL-8B 多模态编码器构建,总参数量 22B,与 CoinVE-200K 训练数据集和 CoinVE-Bench 评测基准一同发布。
CoinVE-Edit 框架:MLLM 将每条指令与源视频一起编码,掩码头预测每条指令对应的区域,残差注意力模块将区域引导注入 Wan2.1 DiT。
一次前向传播完成多条编辑
大多数开源视频编辑模型一次只处理一条指令。CoinVE-Edit 可接受同一视频片段的 2-5 条编辑指令并同时执行,每条编辑被限定在各自区域内:
- 区域感知掩码引导 — 轻量掩码头根据 MLLM 视觉 token 预测每条指令的空间掩码,将编辑限制在正确区域
- 残差注意力 — 残差注意力模块将逐指令的掩码引导注入 DiT 注意力层,使各编辑落在自己的区域,同时保持画面其余部分不变
- 组合式操作 — 替换(Replace)、添加(Add)、移除(Remove)与背景更换(Background Change)可在一次前向传播中任意组合
CoinVE-200K 数据集
CoinVE-200K 是包含 20 万+ 个 1080p 视频编辑对(每条片段最长 201 帧)的大规模数据集,通过自动化数据生成与质量过滤流程构建。每个样本包含针对人物、物体和背景的 2-5 个原子编辑操作,并带有逐指令与组合区域掩码。ReCo-Data、OpenVE-3M 等现有数据集只关注单指令编辑,这限制了模型在真实多编辑场景中的能力。
CoinVE-200K 与现有视频编辑数据集对比:组合式、多指令样本,带逐指令与组合掩码。
基准评测:CoinVE-Bench
CoinVE-Bench 提供 361 个多指令测试用例,由 Gemini 3.6 Flash 评分。CoinVE-Edit 在编辑准确率指标(SA / SPA / EP)与运动自然度(MN)上领先于开源与商业系统:
| 模型 | SA | SPA | EP | AN | SC | MN | CP |
|---|---|---|---|---|---|---|---|
| CoinVE-Edit | 87.97 | 89.45 | 89.60 | 91.85 | 91.17 | 95.30 | 90.83 |
| Seedance 2.0 | 85.34 | 87.71 | 88.08 | 93.19 | 95.84 | 92.87 | 93.91 |
| Kling O3 | 86.91 | 80.93 | 89.06 | 92.55 | 90.30 | 93.91 | 84.51 |
| VACE | 3.98 | 17.15 | 6.50 | 26.69 | 13.82 | 15.21 | 87.83 |
| KiWiEdit | 76.50 | 69.92 | 80.28 | 78.37 | 78.50 | 80.76 | 70.31 |
可用性
CoinVE-Edit 目前没有原生 ComfyUI 支持,需要通过基于 DiffSynth-Studio 的官方 Python 推理流程运行。checkpoint 包含 DiT LoRA(rank 128)、MLLM LoRA(rank 256)、学习得到的图像/视频查询嵌入、连接器、VAE 条件编码器与掩码头,必须加载在 Wan2.1-T2V-14B 和 Qwen3-VL-8B-Instruct 基座模型之上。项目提供了 Hugging Face 演示空间 供试用。
技术报告 与项目主页详细介绍了架构、数据流程与基准评测;推理脚本位于 CoinVE-200K GitHub 仓库。
评论
使用 GitHub 登录后即可参与讨论。