CoinVE-Edit: Wan2.1 기반 멀티 인스트럭션 비디오 편집 모델
텐센트가 CoinVE-Edit를 공개했습니다. Wan2.1-T2V-14B와 Qwen3-VL-8B를 기반으로 하는 22B 규모의 구성적 비디오 편집 모델로, 단일 포워드 패스에서 2-5개의 영역 인식 편집을 동시에 수행합니다.
텐센트 Smart Creation Platform 팀은 8월 18일 CoinVE-Edit을 공개했습니다. 단일 포워드 패스에서 여러 편집 지시를 동시에 실행하는 구성적 인스트럭션 비디오 편집 모델입니다. Wan2.1-T2V-14B 비디오 DiT와 Qwen3-VL-8B 멀티모달 인코더를 기반으로 하는 22B 규모 모델로, CoinVE-200K 학습 데이터셋과 CoinVE-Bench 평가 벤치마크와 함께 공개되었습니다.
CoinVE-Edit 프레임워크: MLLM이 각 지시를 원본 비디오와 함께 인코딩하고, 마스크 헤드가 지시별 영역을 예측하며, 잔차 어텐션 모듈이 Wan2.1 DiT에 영역 가이던스를 주입합니다.
단일 패스에서 여러 편집 수행
대부분의 오픈소스 비디오 편집 모델은 한 번에 하나의 지시만 처리합니다. CoinVE-Edit은 같은 클립에 대한 2-5개의 편집 지시를 받아 각 편집을 지정된 영역에 한정한 채 동시에 적용합니다:
- 영역 인식 마스크 가이던스 — 경량 마스크 헤드가 MLLM 시각 토큰에서 지시별 공간 마스크를 예측하여 각 편집을 올바른 영역 안에 유지합니다
- 잔차 어텐션 — 잔차 어텐션 모듈이 지시별 마스크 가이던스를 DiT 어텐션 레이어에 주입하여, 편집은 각자의 영역에 적용되고 나머지 프레임은 그대로 유지됩니다
- 구성적 작업 — Replace(교체), Add(추가), Remove(제거), Background Change(배경 변경)를 한 패스에서 자유롭게 조합할 수 있습니다
CoinVE-200K 데이터셋
CoinVE-200K는 20만 개 이상의 1080p 비디오 편집 쌍(클립당 최대 201프레임)으로 구성된 대규모 데이터셋으로, 자동 데이터 생성 및 품질 필터링 파이프라인으로 구축되었습니다. 각 샘플은 사람, 객체, 배경에 걸친 2-5개의 원자적 편집 작업을 포함하며, 지시별 마스크와 결합 마스크를 모두 제공합니다. ReCo-Data, OpenVE-3M 같은 기존 데이터셋은 단일 지시 편집에만 집중되어 있어 실제 다중 편집 시나리오에서 모델의 능력을 제한합니다.
기존 비디오 편집 데이터셋과의 비교: 지시별 및 결합 마스크를 갖춘 구성적 다중 지시 샘플.
벤치마크: CoinVE-Bench
CoinVE-Bench는 Gemini 3.6 Flash가 점수를 매기는 361개의 다중 지시 테스트 케이스를 제공합니다. CoinVE-Edit은 편집 정확도 지표(SA / SPA / EP)와 모션 자연스러움(MN)에서 오픈 및 상용 시스템을 모두 앞섭니다:
| 모델 | SA | SPA | EP | AN | SC | MN | CP |
|---|---|---|---|---|---|---|---|
| CoinVE-Edit | 87.97 | 89.45 | 89.60 | 91.85 | 91.17 | 95.30 | 90.83 |
| Seedance 2.0 | 85.34 | 87.71 | 88.08 | 93.19 | 95.84 | 92.87 | 93.91 |
| Kling O3 | 86.91 | 80.93 | 89.06 | 92.55 | 90.30 | 93.91 | 84.51 |
| VACE | 3.98 | 17.15 | 6.50 | 26.69 | 13.82 | 15.21 | 87.83 |
| KiWiEdit | 76.50 | 69.92 | 80.28 | 78.37 | 78.50 | 80.76 | 70.31 |
사용 가능 여부
CoinVE-Edit은 아직 네이티브 ComfyUI 지원이 없으며, DiffSynth-Studio 기반의 공식 Python 추론 파이프라인으로 실행합니다. checkpoint에는 DiT LoRA(rank 128), MLLM LoRA(rank 256), 학습된 이미지/비디오 쿼리 임베딩, 커넥터, VAE 조건 인코더, 마스크 헤드가 포함되어 있으며, Wan2.1-T2V-14B와 Qwen3-VL-8B-Instruct 베이스 모델 위에 로드해야 합니다. Hugging Face 데모 스페이스에서 모델을 시험해 볼 수 있습니다.
기술 보고서와 프로젝트 페이지에서 아키텍처, 데이터 파이프라인, 벤치마크에 대한 자세한 내용을 확인할 수 있습니다. 추론 스크립트는 CoinVE-200K GitHub 저장소에 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.