CoinVE-Edit : édition vidéo multi-instructions basée sur Wan2.1
Tencent publie CoinVE-Edit, un modèle d'édition vidéo compositionnel de 22B basé sur Wan2.1 et Qwen3-VL-8B qui applique 2 à 5 éditions régionales en une seule passe.
L'équipe Smart Creation Platform de Tencent a publié CoinVE-Edit le 18 août, un modèle d'édition vidéo guidée par instructions compositionnelles qui exécute plusieurs instructions d'édition en une seule passe avant. Construit sur le DiT vidéo Wan2.1-T2V-14B et un encodeur multimodal Qwen3-VL-8B, le modèle de 22B est publié avec le jeu de données CoinVE-200K et le benchmark d'évaluation CoinVE-Bench.
Architecture de CoinVE-Edit : un MLLM encode chaque instruction avec la vidéo source, une tête de masque prédit les régions par instruction et un module d'attention résiduelle guide le DiT de Wan2.1.
Plusieurs éditions en une seule passe
La plupart des modèles d'édition vidéo open source ne traitent qu'une instruction à la fois. CoinVE-Edit accepte de 2 à 5 instructions d'édition pour le même clip et les applique simultanément, chaque édition étant confinée à sa région désignée :
- Guidage de masque conscient de la région — une tête de masque légère prédit un masque spatial par instruction à partir des jetons visuels du MLLM, ce qui maintient chaque édition dans la bonne zone
- Attention résiduelle — un module d'attention résiduelle injecte le guidage de masque par instruction dans les couches d'attention du DiT, de sorte que les éditions atterrissent dans leurs propres régions tandis que le reste du cadre reste intact
- Opérations compositionnelles — Replace (remplacer), Add (ajouter), Remove (supprimer) et Background Change (changer le fond) peuvent être librement combinées en une seule passe
Le jeu de données CoinVE-200K
CoinVE-200K est un jeu de données à grande échelle de plus de 200 000 paires d'édition vidéo en 1080p (jusqu'à 201 images par clip), construit via un pipeline automatisé de génération de données et de filtrage qualité. Chaque échantillon contient de 2 à 5 opérations d'édition atomiques sur des personnes, des objets et des fonds, avec des masques par instruction et combinés. Les jeux existants comme ReCo-Data et OpenVE-3M se concentrent sur l'édition à instruction unique, ce qui limite les modèles entraînés dans les scénarios réels d'édition multiple.
CoinVE-200K par rapport aux jeux d'édition vidéo existants : échantillons compositionnels multi-instructions avec masques par instruction et combinés.
Benchmark : CoinVE-Bench
CoinVE-Bench fournit 361 cas de test multi-instructions notés par Gemini 3.6 Flash. CoinVE-Edit mène les métriques de précision d'édition (SA / SPA / EP) et de naturalité de mouvement (MN) parmi les systèmes ouverts et commerciaux :
| Modèle | SA | SPA | EP | AN | SC | MN | CP |
|---|---|---|---|---|---|---|---|
| CoinVE-Edit | 87.97 | 89.45 | 89.60 | 91.85 | 91.17 | 95.30 | 90.83 |
| Seedance 2.0 | 85.34 | 87.71 | 88.08 | 93.19 | 95.84 | 92.87 | 93.91 |
| Kling O3 | 86.91 | 80.93 | 89.06 | 92.55 | 90.30 | 93.91 | 84.51 |
| VACE | 3.98 | 17.15 | 6.50 | 26.69 | 13.82 | 15.21 | 87.83 |
| KiWiEdit | 76.50 | 69.92 | 80.28 | 78.37 | 78.50 | 80.76 | 70.31 |
Disponibilité
CoinVE-Edit n'a pas encore de support natif ComfyUI ; il fonctionne via le pipeline d'inférence Python officiel basé sur DiffSynth-Studio. Le checkpoint regroupe le LoRA du DiT (rank 128), le LoRA du MLLM (rank 256), les embeddings de requête image/vidéo appris, le connecteur, l'encodeur de conditions du VAE et la tête de masque, et doit être chargé par-dessus les modèles de base Wan2.1-T2V-14B et Qwen3-VL-8B-Instruct. Un espace de démonstration Hugging Face est disponible pour essayer le modèle.
Le rapport technique et la page du projet détaillent l'architecture, le pipeline de données et le benchmark ; les scripts d'inférence se trouvent dans le dépôt GitHub CoinVE-200K.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.