CoinVE-Edit: edición de video multi-instrucción basada en Wan2.1

ComfyUI Wikinews

Tencent lanza CoinVE-Edit, un modelo de edición de video composicional de 22B basado en Wan2.1 y Qwen3-VL-8B que aplica de 2 a 5 ediciones regionales en una sola pasada.

El equipo de Smart Creation Platform de Tencent lanzó CoinVE-Edit el 18 de agosto, un modelo de edición de video guiada por instrucciones composicionales que ejecuta múltiples instrucciones de edición en una sola pasada hacia adelante. Construido sobre el DiT de video Wan2.1-T2V-14B y un codificador multimodal Qwen3-VL-8B, el modelo de 22B se publica junto con el conjunto de datos CoinVE-200K y el benchmark de evaluación CoinVE-Bench.

Marco de CoinVE-Edit

Marco de CoinVE-Edit: un MLLM codifica cada instrucción junto con el video fuente, una cabeza de máscara predice las regiones por instrucción y un módulo de atención residual guía el DiT de Wan2.1.

Varias ediciones en una sola pasada

La mayoría de los modelos de edición de video de código abierto manejan una instrucción a la vez. CoinVE-Edit acepta de 2 a 5 instrucciones de edición para el mismo clip y las aplica simultáneamente, con cada edición confinada a su región designada:

  • Guía de máscara con conciencia de región — una cabeza de máscara ligera predice una máscara espacial por instrucción a partir de los tokens visuales del MLLM, manteniendo cada edición dentro del área correcta
  • Atención residual — un módulo de atención residual inyecta la guía de máscara por instrucción en las capas de atención del DiT, de modo que cada edición se aplica en su propia región mientras el resto del fotograma permanece intacto
  • Operaciones composicionales — Replace (reemplazar), Add (añadir), Remove (eliminar) y Background Change (cambiar fondo) se pueden combinar libremente en una sola pasada

El conjunto de datos CoinVE-200K

CoinVE-200K es un conjunto de datos a gran escala de más de 200.000 pares de edición de video en 1080p (hasta 201 fotogramas por clip), construido mediante un pipeline automatizado de generación de datos y filtrado de calidad. Cada muestra contiene de 2 a 5 operaciones de edición atómicas sobre personas, objetos y fondos, con máscaras por instrucción y combinadas. Los conjuntos existentes como ReCo-Data y OpenVE-3M se centran en la edición de una sola instrucción, lo que limita a los modelos entrenados en escenarios reales de múltiples ediciones.

Comparación del conjunto de datos CoinVE-200K

CoinVE-200K frente a conjuntos de edición de video existentes: muestras composicionales y multi-instrucción con máscaras por instrucción y combinadas.

Benchmark: CoinVE-Bench

CoinVE-Bench ofrece 361 casos de prueba multi-instrucción puntuados por Gemini 3.6 Flash. CoinVE-Edit lidera las métricas de precisión de edición (SA / SPA / EP) y la naturalidad de movimiento (MN) entre los sistemas abiertos y comerciales:

ModeloSASPAEPANSCMNCP
CoinVE-Edit87.9789.4589.6091.8591.1795.3090.83
Seedance 2.085.3487.7188.0893.1995.8492.8793.91
Kling O386.9180.9389.0692.5590.3093.9184.51
VACE3.9817.156.5026.6913.8215.2187.83
KiWiEdit76.5069.9280.2878.3778.5080.7670.31

Disponibilidad

CoinVE-Edit aún no tiene soporte nativo de ComfyUI; se ejecuta mediante el pipeline oficial de inferencia en Python basado en DiffSynth-Studio. El checkpoint incluye el LoRA del DiT (rank 128), el LoRA del MLLM (rank 256), los embeddings de consulta de imagen/video aprendidos, el conector, el codificador de condiciones del VAE y la cabeza de máscara, y debe cargarse sobre los modelos base Wan2.1-T2V-14B y Qwen3-VL-8B-Instruct. Hay un espacio de demostración en Hugging Face disponible para probar el modelo.

El informe técnico y la página del proyecto detallan la arquitectura, el pipeline de datos y el benchmark; los scripts de inferencia están en el repositorio de GitHub CoinVE-200K.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
CoinVE-Edit: edición de video multi-instrucción basada en Wan2.1 | ComfyUI Wiki