CoinVE-Edit: мультиинструкционное редактирование видео на базе Wan2.1

ComfyUI Wikinews

Tencent выпускает CoinVE-Edit, композиционную модель редактирования видео на 22B параметров на базе Wan2.1 и Qwen3-VL-8B, применяющую 2-5 региональных правок за один проход.

Команда Smart Creation Platform из Tencent 18 августа выпустила CoinVE-Edit — композиционную модель редактирования видео по инструкциям, которая выполняет несколько инструкций редактирования за один прямой проход. Модель на 22B параметров построена на видеодиффузоре Wan2.1-T2V-14B и мультимодальном энкодере Qwen3-VL-8B и публикуется вместе с обучающим набором данных CoinVE-200K и бенчмарком CoinVE-Bench.

Архитектура CoinVE-Edit

Архитектура CoinVE-Edit: MLLM кодирует каждую инструкцию вместе с исходным видео, головка масок предсказывает регионы для каждой инструкции, а модуль остаточного внимания направляет DiT Wan2.1.

Несколько правок за один проход

Большинство опенсорсных моделей редактирования видео обрабатывают по одной инструкции за раз. CoinVE-Edit принимает от 2 до 5 инструкций редактирования для одного клипа и применяет их одновременно, ограничивая каждую правку своей областью:

  • Маски с учётом региона — лёгкая головка масок предсказывает пространственную маску для каждой инструкции на основе визуальных токенов MLLM, удерживая каждую правку в нужной области
  • Остаточное внимание — модуль остаточного внимания внедряет маску каждой инструкции в слои внимания DiT, поэтому правки попадают в свои регионы, а остальная часть кадра остаётся нетронутой
  • Композиционные операции — Replace (замена), Add (добавление), Remove (удаление) и Background Change (смена фона) свободно комбинируются за один проход

Набор данных CoinVE-200K

CoinVE-200K — это крупномасштабный набор из более 200 000 пар «видео-редактирование» в разрешении 1080p (до 201 кадра на клип), собранный с помощью автоматизированного пайплайна генерации данных и фильтрации качества. Каждый пример содержит от 2 до 5 атомарных операций редактирования над людьми, объектами и фонами, с масками как по каждой инструкции, так и комбинированными. Существующие наборы, такие как ReCo-Data и OpenVE-3M, ориентированы на редактирование по одной инструкции, что ограничивает обученные модели в реальных сценариях с несколькими правками.

Сравнение набора данных CoinVE-200K

CoinVE-200K в сравнении с существующими наборами для редактирования видео: композиционные мультиинструкционные примеры с масками по инструкциям и комбинированными масками.

Бенчмарк: CoinVE-Bench

CoinVE-Bench содержит 361 мультиинструкционный тестовый пример, оцениваемый Gemini 3.6 Flash. CoinVE-Edit лидирует по метрикам точности редактирования (SA / SPA / EP) и естественности движения (MN) среди открытых и коммерческих систем:

МодельSASPAEPANSCMNCP
CoinVE-Edit87.9789.4589.6091.8591.1795.3090.83
Seedance 2.085.3487.7188.0893.1995.8492.8793.91
Kling O386.9180.9389.0692.5590.3093.9184.51
VACE3.9817.156.5026.6913.8215.2187.83
KiWiEdit76.5069.9280.2878.3778.5080.7670.31

Доступность

У CoinVE-Edit пока нет нативной поддержки ComfyUI; модель запускается через официальный Python-пайплайн на базе DiffSynth-Studio. Чекпойнт включает LoRA DiT (rank 128), LoRA MLLM (rank 256), обученные эмбеддинги запросов изображения/видео, коннектор, условный энкодер VAE и головку масок; его нужно загружать поверх базовых моделей Wan2.1-T2V-14B и Qwen3-VL-8B-Instruct. Для знакомства с моделью доступно демо-пространство на Hugging Face.

Технический отчёт и страница проекта подробно описывают архитектуру, пайплайн данных и бенчмарк; скрипты инференса находятся в репозитории CoinVE-200K на GitHub.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
CoinVE-Edit: мультиинструкционное редактирование видео на базе Wan2.1 | ComfyUI Wiki