Wan2.2 Dancer: генерация танцевальных видео под музыку от Tongyi Lab

ComfyUI Wiki

Wan2.2 Dancer (Wan-Dancer-14B) — модель генерации танцевальных видео под музыку от Tongyi Lab (Alibaba), основанная на архитектуре Wan2.2 MoE. Создаёт видео 720p/30fps с танцами на основе музыки и референсного изображения.

W

Wan2.2 Dancer

VideoMusic-to-DanceImage-to-VideoOpen Source

Модель генерации танцевальных видео под музыку от Tongyi Lab (Alibaba Group). Основана на архитектуре Wan2.2 MoE, создаёт видео 720p/30fps с танцами, синхронизированными с музыкой, на основе референсного изображения. Поддерживает жанры: китайский классический танец, K-Pop, уличный танец, чечётка и латиноамериканские танцы.

РазработчикTongyi Lab (Alibaba Group)
Дата выхода2026-07-13
АрхитектураИерархическая структура на основе Wan2.2 MoE (глобальный планировщик ключевых кадров + локальный уточнитель временных интервалов)
ЛицензияApache-2.0
Параметры14B (всего: глобальная и локальная ветви)
ВозможностиМузыка-в-танец, изображение-в-видео, 5 жанров танцев, минутный вывод
Выходное разрешение720p при 30fps, до 60+ секунд
Протестированное оборудование8 × NVIDIA A800 80GB

Обзор

Wan-Dancer-14B — это открытая модель от Tongyi Lab (исследовательского института Alibaba Group, стоящего за Qwen, Wan и Tongyi Fun), которая создаёт качественные, ритмически синхронизированные танцевальные видео на основе музыки и референсных изображений. Модель преодолевает традиционное ограничение длительности диффузионной генерации видео, выдавая стабильное 720p видео с частотой 30 кадров в секунду в течение более минуты — то, что существующим моделям обычно удаётся лишь до 20 секунд.

Модель принимает референсное изображение (показывающее внешность и позу танцора) и аудиофайл (музыкальный трек), а также текстовую подсказку с описанием желаемого танцевального стиля. Затем она генерирует полноценное танцевальное видео, синхронизированное с ритмом и структурой музыки.

Архитектура

Wan-Dancer использует иерархическую структуру, которая разделяет процесс генерации на два этапа:

Этап 1: глобальное планирование ключевых кадров

На первом этапе создаются сегменты ключевых кадров длительностью 5 секунд, которые отражают музыкальную структуру всего трека, обеспечивая глобальную согласованность на всём протяжении видео. Для долгосрочного планирования используется полный музыкальный трек в качестве контекста.

Этап 2: локальное временное уточнение

На втором этапе каждый сегмент уточняется до высокого разрешения 720p, добавляются мелкие детали с сохранением временной плавности между сегментами.

Ключевые технические инновации

  • Time-Mapped RoPE Embeddings: динамическая адаптация частоты кадров, точно согласующая временные метки движений с музыкальными битами и структурой, обеспечивая точную синхронизацию аудио и видео.
  • Функция потерь на основе оптического потока: улучшает непрерывность движения, штрафуя за дрожание и резкие переходы между соседними кадрами, что приводит к более плавным танцевальным движениям.
  • Контроль скорости движения: сохраняет высокую детализацию при быстрых движениях и резких переходах, предотвращая размытие и артефакты, типичные для длительной генерации видео.
  • Музыкальный контекст всего трека: в отличие от моделей, обрабатывающих короткие окна аудио, глобальный этап использует весь музыкальный трек для согласованного долгосрочного планирования на всю продолжительность танца.

Структура основана на наработках Wan2.1, DiffSynth-Studio и архитектуре Wan2.2 MoE.

Жанры танцев

Wan-Dancer поддерживает пять танцевальных жанров с полной музыкальной синхронизацией:

ЖанрОписание
Китайский классический танецЭлегантные, плавные движения с традиционной китайской эстетикой
K-Pop танецСовременная, энергичная хореография под поп-музыку
Уличный танецГородские, свободные движения под влиянием хип-хопа
ЧечёткаРитмичная работа ног, синхронизированная с ударной музыкой
Латиноамериканские танцыСтрастные, динамичные парные стили

Интеграция с ComfyUI

Wan-Dancer-14B нативно поддерживается в ComfyUI 0.22.0+. Начните с официального воркфлоу Wan-Dancer. Убедитесь, что ComfyUI обновлён до последней версии.

Необходимые файлы моделей

Разместите следующие файлы в директории ComfyUI/models/:

+--- diffusion_models/
|    +--- wan2.2_dancer_14b_global_fp8_scaled.safetensors
|    +--- wan2.2_dancer_14b_local_fp8_scaled.safetensors
+--- loras/
|    +--- lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
+--- text_encoders/
|    +--- umt5_xxl_fp16.safetensors
+--- clip_vision/
|    +--- clip_vision_h.safetensors
+--- vae/
|    +--- Wan2_1_VAE_bf16.safetensors

Файлы моделей размещены в репозиториях Comfy-Org/Wan-Dancer и Comfy-Org/Wan_2.1_ComfyUI_repackaged.

Эта модель рендерит 149 кадров за раз, что требует большого объёма VRAM. Воркфлоу по умолчанию выдаёт 5 секунд видео. Перед запуском убедитесь, что у вас мощный GPU (рекомендуется 24+ ГБ VRAM).

Ресурсы

РесурсСсылка
СтатьяarXiv:2607.09581
Страница проектаhumanaigc.github.io/wan-dancer-project/
Репозиторий GitHubgithub.com/Wan-Video/Wan-Dancer
HuggingFace (оригинал)Wan-AI/Wan-Dancer-14B
HuggingFace (Comfy-Org)Comfy-Org/Wan-Dancer
Воркфлоу ComfyUIvideo_wan_dancer.json
ModelScopemodelscope.cn/models/Wan-AI/Wan-Dancer-14B
Демо на ModelScopemodelscope.ai/studios/Wan-AI/Wan-Dancer

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…