Wan-Animate-2: сквозная анимация персонажей в ComfyUI
Alibaba Tongyi Lab выпускает Wan-Animate-2 — сквозную модель анимации персонажей на основе видео, с текстовым управлением точкой обзора и поддержкой ComfyUI.
Alibaba Tongyi Lab выпустила Wan-Animate-2 7 августа 2026 года. Это сквозной фреймворк анимации персонажей, который напрямую использует управляющее видео в переработанном Diffusion Transformer. Веса базовой и дистиллированной моделей, скрипты для вывода и статья на arXiv находятся в открытом доступе под лицензией Apache-2.0.
Двухветвевая архитектура DiT Wan-Animate-2: управляющее видео используется напрямую, а Time-Align RoPE и Sparse-Ref Attention объединяют внешний вид и движение (источник: страница проекта)
Демонстрационные видео
Высококачественная анимация одного персонажа
Многоперсонажная анимация: управление движением «один-ко-многим» и «многие-ко-многим»
Потоковая анимация персонажей в реальном времени с Wan-Animate-2-Lite
Что нового по сравнению с Wan-Animate
- Без промежуточных экстракторов движения. Wan-Animate-2 подаёт управляющее видео напрямую в переработанный Diffusion Transformer, устраняя этапы извлечения скелета и мимики, которые вызывали дрейф идентичности и ошибки движения.
- Текстовое управление точкой обзора. Выходная перспектива камеры не зависит от управляющего видео, что позволяет получать кадры одной и той же анимации с разных ракурсов с сохранением идентичности.
- Многоперсонажная анимация. Поддерживается управление движением «один-ко-многим» и «многие-ко-многим» за один проход.
- Wan-Animate-2-Lite. Эффективный вариант, достигающий порогов вывода в реальном времени для потоковой анимации персонажей, ориентированный на цифровых аватаров и ведущих прямых эфиров.
Как это работает
Wan-Animate-2 использует двухветвевую архитектуру DiT, которая одновременно использует референсное изображение и референсное видео как условия генерации:
- Time-Align RoPE выравнивает временные позиции между токенами видео (в процессе denoising) и референсными токенами.
- Sparse-Ref Attention выборочно уделяет внимание информативным референсным признакам, а не всей референсной последовательности на каждом шаге.
Вариант с дистилляцией работает за 10 шагов и не требует направления без классификатора (Euler scheduler), в то время как базовая модель использует стандартную 40-шаговую выборку.
Поддержка ComfyUI
Wan-Animate-2 поддерживается нативно в ComfyUI с двумя новыми экспериментальными узлами: WanAnimate2ToVideo (анимирует персонажа из референсного изображения, используя видео с позой/управляющее видео, с параметрами pose_strength, pose_start_percent, pose_end_percent и reference_image_strength) и WanAnimate2Cache (кэширует поблочные активации ветви позы, сокращая время генерации примерно вдвое за счёт ~12,5 ГБ системной памяти при 480x832/81 кадре).
Переупакованные веса Comfy-Org включают модели на основе diffusion в форматах bf16 и int8-convrot, LoRA для пошаговой дистилляции lightx2v, текстовые энкодеры, VAE и CLIP vision в папках, готовых для ComfyUI. Официальный шаблон рабочего процесса:
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.