Avatar-Forever: говорящие аватары на базе LTX 2.3 в реальном времени

ComfyUI Wikinews

PolyU, ByteDance и AMD выпустили Avatar-Forever, модель говорящих аватаров, управляемую аудио, на базе LTX 2.3 22B с ForeverCache: неограниченная генерация со скоростью 27.2 FPS.

Avatar-Forever (Страница проекта | GitHub | Статья | Модель) представляет собой фреймворк генерации говорящих аватаров в реальном времени на основе аудио с длинным горизонтом, построенный на видеобэкбоне LTX 2.3 22B и разработанный Гонконгским политехническим университетом, ByteDance и AMD. Он генерирует практически неограниченное видео говорящих аватаров со скоростью 27.2 FPS (768 x 512) end-to-end на одном H100.

Обзор

Большинство систем потокового видео обучают генераторы с малым числом шагов через последовательные конвейеры, ориентированные на дистилляцию, где ошибки ранних этапов накапливаются, а цели дистилляции ухудшают качество при длительных авторегрессивных прогонах. Avatar-Forever вместо этого рассматривает эффективность генерации и устойчивость на длинном горизонте как две независимые способности, обучаемые параллельно:

  • Ветвь полнопараметрической дистилляции обучает эффективный генератор с высоким визуальным качеством
  • Легковесный адаптер длинного горизонта обучается с помощью Recovery-oriented Rollout Training (RRT), чтобы оставаться устойчивым при выводе на длинном горизонте
Обзор раздельного параллельного обучения Avatar-Forever

Схема раздельного параллельного обучения Avatar-Forever (источник: leeruibin/avatarforever)

Потоковая передача ForeverCache

Во время потокового вывода Avatar-Forever использует ForeverCache, механизм поблочного кэширования признаков, который сокращает избыточные вычисления истории и удерживает память и вычислительную нагрузку в ограниченных пределах при генерации видео неограниченной длины. В сочетании с базовой моделью LTX 2.3 22B он сохраняет идентичность, согласованность движений и визуальную точность на протяжении длительных разговоров, пения и интерактивных сессий.

Доступность

Проект выпустил статью, код вывода и чекпойнты модели; код и данные для обучения пока не опубликованы.

  • Веса: avatarforever-ltx-2.3-22b.safetensors на Hugging Face
  • Текстовый энкодер: Gemma 3 12B с ограниченным доступом (примите лицензию перед загрузкой)
  • Вывод: Python CLI в репозитории GitHub; интеграции с ComfyUI пока нет

Ссылки

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Avatar-Forever: говорящие аватары на базе LTX 2.3 в реальном времени | ComfyUI Wiki