Avatar-Forever: говорящие аватары на базе LTX 2.3 в реальном времени
PolyU, ByteDance и AMD выпустили Avatar-Forever, модель говорящих аватаров, управляемую аудио, на базе LTX 2.3 22B с ForeverCache: неограниченная генерация со скоростью 27.2 FPS.
Обзор
Большинство систем потокового видео обучают генераторы с малым числом шагов через последовательные конвейеры, ориентированные на дистилляцию, где ошибки ранних этапов накапливаются, а цели дистилляции ухудшают качество при длительных авторегрессивных прогонах. Avatar-Forever вместо этого рассматривает эффективность генерации и устойчивость на длинном горизонте как две независимые способности, обучаемые параллельно:
- Ветвь полнопараметрической дистилляции обучает эффективный генератор с высоким визуальным качеством
- Легковесный адаптер длинного горизонта обучается с помощью Recovery-oriented Rollout Training (RRT), чтобы оставаться устойчивым при выводе на длинном горизонте
Схема раздельного параллельного обучения Avatar-Forever (источник: leeruibin/avatarforever)
Потоковая передача ForeverCache
Во время потокового вывода Avatar-Forever использует ForeverCache, механизм поблочного кэширования признаков, который сокращает избыточные вычисления истории и удерживает память и вычислительную нагрузку в ограниченных пределах при генерации видео неограниченной длины. В сочетании с базовой моделью LTX 2.3 22B он сохраняет идентичность, согласованность движений и визуальную точность на протяжении длительных разговоров, пения и интерактивных сессий.
Доступность
Проект выпустил статью, код вывода и чекпойнты модели; код и данные для обучения пока не опубликованы.
- Веса:
avatarforever-ltx-2.3-22b.safetensorsна Hugging Face - Текстовый энкодер: Gemma 3 12B с ограниченным доступом (примите лицензию перед загрузкой)
- Вывод: Python CLI в репозитории GitHub; интеграции с ComfyUI пока нет
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.