Avatar-Forever : des avatars parlants en temps réel basés sur LTX 2.3

ComfyUI Wikinews

PolyU, ByteDance et AMD publient Avatar-Forever, un modèle d'avatar piloté par l'audio, construit sur LTX 2.3 22B avec le streaming ForeverCache : génération illimitée à 27,2 FPS.

Avatar-Forever (Page du projet | GitHub | Article | Modèle) est un framework de génération d'avatars parlants pilotée par l'audio, en temps réel et à long horizon, construit sur un backbone vidéo LTX 2.3 22B, développé par l'Université polytechnique de Hong Kong, ByteDance et AMD. Il génère des vidéos d'avatars parlants pratiquement illimitées à 27,2 FPS (768 x 512), de bout en bout, sur un seul H100.

Aperçu

La plupart des systèmes de streaming vidéo entraînent des générateurs en quelques étapes via des pipelines séquentiels centrés sur la distillation, où les échecs des étapes précédentes se cumulent et où les objectifs de distillation dégradent la qualité lors de longs rollouts autorégressifs. Avatar-Forever traite quant à lui l'efficacité de génération et la robustesse à long horizon comme deux capacités indépendantes entraînées en parallèle :

  • Une branche de distillation à paramètres complets entraîne un générateur efficace avec une qualité visuelle élevée
  • Un adaptateur à long horizon léger est entraîné avec le Recovery-oriented Rollout Training (RRT) pour rester robuste lors de l'inférence à long horizon
Aperçu de l'entraînement parallèle découplé d'Avatar-Forever

Framework d'entraînement parallèle découplé d'Avatar-Forever (source : leeruibin/avatarforever)

Streaming ForeverCache

Lors de l'inférence en streaming, Avatar-Forever utilise ForeverCache, un mécanisme de mise en cache des caractéristiques par blocs qui réduit le calcul redondant de l'historique, en maintenant la mémoire et le calcul dans des limites fixes tout en générant des vidéos de longueur illimitée. Combiné au modèle de base LTX 2.3 22B, il maintient la cohérence de l'identité, la cohérence du mouvement et la fidélité visuelle lors de longues conversations, de chansons et de sessions interactives.

Disponibilité

Le projet a publié l'article, le code d'inférence et les checkpoints du modèle. Le code d'entraînement et les données sont encore en attente.

  • Poids : avatarforever-ltx-2.3-22b.safetensors sur Hugging Face
  • Encodeur de texte : Gemma 3 12B à accès restreint (acceptez la licence avant de télécharger)
  • Inférence : CLI Python dans le référentiel GitHub. Aucune intégration ComfyUI pour le moment.

Liens

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Avatar-Forever : des avatars parlants en temps réel basés sur LTX 2.3 | ComfyUI Wiki