Avatar-Forever : des avatars parlants en temps réel basés sur LTX 2.3
PolyU, ByteDance et AMD publient Avatar-Forever, un modèle d'avatar piloté par l'audio, construit sur LTX 2.3 22B avec le streaming ForeverCache : génération illimitée à 27,2 FPS.
Aperçu
La plupart des systèmes de streaming vidéo entraînent des générateurs en quelques étapes via des pipelines séquentiels centrés sur la distillation, où les échecs des étapes précédentes se cumulent et où les objectifs de distillation dégradent la qualité lors de longs rollouts autorégressifs. Avatar-Forever traite quant à lui l'efficacité de génération et la robustesse à long horizon comme deux capacités indépendantes entraînées en parallèle :
- Une branche de distillation à paramètres complets entraîne un générateur efficace avec une qualité visuelle élevée
- Un adaptateur à long horizon léger est entraîné avec le Recovery-oriented Rollout Training (RRT) pour rester robuste lors de l'inférence à long horizon
Framework d'entraînement parallèle découplé d'Avatar-Forever (source : leeruibin/avatarforever)
Streaming ForeverCache
Lors de l'inférence en streaming, Avatar-Forever utilise ForeverCache, un mécanisme de mise en cache des caractéristiques par blocs qui réduit le calcul redondant de l'historique, en maintenant la mémoire et le calcul dans des limites fixes tout en générant des vidéos de longueur illimitée. Combiné au modèle de base LTX 2.3 22B, il maintient la cohérence de l'identité, la cohérence du mouvement et la fidélité visuelle lors de longues conversations, de chansons et de sessions interactives.
Disponibilité
Le projet a publié l'article, le code d'inférence et les checkpoints du modèle. Le code d'entraînement et les données sont encore en attente.
- Poids :
avatarforever-ltx-2.3-22b.safetensorssur Hugging Face - Encodeur de texte : Gemma 3 12B à accès restreint (acceptez la licence avant de télécharger)
- Inférence : CLI Python dans le référentiel GitHub. Aucune intégration ComfyUI pour le moment.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.