Avatar-Forever: avatares parlantes en tiempo real basados en LTX 2.3
PolyU, ByteDance y AMD lanzan Avatar-Forever, un modelo de avatar por audio basado en LTX 2.3 22B con streaming ForeverCache: generación ilimitada a 27.2 FPS.
Descripción General
La mayoría de los sistemas de vídeo en streaming entrenan generadores de pocos pasos mediante pipelines secuenciales centrados en la destilación, donde los fallos de las etapas anteriores se acumulan y los objetivos de destilación degradan la calidad en rollouts autoregresivos largos. Avatar-Forever, en cambio, trata la eficiencia de generación y la robustez de horizonte largo como dos capacidades independientes entrenadas en paralelo:
- Una rama de destilación de parámetros completos entrena un generador eficiente con alta calidad visual
- Un adaptador de horizonte largo ligero se entrena con Recovery-oriented Rollout Training (RRT) para mantenerse robusto bajo inferencia de horizonte largo
Framework de entrenamiento paralelo desacoplado de Avatar-Forever (fuente: leeruibin/avatarforever)
ForeverCache Streaming
Durante la inferencia en streaming, Avatar-Forever utiliza ForeverCache, un mecanismo de caché de características por bloques que reduce el cómputo redundante del historial, manteniendo la memoria y el cómputo acotados mientras genera vídeo de longitud ilimitada. Combinado con el modelo fundacional LTX 2.3 22B, mantiene la consistencia de identidad, la coherencia de movimiento y la fidelidad visual en conversaciones largas, canciones y sesiones interactivas.
Disponibilidad
El proyecto ha publicado el paper, el código de inferencia y los checkpoints del modelo; el código de entrenamiento y los datos aún están pendientes.
- Pesos:
avatarforever-ltx-2.3-22b.safetensorsen Hugging Face - Codificador de texto: Gemma 3 12B con acceso restringido (acepta la licencia antes de descargar)
- Inferencia: CLI de Python en el repositorio de GitHub. Aún no hay integración con ComfyUI
Comentarios
Inicia sesión con GitHub para unirte a la conversación.