Avatar-Forever: avatares parlantes en tiempo real basados en LTX 2.3

ComfyUI Wikinews

PolyU, ByteDance y AMD lanzan Avatar-Forever, un modelo de avatar por audio basado en LTX 2.3 22B con streaming ForeverCache: generación ilimitada a 27.2 FPS.

Avatar-Forever (Página del Proyecto | GitHub | Paper | Modelo) es un framework de generación de avatares parlantes en tiempo real, de horizonte largo e impulsado por audio, construido sobre un backbone de vídeo LTX 2.3 22B, desarrollado por la Universidad Politécnica de Hong Kong, ByteDance y AMD. Genera vídeo de avatar parlante prácticamente ilimitado a 27.2 FPS (768 x 512) de extremo a extremo en una sola H100.

Descripción General

La mayoría de los sistemas de vídeo en streaming entrenan generadores de pocos pasos mediante pipelines secuenciales centrados en la destilación, donde los fallos de las etapas anteriores se acumulan y los objetivos de destilación degradan la calidad en rollouts autoregresivos largos. Avatar-Forever, en cambio, trata la eficiencia de generación y la robustez de horizonte largo como dos capacidades independientes entrenadas en paralelo:

  • Una rama de destilación de parámetros completos entrena un generador eficiente con alta calidad visual
  • Un adaptador de horizonte largo ligero se entrena con Recovery-oriented Rollout Training (RRT) para mantenerse robusto bajo inferencia de horizonte largo
Descripción general del entrenamiento paralelo desacoplado de Avatar-Forever

Framework de entrenamiento paralelo desacoplado de Avatar-Forever (fuente: leeruibin/avatarforever)

ForeverCache Streaming

Durante la inferencia en streaming, Avatar-Forever utiliza ForeverCache, un mecanismo de caché de características por bloques que reduce el cómputo redundante del historial, manteniendo la memoria y el cómputo acotados mientras genera vídeo de longitud ilimitada. Combinado con el modelo fundacional LTX 2.3 22B, mantiene la consistencia de identidad, la coherencia de movimiento y la fidelidad visual en conversaciones largas, canciones y sesiones interactivas.

Disponibilidad

El proyecto ha publicado el paper, el código de inferencia y los checkpoints del modelo; el código de entrenamiento y los datos aún están pendientes.

  • Pesos: avatarforever-ltx-2.3-22b.safetensors en Hugging Face
  • Codificador de texto: Gemma 3 12B con acceso restringido (acepta la licencia antes de descargar)
  • Inferencia: CLI de Python en el repositorio de GitHub. Aún no hay integración con ComfyUI

Enlaces

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Avatar-Forever: avatares parlantes en tiempo real basados en LTX 2.3 | ComfyUI Wiki