Avatar-Forever: 실시간 무한 LTX 2.3 기반 토킹 아바타
ComfyUI Wikinews
PolyU, ByteDance, AMD가 LTX 2.3 22B 기반 실시간 오디오 구동 아바타 모델 Avatar-Forever를 공개했습니다. ForeverCache 스트리밍으로 27.2 FPS의 무제한 생성을 지원합니다.
개요
대부분의 스트리밍 비디오 시스템은 순차적인 증류(distillation) 중심 파이프라인을 통해 few-step 생성기를 학습합니다. 이 과정에서 초기 단계의 실패가 누적되고, 증류 목표가 긴 오토리그레시브 롤아웃에서 품질을 저하시킵니다. Avatar-Forever는 대신 생성 효율과 장기(long-horizon) 견고성을 병렬로 학습되는 두 가지 독립적 기능으로 취급합니다.
- 전체 파라미터 증류 브랜치: 높은 시각적 품질을 갖춘 효율적인 생성기를 학습합니다.
- 경량 장기 어댑터: 복구 중심 롤아웃 학습(Recovery-oriented Rollout Training, RRT)으로 학습되어 장기 추론에서도 견고함을 유지합니다.
Avatar-Forever 분리 병렬 학습 프레임워크 (소스: leeruibin/avatarforever)
ForeverCache 스트리밍
스트리밍 추론 중에 Avatar-Forever는 ForeverCache를 사용합니다. ForeverCache는 청크 단위(chunk-wise) 특징 캐싱 메커니즘으로, 중복된 히스토리 연산을 줄여 무제한 길이의 비디오를 생성하면서도 메모리와 연산량을 제한된 범위로 유지합니다. LTX 2.3 22B 파운데이션 모델과 결합하여 긴 대화, 노래, 인터랙티브 세션에서도 정체성 일관성, 모션 일관성, 시각적 충실도를 유지합니다.
공개 현황
이 프로젝트는 논문, 추론 코드, 모델 체크포인트를 공개했습니다. 학습 코드와 데이터는 아직 대기 중입니다.
- 가중치: Hugging Face의
avatarforever-ltx-2.3-22b.safetensors - 텍스트 인코더: 승인 필요(gated) Gemma 3 12B (다운로드 이전에 라이선스에 동의해야 합니다)
- 추론: GitHub 저장소의 Python CLI. 아직 ComfyUI 통합은 없습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.