Avatar-Forever: 실시간 무한 LTX 2.3 기반 토킹 아바타

ComfyUI Wikinews

PolyU, ByteDance, AMD가 LTX 2.3 22B 기반 실시간 오디오 구동 아바타 모델 Avatar-Forever를 공개했습니다. ForeverCache 스트리밍으로 27.2 FPS의 무제한 생성을 지원합니다.

Avatar-Forever (프로젝트 페이지 | GitHub | 논문 | 모델)는 홍콩 폴리텍 대학교, ByteDance, AMD가 개발한 LTX 2.3 22B 비디오 백본 기반의 실시간 장기(long-horizon) 오디오 구동 아바타 생성 프레임워크입니다. 단일 H100에서 27.2 FPS(768 x 512)로 사실상 무제한의 토킹 아바타 비디오를 엔드투엔드로 생성합니다.

개요

대부분의 스트리밍 비디오 시스템은 순차적인 증류(distillation) 중심 파이프라인을 통해 few-step 생성기를 학습합니다. 이 과정에서 초기 단계의 실패가 누적되고, 증류 목표가 긴 오토리그레시브 롤아웃에서 품질을 저하시킵니다. Avatar-Forever는 대신 생성 효율장기(long-horizon) 견고성을 병렬로 학습되는 두 가지 독립적 기능으로 취급합니다.

  • 전체 파라미터 증류 브랜치: 높은 시각적 품질을 갖춘 효율적인 생성기를 학습합니다.
  • 경량 장기 어댑터: 복구 중심 롤아웃 학습(Recovery-oriented Rollout Training, RRT)으로 학습되어 장기 추론에서도 견고함을 유지합니다.
Avatar-Forever 분리 병렬 학습 개요

Avatar-Forever 분리 병렬 학습 프레임워크 (소스: leeruibin/avatarforever)

ForeverCache 스트리밍

스트리밍 추론 중에 Avatar-Forever는 ForeverCache를 사용합니다. ForeverCache는 청크 단위(chunk-wise) 특징 캐싱 메커니즘으로, 중복된 히스토리 연산을 줄여 무제한 길이의 비디오를 생성하면서도 메모리와 연산량을 제한된 범위로 유지합니다. LTX 2.3 22B 파운데이션 모델과 결합하여 긴 대화, 노래, 인터랙티브 세션에서도 정체성 일관성, 모션 일관성, 시각적 충실도를 유지합니다.

공개 현황

이 프로젝트는 논문, 추론 코드, 모델 체크포인트를 공개했습니다. 학습 코드와 데이터는 아직 대기 중입니다.

  • 가중치: Hugging Faceavatarforever-ltx-2.3-22b.safetensors
  • 텍스트 인코더: 승인 필요(gated) Gemma 3 12B (다운로드 이전에 라이선스에 동의해야 합니다)
  • 추론: GitHub 저장소의 Python CLI. 아직 ComfyUI 통합은 없습니다.

링크

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Avatar-Forever: 실시간 무한 LTX 2.3 기반 토킹 아바타 | ComfyUI Wiki