Avatar-Forever: LTX 2.3ベースのリアルタイム無限トーキングアバター

ComfyUI Wikinews

PolyU、ByteDance、AMDが、LTX 2.3 22BをベースにForeverCacheストリーミングを採用したリアルタイム音声駆動アバターモデル「Avatar-Forever」を公開。27.2 FPSでの無制限生成を実現。

Avatar-Foreverプロジェクトページ | GitHub | 論文 | モデル)は、香港理工大学、ByteDance、AMDによって開発された、LTX 2.3 22B 動画バックボーンをベースにしたリアルタイム・長時間・音声駆動のアバター生成フレームワークです。単一のH100上で、27.2 FPS(768 x 512)のエンドツーエンドで、事実上無制限のトーキングアバター動画を生成します。

概要

ほとんどのストリーミング動画システムでは、逐次的かつ蒸留中心のパイプラインを介して数ステップの生成器をトレーニングします。このパイプラインでは、前段階の失敗が蓄積し、蒸留の目的関数が長い自己回帰ロールアウトにわたって品質を低下させます。Avatar-Foreverはその代わりに、生成効率長時間の堅牢性を、並行してトレーニングされる独立した2つの能力として扱います。

  • 全パラメータ蒸留ブランチは、高い視覚品質を持つ効率的な生成器をトレーニングします。
  • 軽量の長時間用アダプタは、Recovery-oriented Rollout Training(RRT)でトレーニングされ、長時間の推論下でも堅牢性を維持します。
Avatar-Foreverの分離並列トレーニングの概要

Avatar-Foreverの分離並列トレーニングフレームワーク(ソース: leeruibin/avatarforever)

ForeverCacheストリーミング

ストリーミング推論中、Avatar-ForeverはForeverCacheを使用します。これは、冗長な履歴計算を削減するチャンク単位の特徴キャッシュメカニズムであり、無制限の長さの動画を生成しながら、メモリと計算量を一定範囲に保ちます。LTX 2.3 22B基盤モデルと組み合わせることで、長い会話、歌、インタラクティブセッションにわたって、アイデンティティの一貫性、動作の一貫性、視覚的忠実度を維持します。

提供状況

プロジェクトは、論文、推論コード、モデルのチェックポイントを公開しています。トレーニングコードとデータはまだ保留中です。

  • 重み: Hugging Faceavatarforever-ltx-2.3-22b.safetensors
  • テキストエンコーダ: 承認制の Gemma 3 12B(ダウンロード前にライセンスへの同意が必要)
  • 推論: GitHubリポジトリ のPython CLI(ComfyUI統合はまだありません)

リンク

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Avatar-Forever: LTX 2.3ベースのリアルタイム無限トーキングアバター | ComfyUI Wiki