Avatar-Forever: LTX 2.3ベースのリアルタイム無限トーキングアバター
ComfyUI Wikinews
PolyU、ByteDance、AMDが、LTX 2.3 22BをベースにForeverCacheストリーミングを採用したリアルタイム音声駆動アバターモデル「Avatar-Forever」を公開。27.2 FPSでの無制限生成を実現。
概要
ほとんどのストリーミング動画システムでは、逐次的かつ蒸留中心のパイプラインを介して数ステップの生成器をトレーニングします。このパイプラインでは、前段階の失敗が蓄積し、蒸留の目的関数が長い自己回帰ロールアウトにわたって品質を低下させます。Avatar-Foreverはその代わりに、生成効率と長時間の堅牢性を、並行してトレーニングされる独立した2つの能力として扱います。
- 全パラメータ蒸留ブランチは、高い視覚品質を持つ効率的な生成器をトレーニングします。
- 軽量の長時間用アダプタは、Recovery-oriented Rollout Training(RRT)でトレーニングされ、長時間の推論下でも堅牢性を維持します。
Avatar-Foreverの分離並列トレーニングフレームワーク(ソース: leeruibin/avatarforever)
ForeverCacheストリーミング
ストリーミング推論中、Avatar-ForeverはForeverCacheを使用します。これは、冗長な履歴計算を削減するチャンク単位の特徴キャッシュメカニズムであり、無制限の長さの動画を生成しながら、メモリと計算量を一定範囲に保ちます。LTX 2.3 22B基盤モデルと組み合わせることで、長い会話、歌、インタラクティブセッションにわたって、アイデンティティの一貫性、動作の一貫性、視覚的忠実度を維持します。
提供状況
プロジェクトは、論文、推論コード、モデルのチェックポイントを公開しています。トレーニングコードとデータはまだ保留中です。
- 重み: Hugging Face の
avatarforever-ltx-2.3-22b.safetensors - テキストエンコーダ: 承認制の Gemma 3 12B(ダウンロード前にライセンスへの同意が必要)
- 推論: GitHubリポジトリ のPython CLI(ComfyUI統合はまだありません)
コメント
GitHubでサインインしてディスカッションに参加しましょう。