Avatar-Forever:基于 LTX 2.3 的实时无限时长说话数字人模型

ComfyUI Wikinews

香港理工大学、字节跳动和 AMD 发布 Avatar-Forever,一个基于 LTX 2.3 22B 的实时音频驱动数字人模型,采用 ForeverCache 流式传输:以 27.2 FPS 实现无边界生成。

Avatar-Forever项目主页 | GitHub | 论文 | 模型)是一个基于 LTX 2.3 22B 视频主干网络的实时、长时程音频驱动数字人生成框架,由香港理工大学、字节跳动和 AMD 联合开发。它可以在单张 H100 上以 27.2 FPS(768 x 512)端到端生成实际上无边界长度的说话数字人视频。

概述

大多数流式视频系统通过顺序式的、以蒸馏为核心的流水线来训练少步生成器,早期阶段的失败会不断累积,且蒸馏目标会在长时间自回归展开过程中降低质量。Avatar-Forever 则将生成效率长时程鲁棒性视为两种独立的能力,并行训练:

  • 一个全参数蒸馏分支,用于训练视觉质量高、效率高的生成器
  • 一个轻量级长时程适配器,通过恢复导向的展开训练(RRT)进行训练,以在长时程推理过程中保持鲁棒性
Avatar-Forever 解耦并行训练概览

Avatar-Forever 解耦并行训练框架(来源:leeruibin/avatarforever)

ForeverCache 流式传输

在流式推理过程中,Avatar-Forever 使用 ForeverCache,这是一种分块特征缓存机制,可减少冗余的历史计算,在生成无限长度视频的同时将内存和计算量保持有界。结合 LTX 2.3 22B 基础模型,它能在长时间对话、歌曲和交互会话中保持身份一致性、动作连贯性和视觉保真度。

可用性

该项目已发布论文、推理代码和模型权重;训练代码和数据仍在待定中。

  • 模型权重avatarforever-ltx-2.3-22b.safetensors,位于 Hugging Face
  • 文本编码器:受限访问的 Gemma 3 12B(下载之前请先接受许可证)
  • 推理GitHub 仓库中的 Python CLI,尚无 ComfyUI 集成

链接

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Avatar-Forever:基于 LTX 2.3 的实时无限时长说话数字人模型 | ComfyUI Wiki