Avatar-Forever:基于 LTX 2.3 的实时无限时长说话数字人模型
ComfyUI Wikinews
香港理工大学、字节跳动和 AMD 发布 Avatar-Forever,一个基于 LTX 2.3 22B 的实时音频驱动数字人模型,采用 ForeverCache 流式传输:以 27.2 FPS 实现无边界生成。
概述
大多数流式视频系统通过顺序式的、以蒸馏为核心的流水线来训练少步生成器,早期阶段的失败会不断累积,且蒸馏目标会在长时间自回归展开过程中降低质量。Avatar-Forever 则将生成效率和长时程鲁棒性视为两种独立的能力,并行训练:
- 一个全参数蒸馏分支,用于训练视觉质量高、效率高的生成器
- 一个轻量级长时程适配器,通过恢复导向的展开训练(RRT)进行训练,以在长时程推理过程中保持鲁棒性
Avatar-Forever 解耦并行训练框架(来源:leeruibin/avatarforever)
ForeverCache 流式传输
在流式推理过程中,Avatar-Forever 使用 ForeverCache,这是一种分块特征缓存机制,可减少冗余的历史计算,在生成无限长度视频的同时将内存和计算量保持有界。结合 LTX 2.3 22B 基础模型,它能在长时间对话、歌曲和交互会话中保持身份一致性、动作连贯性和视觉保真度。
可用性
该项目已发布论文、推理代码和模型权重;训练代码和数据仍在待定中。
- 模型权重:
avatarforever-ltx-2.3-22b.safetensors,位于 Hugging Face - 文本编码器:受限访问的 Gemma 3 12B(下载之前请先接受许可证)
- 推理:GitHub 仓库中的 Python CLI,尚无 ComfyUI 集成
评论
使用 GitHub 登录后即可参与讨论。