LongCat Video Avatar 1.5:美团开源音频驱动虚拟形象模型

ComfyUI Wikinews

美团将 LongCat-Video-Avatar 升级至 1.5,配备 Whisper-Large 唇形同步、DMD2 8 步蒸馏和多音频支持,并提供用于音频转视频虚拟形象的 ComfyUI 自定义节点。

LongCat-Video-Avatar 1.5 是美团升级后的开源框架,用于音频驱动的人物视频生成。它基于 LongCat-Video 基础模型构建,可生成稳定、生产级的虚拟形象视频,原生支持音频-文本生成视频(AT2V)音频-文本-图像生成视频(ATI2V)视频续写,适用于单个或多个音频流。

LongCat Video Avatar 1.5 演示

1.5 版本新特性

  • Whisper-Large 音频编码器取代 Wav2Vec2,带来明显更流畅、更自然的唇部动态
  • 基于 DMD2 的8 步蒸馏推理,在服务成本与高视觉保真度之间取得平衡
  • 生产级稳定性:精确的唇形同步、全身时间稳定性,以及在长视频中保持严格的身份一致性
  • 风格化领域泛化:在动漫、动物、多人交互和物体处理等场景中表现稳健

项目页面提供了与商业服务在唇形同步和 3D 动画方面的横向对比:

唇形同步对比

ComfyUI 支持

社区节点包 ComfyUI-LongCat-Avatar 将官方 Avatar 1.5 流程适配到 ComfyUI:包含九个节点,覆盖单音频和多音频虚拟形象生成、Whisper-large-v3 音频条件、必填的 DMD distill LoRA,以及三种权重模式(单文件 .safetensors DiT、官方分片和官方 INT8 分片模型),支持 480p 和 720p 分辨率。

模型文件放入标准的 ComfyUI 目录(models/lorasmodels/vaemodels/audio_encodersmodels/diffusion_models),节点可自动下载官方分片模型。该节点包的示例工作流:

LongCat Video Avatar ComfyUI 工作流

可用性

模型权重、技术报告和推理代码可通过官方 LongCat-Video 仓库项目页面获取。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
LongCat Video Avatar 1.5:美团开源音频驱动虚拟形象模型 | ComfyUI Wiki