TaoMate-H3:阿里巴巴为 MiniMax H3 打造的实时流式 LoRA
阿里巴巴 TaoLive AIGC 团队开源 TaoMate-H3,这是一种 3 步 LoRA 运行时,可分块流式输出同步音视频,实现 35 FPS 的长视频 MiniMax H3 生成。
概述
TaoMate 是一个用于少步联合音视频生成的锚点引导持久内存框架,详见该项目的论文和项目主页。它并不扩展活动上下文缓存,而是保留一个不可变的视觉锚点,将已完成的视频和音频块压缩为固定容量的动态状态,并通过模态特定的残差注意力检索这些状态。一种参考感知调制方法根据锚点外观统计量调节视频特征,而锚点保持的因果上下文蒸馏则在训练期间保持锚点不受扰动。
| 指标 | 数值 |
|---|---|
| 流式输出 | 35 FPS |
| 单设备延迟 | 130.3 秒 / 1441 帧 |
| 基础模型 | 22.1B(MiniMax H3) |
| 长时一致性 | 0.9520 |
| 音频失同步 | 0.000 |
发布的运行时在一条同步时间线上生成语音、声音效果和视频,并通过干净的 KV-cache 交接在提示词边界处保持视觉身份、声音和运动的一致性。每个五秒块都可以通过 --prompt-json 文件携带自己的提示词,生成支持 480p、768p 和对齐的 1080p。已验证的硬件配置为 8 x H20 96 GB,采用张量和序列并行。
官方演示片中的示例帧:一个旁白角色在多个流式块中保持一致。
发布内容
- 运行时代码:完整的流式推理栈位于 TaoLiveAIGC/TaoMate-H3,包括分块生成、按块提示词调度和阶段并行执行
- 3 步 LoRA 适配器:step-3000 生成器 EMA checkpoint(rank 128、alpha 128、FP32 张量),位于 Hugging Face 上的 TaoLiveAIGC/TaoMate-H3,需配合 MiniMax H3 FL2VA 基础模型使用
- 演示图库:示例片,包括项目主页上一段不间断的30 分钟纪录片旁白
官方演示:一段 10 秒的陶土机器人视频,带有同步音频。
社区反馈
该发布迅速引起了 MiniMax H3 社区的关注。一周内便收获了 150+ GitHub stars,社区成员还发现了一套适用于单 GPU 的实用双采样器工作流:先用高质量高步数采样器构建场景,再用 TaoMate LoRA 完成最后三步。测试者反馈其视觉质量出色,没有其他 turbo LoRA 常见的过度加工感,同时指出静态或缓慢场景的效果远好于快速运动场景。社区成员还提供了该 LoRA 的 ComfyUI 兼容 safetensors 转换版本,可在此获取。
可用性
TaoMate-H3 需要 MiniMax H3 基础模型,目标平台为搭载 SM90(Hopper)GPU 的 Linux 系统,并遵循 MiniMax H3 社区许可证。运行时代码、安装指南和提示词文件格式均在 GitHub 仓库中,LoRA 适配器则位于 Hugging Face。流式运行时本身没有原生 ComfyUI 节点;单 GPU 用户需通过社区工作流来使用该 LoRA。
评论
使用 GitHub 登录后即可参与讨论。