TaoMate-H3:阿里巴巴为 MiniMax H3 打造的实时流式 LoRA

ComfyUI Wikinews

阿里巴巴 TaoLive AIGC 团队开源 TaoMate-H3,这是一种 3 步 LoRA 运行时,可分块流式输出同步音视频,实现 35 FPS 的长视频 MiniMax H3 生成。

阿里巴巴淘天集团的 TaoLive AIGC 团队 发布了 TaoMate-H3,这是一个基于 MiniMax H3 构建的低延迟流式运行时,能够以小分块方式生成同步的音频和视频。该框架可实现 35 FPS 阶段并行输出,支持 超过 30 分钟 的不间断生成,并在 GitHub(150+ stars)上随运行时代码一同发布了 rank-128 的 3 步 LoRA 适配器。

概述

TaoMate 是一个用于少步联合音视频生成的锚点引导持久内存框架,详见该项目的论文项目主页。它并不扩展活动上下文缓存,而是保留一个不可变的视觉锚点,将已完成的视频和音频块压缩为固定容量的动态状态,并通过模态特定的残差注意力检索这些状态。一种参考感知调制方法根据锚点外观统计量调节视频特征,而锚点保持的因果上下文蒸馏则在训练期间保持锚点不受扰动。

指标数值
流式输出35 FPS
单设备延迟130.3 秒 / 1441 帧
基础模型22.1B(MiniMax H3)
长时一致性0.9520
音频失同步0.000

发布的运行时在一条同步时间线上生成语音、声音效果和视频,并通过干净的 KV-cache 交接在提示词边界处保持视觉身份、声音和运动的一致性。每个五秒块都可以通过 --prompt-json 文件携带自己的提示词,生成支持 480p、768p 和对齐的 1080p。已验证的硬件配置为 8 x H20 96 GB,采用张量和序列并行。

TaoMate-H3 官方演示片中的示例帧:港口记者

官方演示片中的示例帧:一个旁白角色在多个流式块中保持一致。

发布内容

官方演示:一段 10 秒的陶土机器人视频,带有同步音频。

社区反馈

该发布迅速引起了 MiniMax H3 社区的关注。一周内便收获了 150+ GitHub stars,社区成员还发现了一套适用于单 GPU 的实用双采样器工作流:先用高质量高步数采样器构建场景,再用 TaoMate LoRA 完成最后三步。测试者反馈其视觉质量出色,没有其他 turbo LoRA 常见的过度加工感,同时指出静态或缓慢场景的效果远好于快速运动场景。社区成员还提供了该 LoRA 的 ComfyUI 兼容 safetensors 转换版本,可在此获取

可用性

TaoMate-H3 需要 MiniMax H3 基础模型,目标平台为搭载 SM90(Hopper)GPU 的 Linux 系统,并遵循 MiniMax H3 社区许可证。运行时代码、安装指南和提示词文件格式均在 GitHub 仓库中,LoRA 适配器则位于 Hugging Face。流式运行时本身没有原生 ComfyUI 节点;单 GPU 用户需通过社区工作流来使用该 LoRA。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
TaoMate-H3:阿里巴巴为 MiniMax H3 打造的实时流式 LoRA | ComfyUI Wiki