XGEN-JING:基于 MiniMax H3 的第一人称交互模型

ComfyUI Wikinews

XGEN Labs 的 JING-Flash-v1 在 MiniMax H3 上构建第一人称视频与音频:键盘相机控制、文本驱动交互、对话以及四步推理。

XGEN Labs 发布了 XGEN-JING,这是一个基于 MiniMax H3 构建的自我中心(第一人称)交互体验模型。普通视频模型生成的是固定片段,而 JING 接收操作、引用图像和观测历史,并生成第一人称视频与音频:你移动、与物体交互,还能进行对话。

XGEN-JING cover

模型仓库中的官方 XGEN-JING 封面。

它能做什么

该模型针对三种行为进行训练,全部以视频加音频的形式联合生成:

  • 相机控制。 通过键盘输入在日常生活场景与想象世界中移动,从同一起点出发,以不同走法探索。
  • 交互与对话。 用文本而非运动提示词来指挥物体交互和角色对话。
  • 引用条件。 用取自某个故事的角色、物体和场景图像来组合一段体验,因此同一组引用可以在不同操作下被探索。

JING Flash 构建在 MiniMax H3 的 Ref2VA 路径以及 FlashGen(4 步 H3 LoRA)之上,正是它让四步双向推理成为可能。文本编码器、tokenizer、processor、视频与音频 VAE 以及调度器均来自 diffusers 格式的 MiniMax H3,并不属于本次发布的一部分,因此只有 jing_flash_v1 transformer 是全新的。

发布状态

这是一个预览级发布,发布计划对此说得很明确:

项目状态
JING-Flash-v1 四步双向模型已发布
推理代码与示例已发布
提示词技巧已发布
因果模型即将推出
技术报告即将推出

这一区别对于理解此处“交互”的含义很重要。四步双向模型在操作序列预先已知的情况下生成整个片段;而因果模型会随着你按键逐步响应,目前尚未推出。XGEN Labs 随权重一起发布了图库和演示视频。

仓库中还包含一份提示词技巧文档,可根据故事和引用图像生成经过验证的推理案例。

XGEN Labs logo

获取方式

官方 XGEN-JING 演示视频。

目前不支持 ComfyUI:其推理路径是 diffusers 加上固定到特定 diffusion 修订版本的 SGLang 运行时,而且经过验证的演示配置将整套技术栈分布在六块 H100 GPU 上(一块用于文本编码器,一块用于视频与音频 VAE,四块用于带序列并行的 DiT),默认注意力后端为 FlashAttention-4。在因果模型和更轻量的推理路径到来之前,这更像是展示基于 H3 的交互模型将走向何方,而不是能在本地 ComfyUI 机器上直接运行的东西。

关于同一底座上更早的交互式世界模型,请参见 H3-World

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
XGEN-JING:基于 MiniMax H3 的第一人称交互模型 | ComfyUI Wiki