H3-World:基于 MiniMax H3 的键盘控制交互式世界模型

ComfyUI Wikinews

H3-World 将 MiniMax H3 转变为交互式世界模型:65.6M LoRA 加上注意力补丁将 WASD 和相机键映射为从单帧生成的动作控制视频。

H3-World 预告片

H3-World 从单个首帧生成动作控制视频:角色运动使用 WASD,相机运动使用 IJKL。

视频模型之上的世界模型

H3-World 由腾讯、新加坡国立大学和香港理工大学的研究人员描述为基于 MiniMax H3 构建的第一个交互式世界模型。它不生成固定视频片段,而是接收初始帧加上键盘控制,并生成视频,其中角色行走和相机移动根据您的输入进行,论文可在 arXiv 上获取。

诀窍在于游戏风格控制与视频模型之间的翻译层。H3-World 将每个键盘状态转换为每个未来视频 Latent 的一条语言指令,然后使用定向注意力路由将每条指令绑定到其对应的 Latent 区间。角色控制使用 W, A, S, D;相机控制使用 I, J, K, LF 用于快速相机运动。预设涵盖静止、前、后、左/右横移、向上/下倾斜和左/右平移,包括快速平移。

小型适配器,大型骨干

训练使用了来自 ABot-World-Explorer-500h 数据集的 8,000 个游戏片段。结果是一个秩为 32 的 LoRA,包含 65.6M 参数,仅占 33B MiniMax H3 骨干的 0.199%,以 step-10000.safetensors 形式发布,采用 Apache 2.0 许可证。

ItemDetail
BaseMiniMax H3 33B (FL2VA)
AdapterRank-32 LoRA, 65.6M params (0.199%)
Training data8,000 clips from ABot-World-Explorer-500h
ControlsWASD character, IJKL camera, F fast camera
LicenseApache 2.0 (LoRA), H3 license still applies to the base

如何运行

仅 LoRA 是不够的:作者明确指出,通过未修改的 MiniMax H3 pipeline 加载 checkpoint 将无法重现报告的行为。发布的 checkpoint 需要 MiniMax H3 基础权重(约 135 GB)以及官方 H3-World 代码仓库,该仓库对顶固的 DiffSynth-Studio 版本应用了定向注意力补丁。推理需要一个首帧和一个场景提示,然后将动作预设(或原始键盘状态)映射到每个 Latent 指令,默认生成 5.2 秒、832x480 的视频片段。

如果您想在提交 135 GB 下载之前查看键盘驱动的控制循环,可以在 hugging-apps/h3-world-action-demo 找到交互式演示空间。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
H3-World:基于 MiniMax H3 的键盘控制交互式世界模型 | ComfyUI Wiki