EVOKE 14B:Alaya Lab 的开源三步交互式世界模型

ComfyUI Wikinews

Alaya Lab 发布 EVOKE,一个 14B 开源权重世界模型,可以 3 步生成 384x640 视频,具备外部世界状态记忆,并支持生成中途切换提示词。

Alaya Lab 已发布 EVOKE,一个 14B 参数的交互式世界模型,仅需 3 步去噪,且无分类器引导(CFG)为零,即可生成 384x640 @ 24 fps 的视频。场景几何体存放在外部以相机为索引的世界状态库中,因此会话可以无限运行而无需增大去噪器上下文,并且可以在 rollout 中途更改提示词而无需重新启动。

概述

EVOKE(“Endless Interactive World with Bounded State and Long-Horizon Supervision”)是 Alaya Lab 在 AlayaWorld 之后推出的新一代模型。论文描述了一个三步、无 CFG 的世界模型:它在 WBench 交互式基准上取得了最先进的结果,同时在 VBench-Long 和 VBench-2.0 上保持竞争力。

蒸馏后的模型生成 384 x 640 @ 24 fps 的视频,并能在 30 秒的 rollout 中保持连贯,在单个 H200 上每 2.11 秒生成 1.5 秒视频。权重已在 Hugging Face 上开源,推理和训练启动脚本位于 GitHub 仓库 中。

EVOKE overview video

EVOKE 官方概览视频

三步生成,零 CFG

大多数少步模型的天花板继承自用于蒸馏的教师模型。EVOKE 没有把教师模型当作固定的生成器,而是为其重新设计了长时程交互式生成方式:逐块分组、远帧检索和线性注意力全局状态,使教师模型的内存和计算量随会话长度线性增长,这正是 30 秒自强制(self-forced)监督得以可行的原因。

在自强制 rollout 下应用的分布匹配目标将这些能力迁移到三步学生模型,该模型的无分类器引导(CFG)为零,每一步只需一次前向传播而非两次。

EVOKE 推理管线

EVOKE 推理管线:持久化世界状态库为自回归少步去噪器提供输入

无限而非窗口化

交互式世界模型面临一个矛盾:将历史记录保存在去噪器上下文或键值缓存中,成本会随会话长度增长;而低延迟交互则要求少步生成。EVOKE 通过外部化持久世界状态来解决这一问题:

  • 写入:单目深度模型在已知相机位姿下估计每个已生成块(chunk)的深度,并将其反投影到持久化点云中。
  • 读取:当前相机位姿直接寻址状态库;按共视性排序的最多八个来源通过批量 z-buffer 散射融合,返回扭曲图像和逐像素可见性遮罩。
  • 淘汰:可选的保留窗口,仅在小时级运行时显式启用。

由于只检索与视角相关的信息,无论会话运行多久,去噪器上下文都保持有界,无需用会话长度换取内存。

中途改变世界

逐块条件允许在 rollout 运行期间更改提示词,无需剪切,无需重新启动。下面的每个演示都在第 3 个块(共 6 个,213 帧,8.9 秒)处切换:

场景提示词切换为
极光演示冰封苔原,极地日光极光点亮整个天空
相机控制演示持久化世界导航相机移动和转向,而世界保持其空间状态

条件模式

模式输入相机控制
v2v参考视频 + 位姿轨迹是,可延续到参考窗口之外
i2v单个首帧 + 位姿轨迹
t2v仅提示词否(引擎禁止 warp + t2v)

能力演示:像玩游戏一样在已生成的世界中导航(来自官方项目页面)

发布内容

本次发布包含四个模型以及基础组件:

目录模型步数
stage3_post_distillation正式发布的模型3,无 CFG
stage1_camera_control多步相机可控模型50,CFG 5.0
stage2_few_step_training少步蒸馏(3 步金字塔)仅训练
evoke_teacher双专家 DMD 教师模型50,CFG 5.0

每个 EVOKE 目录都是 transformer/ 的父目录,并使用 from_pretrained(path, subfolder="transformer") 加载。蒸馏模型仅使用 v2v 条件训练,因此其上的 i2vt2v 属于零样本(zero-shot);只有 stage1_camera_control 在分布内支持全部三种模式。evoke-base 中的 VAE、文本编码器、分词器和调度器来自已发布的 Helios 基础模型,其来源可追溯至 Wan万相。

可用性

EVOKE 在发布之初暂不支持原生 ComfyUI。官方发布提供了 Python 推理启动脚本(scripts/inference/infer_post_distill.sh),支持文生视频、图生视频、视频转视频和 rollout 中途片段模式,以及各阶段的训练启动脚本。世界状态库必须使用 ViGeo 深度后端;Depth-Anything-3 为可选。权重可在 Hugging Face 的 AlayaLab/Evoke 获取。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
EVOKE 14B:Alaya Lab 的开源三步交互式世界模型 | ComfyUI Wiki