VDN-H3:混合注意力让 MiniMax H3 视频生成快于播放速度

ComfyUI Wikinews

OpenVDN 为 MiniMax H3 推出的 Video DeltaNet 混合注意力模型可在 8 步内渲染 14.4 秒 768p 视频片段,社区 ComfyUI 移植版已可用。

VDN-H3权重代码)是来自 UC Berkeley / Impossible, Inc. / UT Austin 团队对 MiniMax H3 进行的混合注意力重构。它用线性“Video Delta Attention”分支替换了 H3 原本的二次方长程注意力,以 50 步和 8 步蒸馏检查点的形式发布,可作为补丁应用到未经修改的 H3 主干上,并宣称与 dense H3 相比质量接近无损。原生 ComfyUI 移植版已经可用:Saganaki22/ComfyUI-VDN-H3
VDN-H3 作为 ComfyUI 原生节点运行

该社区 ComfyUI 移植版将发布的 VDN-H3 检查点作为运行时模型补丁运行在 ComfyUI 原生 MiniMax-H3 节点上,无需修改核心代码。

Video DeltaNet 如何加速 H3

在 MiniMax H3 这样的前沿全模态模型上,对长 token 序列的 softmax 注意力占总运行时间的 85% 以上,且其成本随视频片段长度呈二次方增长。Video DeltaNet 将视频到视频的注意力拆分为两个互补分支:一个双向滑动窗口 softmax 分支,用于保持相邻帧之间的精确注意力(精细细节和短期稳定性);另一个双向线性注意力分支,通过恒定成本的状态记忆传递长程上下文。4 路边界锚定方案仅增加 3.57% 的注意力密度,同时保持全局一致性,因此视频片段的首帧和末帧对所有帧保持可见。

该检查点不替换 H3 主干。它提供了一个独立的线性注意力分支以及两个小型 LoRA 适配器,在推理时合并到主干中,使原始权重保持不变。除架构变化外,8 步模型是 50 步模型的 DMD 蒸馏版本。

性能与质量

最亮眼的数据来自数据中心配置:在 8 块 B200 GPU 上,VDN-H3 只需 11.23 秒即可通过 8 步去噪生成一段 14.4 秒的 768p 视频。与 dense H3 基线的单 GPU 对比:

配置GPU50 NFE(VDN-H3-50-step)8 NFE(VDN-H3-8-step)
dense MiniMax-H3(H200)127.3 分钟4.4 分钟
VDN-H3 FP8(H200)19.4 分钟90.5 秒
dense MiniMax-H3(B200)113.95 分钟2.23 分钟
VDN-H3 FP8(B200)15.3 分钟51 秒

团队报告称,该混合模型在视觉上与 dense H3 的输出几乎无法区分,并且表现出比 MiniMax FastH3 更高的质量和更好的指令遵循能力。样例对比,包括与 dense H3 和 FastH3 的并排视频,可在项目页面上查看。

来自项目页面的 VDN-H3 8 步输出示例。

在 ComfyUI 中运行

官方发布版本面向数据中心技术栈:8 块 B200,采用 Ulysses 序列并行和仅支持 Hopper 与数据中心 Blackwell 的 FlashAttention-4 内核。没有官方 Windows 版本,FA4 内核不支持消费级 Blackwell(sm_120)。

ComfyUI-VDN-H3 移植版以运行时模型补丁的形式在 ComfyUI 原生 MiniMax-H3 模型上复现官方混合注意力计算,使用可移植的 PyTorch 等价实现替代 FP8 线性层和融合 Triton 内核。它已针对官方实现进行过单元测试,并且零新增依赖。安装步骤:

  1. 将仓库克隆到 ComfyUI/custom_nodes/,然后重新启动 ComfyUI。
  2. 将所需检查点阶段下载到 ComfyUI/models/vdn/,并保持目录结构不变(model_spec.jsonlinear_branch/adapters/):
hf download OpenVDN/vdn-minimax-h3 --include "stage-dmd-step-250/*" --local-dir <ComfyUI>/models/vdn

8 步 stage-dmd-step-250 下载文件约 5 GB(线性分支加适配器);50 步 stage-b-step-2000 变体约 4.3 GB。

该移植版无法提供的是官方宣传中的最高速度:官方 74.5 倍的数字是 8 GPU 并行、FA4、FP8 和 8 步蒸馏共同作用的结果。上游自己的单 GPU 实测在 50 步时约为 2.6 倍,而移植版的可移植内核会略低于这一水平(在 RTX 5090 上、1280x736 / 145 帧条件下测得约 17 秒/迭代)。Banodoco H3 频道中的社区基准测试显示,8 步 VDN-H3 Turbo 在 1280x736 下用时 2:04,而 LightXv2 4 步 turbo 在相同硬件上用时 1:24,评论者指出 VDN 在快速运动场景下比 FastH3 路线保持了更好的画面质量。

相同提示词下,dense H3 在 50 步时的输出(位于项目页面对比的顶部)。

可用资源

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
VDN-H3:混合注意力让 MiniMax H3 视频生成快于播放速度 | ComfyUI Wiki