Ref2VA VSA:面向 H3 参考生视频的稀疏注意力节点

ComfyUI Wikinews

一个 ComfyUI 节点将 FastH3 VSA 门控移植到 MiniMax H3 Ref2VA 上,让参考 token 保持稠密,同时剪枝视频瓦片,实现快速的 4 步角色视频生成。

Ref2VA VSA 将视频稀疏注意力引入 MiniMax H3 的参考生视频路径。稀疏注意力正是 FastH3 在文生视频上提速的原因,但此前一直被认为与参考条件不兼容,直到此节点把训练好的门控移植到 Ref2VA 模型上。

为什么 Ref2VA 一直沿用稠密调度

VSA(视频稀疏注意力)将视频 token 聚类为 3D 时空瓦片,并在每个 block 中剪除其中大部分,FastH3 模型正是借此削减每次 transformer 前向传播的开销。参考生视频打破了这种布局:Ref2VA 会在生成的视频序列之前,前置动态多模态分段、参考图像 latent、参考音频 latent 以及提示词 token。

朴素的瓦片划分会把不同模态的 token 放进同一个瓦片,从而破坏条件掩码、损害角色一致性。因此,基于参考的 H3 生成一直走稠密注意力路径,而文生视频已转向稀疏 kernel。

双层注意力补丁

Ref2VA VSA 通过工程化的注意力布局解决了这个问题,而无需新的模型:

  1. 免剪枝的稠密前缀:几何映射器将文本、参考图像和参考音频 token 隔离成分段纯净的瓦片,使其免于 top-k 剪枝。参考 token 保持完全稠密,因此不会以牺牲身份一致性来换取速度。
  2. 仅对视频稀疏:top-k 剪枝严格应用于已生成视频的 key 瓦片。
  3. 门控移植:将 FastH3 VSA 模型中 50 个训练好的 to_gate_compress 投影矩阵挂载到 Ref2VA H3 block 上,然后在打过补丁的模型上运行相同的 tile-64 Sol/VSA kernel。
用于对比运行的参考角色图像

作者用于对比运行的参考图像。

作者在同一台机器、同一个提示词、同一张参考图像、1344x768 分辨率下发布了同种子对比结果。两列使用相同的角色参考:

Ref2VA VSA,4 步Video Delta Net,8 步
Ref2VA VSA:4 步,75% 视频稀疏度,约快 2.2 倍Video Delta Net (VDN-H3):8 步

相较于稠密的原生 H3 调度,该仓库报告约 9 倍加速;相比 Video Delta Net 路径,在 4 步对 8 步的情况下约快 2.2 倍。

接入工作流

作者在 1344x768 下的 4 步 Ref2VA VSA 结果。

该补丁节点位于模型加载器与采样链之间:

UNETLoader (Ref2VA INT8)
   -> LoraLoaderModelOnly (turbo 4-step LoRA, strength 1.0)
   -> Ref2VAVSAGatePatch (fasth3_vsa_gate.safetensors, sparsity 0.75)
   -> MiniMaxH3SigmaShift (shift_video 12, shift_audio 3)
   -> BasicScheduler (steps 4) + BasicGuider -> SamplerCustomAdvanced (euler)

此节点位于 FastH3/VSA 类别下,接收模型、来自 models/loras/ 的门控 safetensors 文件以及 sparsity 值。README 中的 4 步配方使用 0.75 稀疏度搭配 simple 调度器;节点自身的描述建议从 0.50 到 0.70 开始,并与同一稠密种子进行对比后再往上调。同一类别下还包含 FastH3 VSA-H3 Patch (tile64),即最初的文生视频补丁,因此两条路径可以共用一次安装。

工作流

该仓库还包含用于更轻量 UI 预览流程的 ref2va_vsa_4step_with_preview.json、用于 API 格式的 ref2va_vsa_4step_api.json,以及 tools/extract_vsa_gate.py,如果你本地已有 FastH3 VSA 模型,可用它重新构建 fasth3_vsa_gate.safetensors

可用性

Ref2VA VSA 是一个 Apache-2.0 自定义节点。将 Kablex/ComfyUI-Ref2VA-VSA 克隆到 ComfyUI/custom_nodes,重新启动,然后在 FastH3/VSA 下查找这些节点。它需要支持 H3 的最近版本 ComfyUI,以及带有 CUDA Sol-Attention 原语的 comfy-kitchen,因为稀疏 kernel 本身来自该软件包。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Ref2VA VSA:面向 H3 参考生视频的稀疏注意力节点 | ComfyUI Wiki