ComfyUI MiniMax H3 SPEED V2 发布:多采样器支持与渐进分辨率加速

ComfyUI Wikinews

ComfyUI-MiniMax-H3-SPEED V2 支持 Euler、Heun、DPM2 和 RES Multistep,新增可感知采样器的 Sigma Harvest,并修复了 I2V 关键帧缩放问题。

ComfyUI-MiniMax-H3-SPEED 将一次 MiniMax H3 采样过程拆分到不同分辨率上执行:噪声最大的早期步骤在廉价的低分辨率网格上运行,随着精细细节开始变得重要,网格再逐步放大。版本 2 取消了仅限 Euler 的限制,让校准能够感知实际使用的采样器,并修复了关键帧缩放问题,该问题曾导致图生视频在每次切换分辨率后都变得更模糊。
同一段视频的三帧画面:全分辨率基线、3 阶段和 4 阶段

相同的种子和提示词,960x544、24 fps、11.125 秒。左:全分辨率基线,未启用 SPEED(571.49s)。中:3 阶段,delta 0.005(438.85s)。右:4 阶段,delta 0.05(237.57s)。

SPEED 如何切分采样调度

MiniMax H3 在每一个去噪步骤上都要付出完整的空间成本,包括早期那些 Latent 仍以噪声为主、尚不存在高频细节的步骤。SPEED 把这些步骤下移到更小的网格上执行,再逐步升回来:采样器先在目标分辨率的一个分数比例上执行去噪,随后把 Latent 过渡到更大的网格以完成剩余步骤。

该节点内置三套自动阶梯,由一个 stages 值选择:

stages分辨率阶梯
20.5 到 1.0
30.33 到 0.66 到 1.0
40.25 到 0.5 到 0.75 到 1.0

Tolerance (Delta)noise_amplitudenoise_decay_exponent 决定每次切换在何时发生;内置的默认值来自作者自己的校准拟合,README 建议不要改动它们,除非你正在运行 Harvest 校准。在默认的 direct_coarse 噪声策略下,分辨率提升所暴露出的高频频段由确定性的、以切换事件为种子的高斯场填充。第二种策略 coupled_full_grid 则改为从单一全分辨率噪声场推导这些频段;作者尚未确认它能提升质量,因此它不是默认选项。

SPEED 仅适用于 MiniMax H3,而且 H3 的音频流始终保持全分辨率。

V2 带来了哪些变化

仓库的 CHANGELOG.md 将其标记为 2.0.0。实质性变化包括:

  • 采样器支持。 SPEED 不再绑定 Euler。V2 支持 Euler、Heun、DPM2、Exp Heun 2 X0 和 RES Multistep。无状态采样器使用 ComfyUI 自身的采样器对象;RES Multistep 会保留上一步的历史,因此 V2 通过一个运行作用域内的适配器来运行它,并在 SPEED 改变分辨率时清空该状态,而不是把历史带入尺寸不同的 Latent。
  • 可感知采样器的 Sigma Harvest。 校准节点现在会针对你实际选择的采样器报告参数,而不再假定为 Euler,并且默认使用与自动路径相同的 0.005 阈值。
  • 统一规划。 自动模式与手动模式共用同一套规划与验证实现。自动模式现在会根据实时 sigma 调度和当前 Latent 尺寸计算切换点。
  • I2V 关键帧修复。 关键帧 Latent 现在从它们的原始全分辨率副本进行缩放,而不是对已经缩放过的 tensor 再次缩放;并且它们会在最后阶段之前以及运行失败之后被恢复。作者的总结是:图生视频不应再在每次分辨率变化时逐渐变模糊。
  • 更精简的 Harvest 内存占用。 V1 会保留每个全分辨率残差 tensor 直到运行结束,然后再统一分析。V2 在回调内部就把每个残差归约为一个小型径向 DCT 功率档案,并随即丢弃该 tensor。
  • 连续进度与预览。 一次 SPEED 运行现在会作为一次生成过程上报,而不是若干互不相关的采样器调用。
  • 回归测试覆盖在采样器选择、RES 状态、I2V、切换、Harvest、工作流和噪声策略等方面都得到了扩展。

实测加速效果

仓库发布了一个证据文件夹,其中包含支撑这些结论的耗时数据:单张 RTX 5080、128GB 系统内存、960x544 输出、24 fps、时长 10.125 秒,每一行使用相同的种子和提示词。全分辨率 Euler 基线为 571.49s

阈值(Delta)2 阶段3 阶段4 阶段
0.005462.96s(1.23x)438.85s(1.30x)435.21s(1.31x)
0.010450.38s(1.27x)409.83s(1.39x)384.13s(1.49x)
0.050278.44s(2.05x)262.32s(2.18x)237.57s(2.41x)

同一个文件夹也明确说明了这些数字的局限。它们只是一组仅针对 Euler 的参考数据:既不能证明 V2 新增的四种采样器在速度或质量上与之相当,也不应被解读为某种噪声策略优于另一种的证明。作者的指示是:重新运行 Harvest 校准,并针对你自己的采样器、模型和 scheduler 组合进行基准测试。

三个节点

节点作用
主 SPEED 节点(自动)选择 2、3 或 4 阶段阶梯,并根据实时 sigma 调度处理切换
SPEED 采样器(逐步手动)最多四组显式的 (goal, resolution) 组合;ratio_mode 将 goal 视为全局步骤索引(steps)或采样调度的 0 到 1 比例(ratio)。启用的分辨率必须递增,且最后一个必须为 1.0
Sigma Harvest与你现有的工作流一起运行,用于测量你打算使用的采样器,并返回 sampler_namedeltanoise_amplitudenoise_decay_exponent 值,供你复制到对应的节点中

安装方式是将该包克隆到 ComfyUI/custom_nodes/ 并重新启动。在工作流中,用 SPEED 采样器节点替换 SamplerCustomAdvanced,并连接相同的 noiseguidersigmaslatent_image 输入;一体式的 KSampler 必须先拆分为 ComfyUI 的高级采样组件。

工作流

仓库附带三个前端格式的工作流。计算变体在图中直接运行 Sigma Harvest,因此校准值会自动传入;手动变体则暴露阶梯以供手动调参。

计算工作流将一个图生视频 H3 图封装在子图中,并把 SPEED 采样器设置为 stages = 3direct_coarsedelta = 0.005noise_amplitude = 12.105noise_decay_exponent = 0.773seed_offset = 10000sampler = euler。其备注指向剪枝后的 int8 convrot fl2va checkpoint、nvfp4 Qwen3-VL 32B 文本编码器,以及 H3 独立的视频与音频 VAE。

获取方式

本文撰写时,该仓库已获得 85 个 star。公告帖发布在 r/comfyui,其中大量讨论要求提供并排输出对比,而不是耗时表格;作者引导读者查看证据文件夹以及另一份第三方速度对比。截至本文撰写时,尚未有关于 V2 采样器组合的独立复现结果发布。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
ComfyUI MiniMax H3 SPEED V2 发布:多采样器支持与渐进分辨率加速 | ComfyUI Wiki