SelfLift 为 ComfyUI 带来渐进式分辨率采样

ComfyUI Wikinews

comfyui-SelfLift 在低分辨率下执行早期去噪并在全分辨率下完成,为 Z-Image、FLUX.2-Klein 和 MiniMax H3 带来免训练加速,并支持 TST 校正。

comfyui-SelfLift 将 SelfLift 渐进式分辨率方法移植到 ComfyUI:最初的去噪步骤在低分辨率下运行,中间 Latent 被提升至全分辨率,剩余步骤在该分辨率下完成。它无需训练,图像路径也不需要额外的模型。

SelfLift 如何划分调度

Z-Image-Turbo 和 FLUX.2-Klein 这类少步数模型压缩的是时间轴,这使得每一次剩余前向传播的空间开销成为主导项。渐进式分辨率采样通过先在低分辨率下进行去噪来削减这一开销。SelfLift 论文(arXiv:2609.02036)指出的问题在于,单纯提升 Latent 并指望剩余少数几步吸收这种不匹配,会留下可见伪影。

SelfLift 转而从模型自身推导修复信号:提升之后,一部分高风险位置会被校正至像素 VAE 锚点,并且过渡过程经过设计,使低分辨率前缀仍是同一轨迹的有效组成部分。论文给出的起始配置为 Z-Image-Turbo 在 8 步中的 6 步使用低分辨率,以及 FLUX.2-Klein 的 4 步中的 3 步

展示渐进式分辨率去噪的 SelfLift 宣传图

来自项目页面的 SelfLift 宣传图。

一个包中的三个节点

节点功能
SelfLift Progressive Sampler (Image)SelfLiftImageSampler使用模型自身的 VAE,为 rectified flow 图像模型提供渐进式分辨率采样
SelfLift Progressive Sampler (MiniMax H3)SelfLiftH3Sampler同一思路针对 H3 的实验性音频与视频适配
H3 Temporal State Transport (TST)SelfLiftH3TST一个 MODELMODEL 的补丁,用于校正 H3 视频中的时间不平衡

这些采样器接入标准的 ComfyUI 采样器连线方式:它们像 SamplerCustom 一样接收 samplersigmas 输入,因此你需要连接设置为 eulerKSamplerSelect 以及模型自带的调度器。其他采样器会被有意拒绝。

主要的调节参数包括:transition_step(保持低分辨率的步数)、lowres_scale(默认 0.5)、rho(被拉向 VAE 锚点的高风险位置比例,设为 0 即禁用)、用于控制校正强度的 w_min / w_max、提升插值方式(nearestbilinear),以及可选的 model_hires,使高分辨率阶段可以运行不同的 checkpoint 或 LoRA 组合。该过渡不会增加额外的去噪器评估次数:N 步的调度仍然恰好是 N 步,除非 rho 为 0,否则再加上一次 VAE 解码、放大和重新编码的往返。

SelfLift 概览图

SelfLift 概览:低分辨率前缀、Latent 提升,以及带锚点的高分辨率阶段。

MiniMax H3 路径

作者明确将 H3 采样器标记为实验性,论文也未对其进行验证。它提供两种提升路线:

  • 外部放大器(默认):使用已安装的 H3 latent 放大器并将 rho 设为 0,这是一种仅针对 Latent 的可学习提升方式。与 H3 Latent 放大器 权重兼容,README 中对这些权重予以致谢;节点会从 models/latent_upscale_models/ 中读取 h3 文件。
  • SelfLift-zero:将 upscaler_model 设为 none,并把 rho 设为大于 0。作者测试过的 H3 起点是 rho 0.6w_minw_max 为 1;这是在一次单种子运行发现论文的图像设置会在 H3 的直接提升路径上留下伪影之后得出的。

实验性的 highres_tiling 选项会将高分辨率阶段拆分为 1 到 8 个空间分块。它只保留第一个分块的音频,没有跨分块注意力,也不支持 ControlNet,因此这是一种内存上的取舍,而非画质调节项。

时间状态传输

TST 是这里移植的第二篇论文(arXiv:2609.08505)。它测量帧级注意力算子的带符号谱张力,并只校正失衡的注意力头,锐化过度混合的头、柔化碎片化的头,且在更深的图层和更早的步骤中进行更强的校正。它适用于任何标准采样器,而不只是 SelfLift 采样器,作者报告其运行时开销约为 1% 到 2%。

在实践中,它针对的是用户在 H3 输出中最常察觉的失败情况:画面文字和 logo 等细节的闪烁或形变、人物与服饰的身份漂移,以及物理上不合理的运动。tau 是强度调节项,推荐值为 0.2;0.5 明显过强。它无法凭空创造模型本身没有的细节,仅适用于 H3 模型,并且在开启 highres_tiling 时会被跳过。日志选项会在每次模型前向时打印一行诊断信息,包括被校正的注意力头比例;作者测得该比例在 89% 到 100% 的注意力头上与精确注意力算子一致。

可用性

facok/comfyui-SelfLift 克隆到 ComfyUI/custom_nodes 并重新启动;全部节点会出现在 selflift 类别下。该包提供英文和中文文档,其中包括用于调校 H3 提升路线的诊断预设表。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
SelfLift 为 ComfyUI 带来渐进式分辨率采样 | ComfyUI Wiki