SelfLift 为 ComfyUI 带来渐进式分辨率采样
comfyui-SelfLift 在低分辨率下执行早期去噪并在全分辨率下完成,为 Z-Image、FLUX.2-Klein 和 MiniMax H3 带来免训练加速,并支持 TST 校正。
SelfLift 如何划分调度
Z-Image-Turbo 和 FLUX.2-Klein 这类少步数模型压缩的是时间轴,这使得每一次剩余前向传播的空间开销成为主导项。渐进式分辨率采样通过先在低分辨率下进行去噪来削减这一开销。SelfLift 论文(arXiv:2609.02036)指出的问题在于,单纯提升 Latent 并指望剩余少数几步吸收这种不匹配,会留下可见伪影。
SelfLift 转而从模型自身推导修复信号:提升之后,一部分高风险位置会被校正至像素 VAE 锚点,并且过渡过程经过设计,使低分辨率前缀仍是同一轨迹的有效组成部分。论文给出的起始配置为 Z-Image-Turbo 在 8 步中的 6 步使用低分辨率,以及 FLUX.2-Klein 的 4 步中的 3 步。
来自项目页面的 SelfLift 宣传图。
一个包中的三个节点
| 节点 | 类 | 功能 |
|---|---|---|
| SelfLift Progressive Sampler (Image) | SelfLiftImageSampler | 使用模型自身的 VAE,为 rectified flow 图像模型提供渐进式分辨率采样 |
| SelfLift Progressive Sampler (MiniMax H3) | SelfLiftH3Sampler | 同一思路针对 H3 的实验性音频与视频适配 |
| H3 Temporal State Transport (TST) | SelfLiftH3TST | 一个 MODEL 到 MODEL 的补丁,用于校正 H3 视频中的时间不平衡 |
这些采样器接入标准的 ComfyUI 采样器连线方式:它们像 SamplerCustom 一样接收 sampler 和 sigmas 输入,因此你需要连接设置为 euler 的 KSamplerSelect 以及模型自带的调度器。其他采样器会被有意拒绝。
主要的调节参数包括:transition_step(保持低分辨率的步数)、lowres_scale(默认 0.5)、rho(被拉向 VAE 锚点的高风险位置比例,设为 0 即禁用)、用于控制校正强度的 w_min / w_max、提升插值方式(nearest 或 bilinear),以及可选的 model_hires,使高分辨率阶段可以运行不同的 checkpoint 或 LoRA 组合。该过渡不会增加额外的去噪器评估次数:N 步的调度仍然恰好是 N 步,除非 rho 为 0,否则再加上一次 VAE 解码、放大和重新编码的往返。
SelfLift 概览:低分辨率前缀、Latent 提升,以及带锚点的高分辨率阶段。
MiniMax H3 路径
作者明确将 H3 采样器标记为实验性,论文也未对其进行验证。它提供两种提升路线:
- 外部放大器(默认):使用已安装的 H3 latent 放大器并将
rho设为 0,这是一种仅针对 Latent 的可学习提升方式。与 H3 Latent 放大器 权重兼容,README 中对这些权重予以致谢;节点会从models/latent_upscale_models/中读取h3文件。 - SelfLift-zero:将
upscaler_model设为 none,并把rho设为大于 0。作者测试过的 H3 起点是rho 0.6,w_min和w_max为 1;这是在一次单种子运行发现论文的图像设置会在 H3 的直接提升路径上留下伪影之后得出的。
实验性的 highres_tiling 选项会将高分辨率阶段拆分为 1 到 8 个空间分块。它只保留第一个分块的音频,没有跨分块注意力,也不支持 ControlNet,因此这是一种内存上的取舍,而非画质调节项。
时间状态传输
TST 是这里移植的第二篇论文(arXiv:2609.08505)。它测量帧级注意力算子的带符号谱张力,并只校正失衡的注意力头,锐化过度混合的头、柔化碎片化的头,且在更深的图层和更早的步骤中进行更强的校正。它适用于任何标准采样器,而不只是 SelfLift 采样器,作者报告其运行时开销约为 1% 到 2%。
在实践中,它针对的是用户在 H3 输出中最常察觉的失败情况:画面文字和 logo 等细节的闪烁或形变、人物与服饰的身份漂移,以及物理上不合理的运动。tau 是强度调节项,推荐值为 0.2;0.5 明显过强。它无法凭空创造模型本身没有的细节,仅适用于 H3 模型,并且在开启 highres_tiling 时会被跳过。日志选项会在每次模型前向时打印一行诊断信息,包括被校正的注意力头比例;作者测得该比例在 89% 到 100% 的注意力头上与精确注意力算子一致。
可用性
将 facok/comfyui-SelfLift 克隆到 ComfyUI/custom_nodes 并重新启动;全部节点会出现在 selflift 类别下。该包提供英文和中文文档,其中包括用于调校 H3 提升路线的诊断预设表。
评论
使用 GitHub 登录后即可参与讨论。