KJNodes/torchcompilegenerated

TorchCompileModelFluxAdvancedV2

在技术实现上,此节点会克隆输入模型,并对其内部的扩散模型部分应用 torch.compile。

Torch Compile Model Flux Advanced V2

model
MODEL
backend
COMBO
fullgraph
mode
default
double_blocks
single_blocks
dynamic
dynamo_cache_size_limit
64
force_parameter_static_shapes
KJNodes

TorchCompileModelFluxAdvancedV2 节点已弃用——请改用 TorchCompileModelAdvanced。在技术实现上,它会克隆输入模型,并对其内部的扩散模型部分应用 torch.compile

TorchCompileModelFluxAdvancedV2 是一个用于优化和加速模型推理的节点。它通过 PyTorch 的 torch.compile 功能对给定的扩散模型进行编译,旨在提升模型在图像生成时的运行效率。该节点提供了多种编译选项,允许用户根据硬件和依赖项调整优化策略。

节点功能

在技术实现上,此节点会克隆输入模型,并对其内部的扩散模型部分应用 torch.compile。它支持多种后端(如 inductor)和编译模式(如 max-autotune),并允许控制是否编译模型中的特定模块(如单/双注意力块)。此外,它还能配置 PyTorch Dynamo 的缓存大小和形状强制静态化等底层参数,以实现更精细的性能调优。

节点参数说明 - TorchCompileModelFluxAdvancedV2

连接输入 (Inputs)

参数名称数据类型必填默认值取值范围/选项说明
modelMODEL--接收待优化的模型输入。此参数是节点的核心输入,通常来自上游的模型加载节点。

控件参数 (Parameters)

参数名称数据类型必填默认值取值范围/选项说明
backendCOMBOinductor"inductor", "cudagraphs"选择 PyTorch 编译所使用的后端引擎。可选值为 inductor(默认)或 cudagraphs,用于指定底层的优化实现方式。
modeCOMBO"default""default", "max-autotune", "max-autotune-no-cudagraphs", "reduce-overhead"max-autotunemax-autotune-no-cudagraphsreduce-overhead,用于在编译时间、内存占用和运行速度之间进行权衡。
fullgraphBOOLEANFalse-启用完整图形模式
double_blocksBOOLEANTrue-编译双注意力块
single_blocksBOOLEANTrue-编译单注意力块
dynamicBOOLEANFalse-启用动态模式
dynamo_cache_size_limitINT640 - 1024 (步长: 1)torch._dynamo.config.cache_size_limit
force_parameter_static_shapesBOOLEANTrue-torch._dynamo.config.force_parameter_static_shapes

输出 (Output)

参数名称数据类型说明
MODELMODEL输出经过 torch.compile 编译优化后的模型,可供后续采样或处理节点使用。

使用场景

在图像生成工作流中,你可以将此节点放置在模型加载节点之后、采样器节点之前。例如,加载一个 Stable Diffusion 模型后,通过此节点对其进行编译优化,再将优化后的模型送入采样器进行图像生成,以期获得更快的生成速度。

注意事项

请注意,此节点已被标记为“弃用”,开发者建议使用其替代节点 TorchCompileModelAdvanced。它仍处于实验性阶段,其优化效果可能因模型、硬件和具体参数的不同而有显著差异。

TorchCompileModelFluxAdvancedV2 节点源码链接

TorchCompileModelFluxAdvancedV2 节点来自 ComfyUI-KJNodes 节点包。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…