KJNodes/torchcompilegenerated
TorchCompileModelFluxAdvancedV2
在技术实现上,此节点会克隆输入模型,并对其内部的扩散模型部分应用 torch.compile。
Torch Compile Model Flux Advanced V2
model
MODEL
backend
COMBO
fullgraph
mode
default
double_blocks
single_blocks
dynamic
dynamo_cache_size_limit
64
force_parameter_static_shapes
KJNodes
TorchCompileModelFluxAdvancedV2 节点已弃用——请改用 TorchCompileModelAdvanced。在技术实现上,它会克隆输入模型,并对其内部的扩散模型部分应用 torch.compile。
TorchCompileModelFluxAdvancedV2 是一个用于优化和加速模型推理的节点。它通过 PyTorch 的 torch.compile 功能对给定的扩散模型进行编译,旨在提升模型在图像生成时的运行效率。该节点提供了多种编译选项,允许用户根据硬件和依赖项调整优化策略。
节点功能
在技术实现上,此节点会克隆输入模型,并对其内部的扩散模型部分应用 torch.compile。它支持多种后端(如 inductor)和编译模式(如 max-autotune),并允许控制是否编译模型中的特定模块(如单/双注意力块)。此外,它还能配置 PyTorch Dynamo 的缓存大小和形状强制静态化等底层参数,以实现更精细的性能调优。
节点参数说明 - TorchCompileModelFluxAdvancedV2
连接输入 (Inputs)
| 参数名称 | 数据类型 | 必填 | 默认值 | 取值范围/选项 | 说明 |
|---|---|---|---|---|---|
model | MODEL | 是 | - | - | 接收待优化的模型输入。此参数是节点的核心输入,通常来自上游的模型加载节点。 |
控件参数 (Parameters)
| 参数名称 | 数据类型 | 必填 | 默认值 | 取值范围/选项 | 说明 |
|---|---|---|---|---|---|
backend | COMBO | 是 | inductor | "inductor", "cudagraphs" | 选择 PyTorch 编译所使用的后端引擎。可选值为 inductor(默认)或 cudagraphs,用于指定底层的优化实现方式。 |
mode | COMBO | 是 | "default" | "default", "max-autotune", "max-autotune-no-cudagraphs", "reduce-overhead" | max-autotune、max-autotune-no-cudagraphs 和 reduce-overhead,用于在编译时间、内存占用和运行速度之间进行权衡。 |
fullgraph | BOOLEAN | 是 | False | - | 启用完整图形模式 |
double_blocks | BOOLEAN | 是 | True | - | 编译双注意力块 |
single_blocks | BOOLEAN | 是 | True | - | 编译单注意力块 |
dynamic | BOOLEAN | 是 | False | - | 启用动态模式 |
dynamo_cache_size_limit | INT | 否 | 64 | 0 - 1024 (步长: 1) | torch._dynamo.config.cache_size_limit |
force_parameter_static_shapes | BOOLEAN | 否 | True | - | torch._dynamo.config.force_parameter_static_shapes |
输出 (Output)
| 参数名称 | 数据类型 | 说明 |
|---|---|---|
| MODEL | MODEL | 输出经过 torch.compile 编译优化后的模型,可供后续采样或处理节点使用。 |
使用场景
在图像生成工作流中,你可以将此节点放置在模型加载节点之后、采样器节点之前。例如,加载一个 Stable Diffusion 模型后,通过此节点对其进行编译优化,再将优化后的模型送入采样器进行图像生成,以期获得更快的生成速度。
注意事项
请注意,此节点已被标记为“弃用”,开发者建议使用其替代节点 TorchCompileModelAdvanced。它仍处于实验性阶段,其优化效果可能因模型、硬件和具体参数的不同而有显著差异。
评论
使用 GitHub 登录后即可参与讨论。