説明
実験的!このノードはカスタム sageattention パッチを有効にしてピーク VRAM 使用量を削減します。現在のモデル内のアテンションモードを上書きし、メモリ効率的な sageattention カーネルに置き換えます。sageattention ライブラリの最新バージョンが必要です。
入力
-
model (
MODEL、必須)
メモリ効率的なアテンションパッチが適用される拡散モデル。 -
triton_kernels (
BOOLEAN、必須、デフォルト:true)
有効にすると、セルフアテンションの Q/K 射影に Triton fused RoPE カーネルを使用します。これによりメモリをさらに削減し、パフォーマンスを向上させることができますが、Triton がインストールされている必要があります。
出力
MODEL
アテンションモードが sageattention を使用するようにパッチされた同じモデル。低 VRAM 使用量で推論に使用できます。
使用上の注意
- このノードは実験的です。今後のバージョンで動作が変更される可能性があります。
- 最新の
sageattentionパッケージがインストールされていることを確認してください(例:pip install sageattention --upgrade)。 triton_kernelsを有効にするには、環境に Triton が利用可能である必要があります。Triton が未インストールの場合は、この入力をfalseに設定してください。- このパッチはモデルに組み込まれたアテンション機構を上書きするため、モデル内のすべてのアテンションレイヤーに影響を与えます。
- 通常、
LTX2系のワークフローと組み合わせて使用し、サンプリング中の VRAM ピークを削減します。
コメント
GitHubでサインインしてディスカッションに参加しましょう。