KJNodes/ltxvgenerated
LTX2 メモリ効率的 Sage Attention パッチ(LTX2MemoryEfficientSageAttentionPatch)
実験的!カスタム sageattention を有効にしてピーク VRAM 使用量を削減し、アテンションモードを上書きします。最新バージョンの sageattention が必要です。
LTX2 Memory Efficient Sage Attention Patch
model
model
triton_kernels
KJNodes
説明
実験的!このノードはカスタム sageattention パッチを有効にしてピーク VRAM 使用量を削減します。現在のモデル内のアテンションモードを上書きし、メモリ効率的な sageattention カーネルに置き換えます。sageattention ライブラリの最新バージョンが必要です。
入力
-
model (
MODEL、必須)
メモリ効率的なアテンションパッチが適用される拡散モデル。 -
triton_kernels (
BOOLEAN、必須、デフォルト:true)
有効にすると、セルフアテンションの Q/K 射影に Triton fused RoPE カーネルを使用します。これによりメモリをさらに削減し、パフォーマンスを向上させることができますが、Triton がインストールされている必要があります。
出力
MODEL
アテンションモードが sageattention を使用するようにパッチされた同じモデル。低 VRAM 使用量で推論に使用できます。
使用上の注意
- このノードは実験的です。今後のバージョンで動作が変更される可能性があります。
- 最新の
sageattentionパッケージがインストールされていることを確認してください(例:pip install sageattention --upgrade)。 triton_kernelsを有効にするには、環境に Triton が利用可能である必要があります。Triton が未インストールの場合は、この入力をfalseに設定してください。- このパッチはモデルに組み込まれたアテンション機構を上書きするため、モデル内のすべてのアテンションレイヤーに影響を与えます。
- 通常、
LTX2系のワークフローと組み合わせて使用し、サンプリング中の VRAM ピークを削減します。
インストール(SageAttention)
このオプションを使用するには、ComfyUI の Python 環境に SageAttention ライブラリのインストールが必要です:
- 公式リポジトリ(Linux): thu-ml/SageAttention -
pip install sageattention(要件:python>=3.9、torch>=2.3.0、triton>=3.0.0、CUDA>=12.0。バージョン要件は README 参照) - Windows: woct0rdho/SageAttention - Windows 用プリビルド wheel を提供。まず triton-windows をインストールし、releases ページ から PyTorch バージョンに合う wheel を選択(README 参照)
ComfyUI の組み込みグローバル高速化(ノード不要)には、起動時に --use-sage-attention を追加します。一部のモデル(Wan、Qwen-Image など)で量子化オーバーフローにより黒画像やノイズが発生する場合は、sageattn_qk_int8_pv_fp16_cuda(最もオーバーフローしにくい)を使用するか、pv_accum_dtype を調整してください。
コメント
GitHubでサインインしてディスカッションに参加しましょう。