KJNodes/ltxvgenerated

LTX2 메모리 효율적 Sage Attention 패치(LTX2MemoryEfficientSageAttentionPatch)

실험적! 커스텀 sageattention을 활성화하여 최대 VRAM 사용량을 줄이고, 어텐션 모드를 재정의합니다. 최신 sageattention 버전이 필요합니다.

LTX2 Memory Efficient Sage Attention Patch

model
model
triton_kernels
KJNodes

설명

실험적! 이 노드는 커스텀 sageattention 패치를 활성화하여 최대 VRAM 사용량을 줄입니다. 현재 모델의 어텐션 모드를 재정의하고, 메모리 효율적인 sageattention 커널로 대체합니다. sageattention 라이브러리의 최신 버전이 필요합니다.

입력

  • model (MODEL, 필수)
    메모리 효율적 어텐션 패치가 적용될 확산 모델입니다.

  • triton_kernels (BOOLEAN, 필수, 기본값: true)
    활성화되면 self-attention Q/K 프로젝션에 Triton 융합 RoPE 커널을 사용합니다. 이는 메모리를 더욱 줄이고 성능을 향상시킬 수 있지만, Triton이 설치되어 있어야 합니다.

출력

  • MODEL
    어텐션 모드가 sageattention을 사용하도록 패치된 동일한 모델로, 더 낮은 VRAM 사용량으로 추론할 준비가 되었습니다.

사용 참고 사항

  • 이 노드는 실험적입니다 — 동작은 향후 버전에서 변경될 수 있습니다.
  • 최신 sageattention 패키지가 설치되어 있는지 확인하세요 (예: pip install sageattention --upgrade).
  • triton_kernels를 활성화하려면 Triton이 환경에 있어야 합니다. Triton이 설치되지 않은 경우, 이 입력을 거짓으로 설정하세요.
  • 이 패치는 모델의 내장 어텐션 메커니즘을 재정의하며, 모델의 모든 어텐션 레이어에 영향을 미칩니다.
  • 일반적으로 LTX2 계열 워크플로와 함께 사용되어 샘플링 중 VRAM 피크를 줄입니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
LTX2 메모리 효율적 Sage Attention 패치 (LTX2MemoryEfficientSageAttentionPatch) - ComfyUI-KJNodes | ComfyUI Wiki