설명
실험적! 이 노드는 커스텀 sageattention 패치를 활성화하여 최대 VRAM 사용량을 줄입니다. 현재 모델의 어텐션 모드를 재정의하고, 메모리 효율적인 sageattention 커널로 대체합니다. sageattention 라이브러리의 최신 버전이 필요합니다.
입력
-
model (
MODEL, 필수)
메모리 효율적 어텐션 패치가 적용될 확산 모델입니다. -
triton_kernels (
BOOLEAN, 필수, 기본값:true)
활성화되면 self-attention Q/K 프로젝션에 Triton 융합 RoPE 커널을 사용합니다. 이는 메모리를 더욱 줄이고 성능을 향상시킬 수 있지만, Triton이 설치되어 있어야 합니다.
출력
MODEL
어텐션 모드가 sageattention을 사용하도록 패치된 동일한 모델로, 더 낮은 VRAM 사용량으로 추론할 준비가 되었습니다.
사용 참고 사항
- 이 노드는 실험적입니다 — 동작은 향후 버전에서 변경될 수 있습니다.
- 최신
sageattention패키지가 설치되어 있는지 확인하세요 (예:pip install sageattention --upgrade). triton_kernels를 활성화하려면 Triton이 환경에 있어야 합니다. Triton이 설치되지 않은 경우, 이 입력을거짓으로 설정하세요.- 이 패치는 모델의 내장 어텐션 메커니즘을 재정의하며, 모델의 모든 어텐션 레이어에 영향을 미칩니다.
- 일반적으로 LTX2 계열 워크플로와 함께 사용되어 샘플링 중 VRAM 피크를 줄입니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.