ComfyUI에 Veda 희소 어텐션 등장: 더 빨라진 MiniMax H3
Veda 팀이 증류된 희소 예측기로 MiniMax H3 어텐션을 대체하는 공식 ComfyUI 노드를 공개했습니다. 어텐션 타일의 90%를 건너뛰어 영상 생성 속도를 최대 3배 높입니다.
Veda 프로젝트 페이지에서: 720p, 241 프레임의 Waver-T2V-12B. 왼쪽은 전체 어텐션, 오른쪽은 Veda의 타일 건너뛰기 경로입니다.
Veda가 하는 일
모델을 압축하거나 다시 학습하는 대신, Veda는 어텐션 맵에서 어느 부분이 중요한지 학습합니다. 증류된 경량 예측기가 어텐션 타일을 점수화해 상위 약 10%만 유지하고, 타일 건너뛰기 커널이 선택된 K/V 타일만 가져옵니다. 가중치 자체가 아니라 어텐션 계산 방식을 바꾸기 때문에 어떤 LoRA와도, 그리고 파인튜닝되거나 양자화된 MiniMax H3 체크포인트와도 호환됩니다.
프로젝트 페이지는 이 방법을 세 단계로 설명합니다. max-pooled 전체 어텐션이 타일 수준의 teacher 분포를 제공하고, 헤드별 Q/K 프로젝션을 갖춘 Triplet Pooling 추정기가 그 분포를 재구성하며, 헤드 인식 top-k 선택이 커널이 따르는 타일 마스크를 출력합니다. 레이어별, 헤드별 타일 지오메트리는 고정된 하드웨어 예산 안에서 이질적인 공간 및 시간 헤드를 수용하도록 선택됩니다.
MiniMax H3에서 공개된 예측기는 8단계 Turbo LoRA로 학습되었습니다. 저장소에 따르면 이 체크포인트는 모달리티와 스텝에 구애받지 않습니다. 즉 T2VA, FL2VA, R2VA에 모두 적용되며 샘플링 스텝 수와도 무관하고, 전용 R2VA 파인튜닝은 향후 릴리스로 예고되어 있습니다.
ComfyUI 노드
이 노드는 의도적으로 단순합니다. MODEL 입력에 MODEL 출력입니다. 어텐션 오버라이드로 설치되므로, 모델과 모든 LoRA 로더 이후, 가이드 또는 샘플러 바로 이전의 MODEL 연결선에 배치합니다. Ctrl+B로 바이패스하면 동일한 시드로 전체 어텐션을 사용해 렌더링하므로 직접 비교할 수 있습니다.
| 입력 | 기본값 | 설명 |
|---|---|---|
generated_sparsity | 90% | 생성된 영상의 어텐션 희소도. 24와 같은 정수를 지정하면 128-토큰 키 타일을 정확히 그 개수만큼 유지합니다. |
reference_sparsity | 90% | 참조 토큰에 대한 동일 설정: 첫/마지막 프레임, 가이드 프레임, 참조 이미지 및 영상. 0%이면 전체 어텐션을 적용합니다. |
full_attention_layers | 비어 있음 | 전체 어텐션을 유지하는 0부터 시작하는 DiT 블록. 예: 0, 1, 47-49. |
full_attention_steps | 비어 있음 | 전체 어텐션을 유지하는 0부터 시작하는 샘플링 스텝. |
verbose | 꺼짐 | 각 실행 후 단계별 어텐션 타이밍, 호출 횟수, 예측기 세부 정보를 보고합니다. |
실행이 끝나면 노드는 실제로 수행한 내용을 출력합니다:
Veda done · Triton INT8 (SM120)
Video: 1344x768 · 5.2 s
Attention computed: 10.9% of full attention (89.1% skipped)커널이 현재 GPU에서 실행될 수 없으면 노드가 이를 알리고, 해당 실행에서는 깨진 렌더를 만들지 않고 모델 자체의 어텐션으로 폴백합니다.
성능
1344x768, 124 프레임(5.2초) T2VA, 8단계 Turbo LoRA 및 90% 희소도 기준, Windows 11의 RTX 5070 12 GB에서 측정:
| 어텐션 경로 | 스텝당 | 8 스텝 | 스텝당 어텐션 |
|---|---|---|---|
| ComfyUI 기본 | 40.7 s | 342 s | 31.1 s |
ComfyUI --use-sage-attention | 24.8 s | 231 s | 15.2 s |
| Veda sparse INT8 | 14.0 s | 130 s | 4.41 s |
이는 엔드투엔드 기준 약 2.9배, 어텐션만 기준 7.1배이며, 클립 길이가 길어질수록 격차는 더 벌어집니다. 104k 토큰에서 90% 희소도의 단일 어텐션 레이어는 528 ms가 걸리는 반면, 전체 어텐션은 11.8초가 걸립니다.
95% 희소도의 Veda. Veda 프로젝트는 720p, 241 프레임 Waver-T2V-12B에서 엔드투엔드 속도가 5.1배 향상되어 19.4분에서 3.8분으로 단축되었다고 보고합니다.
예측기 저장소는 자체 전체 어텐션 베이스라인 대비 엔드투엔드 속도 향상도 제시합니다. 모두 Turbo LoRA로 어텐션의 10%를 유지한 조건입니다:
| GPU | 클립 | 어텐션 속도 향상 | 엔드투엔드 속도 향상 |
|---|---|---|---|
| RTX PRO 6000 Blackwell | 16:9 · 14.4 s | 6.79x | 3.12x |
| RTX 4090 | 16:9 · 5.17 s | 4.75x | 1.77x |
| RTX 4090 | 16:9 · 10.1 s | 6.22x | 2.42x |
| RTX 4090 | 16:9 · 14.4 s | 6.31x | 2.82x |
왼쪽은 전체 어텐션, 오른쪽은 Veda입니다. 동일한 프롬프트, 시드, Turbo LoRA를 사용했으며 단일 RTX PRO 6000 Blackwell에서 생성했습니다.
하드웨어 지원
하나의 Triton 커널이 Windows와 Linux에서 SM80 이후의 모든 NVIDIA GPU를 지원하며, Apple silicon은 MLX를 통해 실행됩니다. 일치하는 커널이 없는 그래픽 카드는 그 사실을 알려주며, 모델은 자체 어텐션을 그대로 사용합니다.
| 하드웨어 | 상태 |
|---|---|
| RTX 30 / A100 / RTX 40 / L40 (sm80-89) | 코드 경로 준비됨, 저자 검증 전 |
| H100 / H200 (sm90) | 코드 경로 준비됨, 저자 검증 전 |
| B200 / B300 (sm100 / sm103) | 코드 경로 준비됨, 저자 검증 전 |
| RTX 50, RTX PRO 6000 Blackwell (sm120) | 검증됨: RTX 5070, Windows 11 |
| DGX Spark / GB10 (sm121) | 코드 경로 준비됨, 저자 검증 전 |
| Apple silicon (M 시리즈) | 검증됨: M3 Pro, macOS 15 |
시작하기
Veda는 ComfyUI 0.38.0 이상이 필요합니다. ComfyUI 매니저에서 "Veda"를 검색해 노드를 설치하거나, CLI에서 설치할 수 있습니다:
comfy node install veda-sparse-attention그런 다음 275 MB 예측기를 ComfyUI/models/veda/에 배치합니다:
hf download Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview \
minimax_h3_t2va_veda_8nfe_600step_preview_fp8.safetensors \
--local-dir ComfyUI/models/veda이 노드는 자체적으로 아무것도 다운로드하지 않습니다. 더 쉬운 방법은 워크플로 -> 템플릿 탐색 -> Veda-on-ComfyUI를 열고 템플릿을 선택하는 것입니다. 그러면 ComfyUI의 누락됨 모델 대화상자에서 예측기를 제공합니다. 저장소에는 두 개의 예시 워크플로가 포함되어 있습니다:
사용 가능 여부
이 노드는 Comfy Registry에 veda-sparse-attention으로 등록되어 있고, 소스는 veda-sparse/Veda-on-ComfyUI에 있습니다. 예측기 체크포인트는 Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview에 있으며, 학습 코드는 veda-sparse/Miowtion에 있습니다. 공개된 예측기는 미리보기로 표시되어 있으며, 8단계 Turbo LoRA로 5초, 10초, 14초 길이의 1344x768, 768x1344, 768x768, 1024x768 해상도에 대해 학습되었습니다. 다른 크기는 가장 가까운 학습된 타일 계획으로 폴백되므로 전체 어텐션과 비교해 확인해야 합니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.