ComfyUI에 Veda 희소 어텐션 등장: 더 빨라진 MiniMax H3

ComfyUI Wikinews

Veda 팀이 증류된 희소 예측기로 MiniMax H3 어텐션을 대체하는 공식 ComfyUI 노드를 공개했습니다. 어텐션 타일의 90%를 건너뛰어 영상 생성 속도를 최대 3배 높입니다.

<strong>Veda</strong>는 ByteDance, HKU, USTC가 개발해 ICML 2026에서 발표한 비디오 diffusion 모델용 학습 기반 희소 어텐션 방법입니다. 이제 저자들이 이를 공식 ComfyUI 커스텀 노드인 <strong>Veda Sparse Attention (MiniMax H3)</strong>로 패키징했습니다. 이 노드는 모델 가중치를 단 하나도 바꾸지 않고 MiniMax H3 어텐션을 평소 비용의 약 10분의 1로 실행합니다.
동일한 Waver-T2V-12B 클립에서 95% 희소도의 Veda 옆에 놓인 FlashAttention-3 전체 어텐션

Veda 프로젝트 페이지에서: 720p, 241 프레임의 Waver-T2V-12B. 왼쪽은 전체 어텐션, 오른쪽은 Veda의 타일 건너뛰기 경로입니다.

Veda가 하는 일

모델을 압축하거나 다시 학습하는 대신, Veda는 어텐션 맵에서 어느 부분이 중요한지 학습합니다. 증류된 경량 예측기가 어텐션 타일을 점수화해 상위 약 10%만 유지하고, 타일 건너뛰기 커널이 선택된 K/V 타일만 가져옵니다. 가중치 자체가 아니라 어텐션 계산 방식을 바꾸기 때문에 어떤 LoRA와도, 그리고 파인튜닝되거나 양자화된 MiniMax H3 체크포인트와도 호환됩니다.

프로젝트 페이지는 이 방법을 세 단계로 설명합니다. max-pooled 전체 어텐션이 타일 수준의 teacher 분포를 제공하고, 헤드별 Q/K 프로젝션을 갖춘 Triplet Pooling 추정기가 그 분포를 재구성하며, 헤드 인식 top-k 선택이 커널이 따르는 타일 마스크를 출력합니다. 레이어별, 헤드별 타일 지오메트리는 고정된 하드웨어 예산 안에서 이질적인 공간 및 시간 헤드를 수용하도록 선택됩니다.

MiniMax H3에서 공개된 예측기는 8단계 Turbo LoRA로 학습되었습니다. 저장소에 따르면 이 체크포인트는 모달리티와 스텝에 구애받지 않습니다. 즉 T2VA, FL2VA, R2VA에 모두 적용되며 샘플링 스텝 수와도 무관하고, 전용 R2VA 파인튜닝은 향후 릴리스로 예고되어 있습니다.

ComfyUI 노드

이 노드는 의도적으로 단순합니다. MODEL 입력에 MODEL 출력입니다. 어텐션 오버라이드로 설치되므로, 모델과 모든 LoRA 로더 이후, 가이드 또는 샘플러 바로 이전의 MODEL 연결선에 배치합니다. Ctrl+B로 바이패스하면 동일한 시드로 전체 어텐션을 사용해 렌더링하므로 직접 비교할 수 있습니다.

입력기본값설명
generated_sparsity90%생성된 영상의 어텐션 희소도. 24와 같은 정수를 지정하면 128-토큰 키 타일을 정확히 그 개수만큼 유지합니다.
reference_sparsity90%참조 토큰에 대한 동일 설정: 첫/마지막 프레임, 가이드 프레임, 참조 이미지 및 영상. 0%이면 전체 어텐션을 적용합니다.
full_attention_layers비어 있음전체 어텐션을 유지하는 0부터 시작하는 DiT 블록. 예: 0, 1, 47-49.
full_attention_steps비어 있음전체 어텐션을 유지하는 0부터 시작하는 샘플링 스텝.
verbose꺼짐각 실행 후 단계별 어텐션 타이밍, 호출 횟수, 예측기 세부 정보를 보고합니다.

실행이 끝나면 노드는 실제로 수행한 내용을 출력합니다:

Veda done · Triton INT8 (SM120)
Video: 1344x768 · 5.2 s
Attention computed: 10.9% of full attention (89.1% skipped)

커널이 현재 GPU에서 실행될 수 없으면 노드가 이를 알리고, 해당 실행에서는 깨진 렌더를 만들지 않고 모델 자체의 어텐션으로 폴백합니다.

H3에서는 이 노드를 ComfyUI 자체의 모델 희소 어텐션 노드와 함께 쌓지 마세요. 해당 노드는 어텐션 블록을 완전히 교체하므로 Veda가 호출될 일이 없습니다. Veda 노드는 이런 조합을 감지해 경고합니다.

성능

1344x768, 124 프레임(5.2초) T2VA, 8단계 Turbo LoRA 및 90% 희소도 기준, Windows 11의 RTX 5070 12 GB에서 측정:

어텐션 경로스텝당8 스텝스텝당 어텐션
ComfyUI 기본40.7 s342 s31.1 s
ComfyUI --use-sage-attention24.8 s231 s15.2 s
Veda sparse INT814.0 s130 s4.41 s

이는 엔드투엔드 기준 약 2.9배, 어텐션만 기준 7.1배이며, 클립 길이가 길어질수록 격차는 더 벌어집니다. 104k 토큰에서 90% 희소도의 단일 어텐션 레이어는 528 ms가 걸리는 반면, 전체 어텐션은 11.8초가 걸립니다.

동일한 클립에서 FlashAttention-3 베이스라인 옆에 놓인 95% 희소도의 Veda

95% 희소도의 Veda. Veda 프로젝트는 720p, 241 프레임 Waver-T2V-12B에서 엔드투엔드 속도가 5.1배 향상되어 19.4분에서 3.8분으로 단축되었다고 보고합니다.

예측기 저장소는 자체 전체 어텐션 베이스라인 대비 엔드투엔드 속도 향상도 제시합니다. 모두 Turbo LoRA로 어텐션의 10%를 유지한 조건입니다:

GPU클립어텐션 속도 향상엔드투엔드 속도 향상
RTX PRO 6000 Blackwell16:9 · 14.4 s6.79x3.12x
RTX 409016:9 · 5.17 s4.75x1.77x
RTX 409016:9 · 10.1 s6.22x2.42x
RTX 409016:9 · 14.4 s6.31x2.82x

왼쪽은 전체 어텐션, 오른쪽은 Veda입니다. 동일한 프롬프트, 시드, Turbo LoRA를 사용했으며 단일 RTX PRO 6000 Blackwell에서 생성했습니다.

하드웨어 지원

하나의 Triton 커널이 Windows와 Linux에서 SM80 이후의 모든 NVIDIA GPU를 지원하며, Apple silicon은 MLX를 통해 실행됩니다. 일치하는 커널이 없는 그래픽 카드는 그 사실을 알려주며, 모델은 자체 어텐션을 그대로 사용합니다.

하드웨어상태
RTX 30 / A100 / RTX 40 / L40 (sm80-89)코드 경로 준비됨, 저자 검증 전
H100 / H200 (sm90)코드 경로 준비됨, 저자 검증 전
B200 / B300 (sm100 / sm103)코드 경로 준비됨, 저자 검증 전
RTX 50, RTX PRO 6000 Blackwell (sm120)검증됨: RTX 5070, Windows 11
DGX Spark / GB10 (sm121)코드 경로 준비됨, 저자 검증 전
Apple silicon (M 시리즈)검증됨: M3 Pro, macOS 15

시작하기

Veda는 ComfyUI 0.38.0 이상이 필요합니다. ComfyUI 매니저에서 "Veda"를 검색해 노드를 설치하거나, CLI에서 설치할 수 있습니다:

comfy node install veda-sparse-attention

그런 다음 275 MB 예측기를 ComfyUI/models/veda/에 배치합니다:

hf download Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview \
  minimax_h3_t2va_veda_8nfe_600step_preview_fp8.safetensors \
  --local-dir ComfyUI/models/veda

이 노드는 자체적으로 아무것도 다운로드하지 않습니다. 더 쉬운 방법은 워크플로 -> 템플릿 탐색 -> Veda-on-ComfyUI를 열고 템플릿을 선택하는 것입니다. 그러면 ComfyUI의 누락됨 모델 대화상자에서 예측기를 제공합니다. 저장소에는 두 개의 예시 워크플로가 포함되어 있습니다:

사용 가능 여부

이 노드는 Comfy Registry에 veda-sparse-attention으로 등록되어 있고, 소스는 veda-sparse/Veda-on-ComfyUI에 있습니다. 예측기 체크포인트는 Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview에 있으며, 학습 코드는 veda-sparse/Miowtion에 있습니다. 공개된 예측기는 미리보기로 표시되어 있으며, 8단계 Turbo LoRA로 5초, 10초, 14초 길이의 1344x768, 768x1344, 768x768, 1024x768 해상도에 대해 학습되었습니다. 다른 크기는 가장 가까운 학습된 타일 계획으로 폴백되므로 전체 어텐션과 비교해 확인해야 합니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
ComfyUI에 Veda 희소 어텐션 등장: 더 빨라진 MiniMax H3 | ComfyUI Wiki