VDN-H3: 하이브리드 어텐션으로 MiniMax H3 비디오를 재생 속도보다 빠르게 실행

ComfyUI Wikinews

MiniMax H3용 OpenVDN의 Video DeltaNet 하이브리드 어텐션 체크포인트가 14.4초 길이의 768p 클립을 8스텝으로 렌더링합니다. 커뮤니티 ComfyUI 포트도 이미 제공됩니다.

VDN-H3 (가중치, 코드)는 UC Berkeley / Impossible, Inc. / UT Austin 팀이 제작한 MiniMax H3의 하이브리드 어텐션 재작업 버전입니다. H3의 2차(quadratic) 장거리 어텐션을 선형 "Video Delta Attention" 브랜치로 대체하며, 수정되지 않은 H3 백본에 패치되는 50스텝 및 8스텝 증류(distilled) 체크포인트로 제공됩니다. 밀집(dense) H3 대비 거의 무손실 품질을 보고합니다. 네이티브 ComfyUI 포트도 이미 사용할 수 있습니다: Saganaki22/ComfyUI-VDN-H3.
네이티브 ComfyUI 노드로 실행 중인 VDN-H3

커뮤니티 ComfyUI 포트는 ComfyUI의 네이티브 MiniMax-H3 노드에 출시된 VDN-H3 체크포인트를 런타임 모델 패치로 적용하며, 코어 수정이 필요 없습니다.

Video DeltaNet이 H3를 가속하는 방법

플래그십 옴니(omni) 모델인 MiniMax H3에서 긴 토큰 시퀀스에 대한 소프트맥스 어텐션은 전체 런타임의 85% 이상을 차지하며, 비용은 클립 길이에 따라 2차적으로 증가합니다. Video DeltaNet은 비디오-비디오 어텐션을 두 개의 상호 보완적인 브랜치로 분할합니다. 하나는 인접 프레임 간의 정확한 어텐션을 유지하는 양방향 슬라이딩 윈도우 소프트맥스 브랜치(미세 디테일과 단기 안정성 담당)이고, 다른 하나는 상수 비용의 순환 상태(recurrent state)를 통해 장거리 컨텍스트를 전달하는 양방향 선형 어텐션 브랜치입니다. 4방향 경계 앵커(4-way boundary-anchor) 방식은 전역 일관성을 유지하면서 어텐션 밀도를 3.57%만 추가하므로, 클립의 첫 번째와 마지막 프레임이 모든 프레임에 계속 노출됩니다.

이 체크포인트는 H3 백본을 대체하지 않습니다. 별도의 선형 어텐션 브랜치와 추론 중에 백본으로 병합되는 두 개의 소형 LoRA 어댑터로 구성되며, 원본 가중치는 그대로 유지됩니다. 아키텍처 변경과 함께 8스텝 모델은 50스텝 모델의 DMD 증류(distillation) 버전입니다.

성능 및 품질

헤드라인 수치는 데이터센터 구성에서 나온 것입니다. 8개의 B200 GPU에서 VDN-H3는 8회의 디노이징 스텝으로 14.4초 분량의 768p 클립을 11.23초 만에 생성합니다. 단일 GPU 기준 밀집 H3 베이스라인과의 비교는 다음과 같습니다:

구성GPUs50 NFE (VDN-H3-50-step)8 NFE (VDN-H3-8-step)
밀집 MiniMax-H3 (H200)127.3분4.4분
VDN-H3 FP8 (H200)19.4분90.5초
밀집 MiniMax-H3 (B200)113.95분2.23분
VDN-H3 FP8 (B200)15.3분51초

팀은 하이브리드 모델이 밀집 H3 출력과 시각적으로 거의 구분되지 않으며, MiniMax FastH3보다 높은 품질과 더 나은 지시 수행(instruction-following) 능력을 보여준다고 보고합니다. 밀집 H3 및 FastH3와 나란히 비교한 클립을 포함한 샘플 비교는 프로젝트 페이지에서 확인할 수 있습니다.

프로젝트 페이지에 있는 VDN-H3 8스텝 출력 샘플.

ComfyUI에서 실행하기

공식 릴리스는 데이터센터 스택을 대상으로 합니다. Ulysses 시퀀스 병렬 처리와 Hopper 및 데이터센터급 Blackwell만 지원하는 FlashAttention-4 커널을 갖춘 8x B200 환경입니다. 공식 Windows 빌드는 없으며, FA4 커널은 컨슈머 Blackwell(sm_120)을 지원하지 않습니다.

ComfyUI-VDN-H3 포트는 ComfyUI의 네이티브 MiniMax-H3 모델에 런타임 모델 패치를 적용하는 방식으로 공식 하이브리드 어텐션 수식을 재현하며, FP8 선형 레이어와 융합 Triton 커널을 휴대 가능한 PyTorch 등가물로 대체합니다. 공식 구현에 대해 유닛 테스트를 거쳤으며 새로운 의존성이 필요 없습니다. 설치 방법은 다음과 같습니다:

  1. 저장소를 ComfyUI/custom_nodes/에 복제한 후 ComfyUI를 재시작합니다.
  2. 원하는 체크포인트 스테이지를 ComfyUI/models/vdn/에 다운로드하고 디렉터리 구조(model_spec.json, linear_branch/, adapters/)를 그대로 유지합니다:
hf download OpenVDN/vdn-minimax-h3 --include "stage-dmd-step-250/*" --local-dir <ComfyUI>/models/vdn

8스텝용 stage-dmd-step-250 다운로드 크기는 약 5GB(선형 브랜치 + 어댑터)이며, 50스텝용 stage-b-step-2000 버전은 약 4.3GB입니다.

이 포트가 제공하지 않는 것은 헤드라인 속도입니다. 공식 74.5배 수치는 8-GPU 병렬 처리, FA4, FP8, 8스텝 증류가 모두 결합된 결과입니다. 업스트림의 자체 단일 GPU 측정치는 50스텝에서 약 2.6배이며, 포트의 휴대용 커널은 그보다 다소 낮습니다(RTX 5090에서 1280x736 / 145프레임 기준 약 17초/it로 측정). Banodoco H3 채널의 커뮤니티 벤치마크에서는 동일한 하드웨어에서 8스텝 VDN-H3 Turbo가 1280x736 기준 2:04, LightXv2 4스텝 터보가 1:24로 측정되었으며, 댓글 참여자들은 VDN이 FastH3 경로보다 빠른 모션을 더 잘 유지한다고 지적했습니다.

동일한 프롬프트를 50스텝의 밀집 H3로 생성한 결과(프로젝트 페이지 비교의 상단).

다운로드 및 관련 링크

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
VDN-H3: 하이브리드 어텐션으로 MiniMax H3 비디오를 재생 속도보다 빠르게 실행 | ComfyUI Wiki