NVIDIA H3 슈퍼 가속: MiniMax H3 영상 최대 27.7배 빨라져

ComfyUI Wikinews

NVIDIA Sol Engine은 MiniMax H3를 4단계 드래프트와 3단계 LTX 리파인먼트로 실행합니다: GB200 하나로 5초 768p 영상 6.85초, SGLang보다 최대 27.7배 빠릅니다.

MiniMax H3 슈퍼 가속 (공식 페이지)은 NVIDIA SANA 팀이 만든 NVIDIA Sol Engine 파이프라인으로, MiniMax H3 영상 생성을 두 단계 작업으로 바꿉니다: 속도 LoRA를 쓴 H3의 4단계 896×512 드래프트, 그 다음 Sol-Attn으로 목표 해상도에서 3단계 LTX 리파인먼트. NVIDIA GB200 하나에서 측정했을 때 5초 1344×768 영상은 6.85초, 10초 영상은 14.93초에 렌더링되며, 공개된 SGLang 베이스라인보다 각각 22.2배, 27.7배 빠릅니다.
NVIDIA H3 슈퍼 가속: 10초 1440p 도시 군중 결과

NVIDIA 페이지에 올라온 독립 1440p 결과 중 하나(10초, 2560×1440): 2단계 가속이며 1440p는 매칭 베이스라인이 기록되지 않았습니다.

작동 방식

전체 해상도에서 H3 디노이징 스텝을 여러 번 실행하는 대신, H3 슈퍼 가속은 짧은 저해상도 드래프트에서 생성 작업의 대부분을 수행하고 가벼운 리파인먼트 패스로 고해상도 디테일을 복원합니다. 각 단계는 하나의 작업이며, 두 단계는 GB200 하나에서 직렬로 실행됩니다:

단계모델해상도FPS스텝출력
1단계 · 드래프트MiniMax-H3 + 속도 LoRA896×512244드래프트 영상
2단계 · 리파인LTX-2.5 + Sol-Attn768p / 1080p / 2K243최종 영상

1단계는 LightX2V MiniMax-H3 Turbo LoRA로 896×512 초기 영상을 4단계 디노이징으로 생성합니다. 2단계는 드래프트를 요청한 출력 해상도로 업스케일한 뒤, 고해상도 디테일과 일관성을 복원하는 3단계 Sol-Attn 패스를 실행합니다. 이 파이프라인은 SGLang 베이스라인과 비트 단위로 동일하지 않습니다. 샘플링 경로가 바뀌므로 디테일, 텍스처, 모션 또는 오디오에 차이가 생길 수 있으며, NVIDIA 페이지의 비교 영상으로 그 트레이드오프를 직접 확인할 수 있습니다.

측정된 레이턴시

NVIDIA GB200 하나에서의 엔드투엔드 레이턴시(최신 Sol-Super 결과는 2단계 전체 서비스에 Sol-Attn 사용):

해상도길이DiffusersSGLangSol EngineSol-Super E2Evs. SGLang
1344×7685초167.8초152.3초45.4초6.852초22.2배
1344×76810초468.2초414.1초132.5초14.931초27.7배

두 가속의 원인은 서로 다릅니다. 1단계는 공식 H3 VAE 디코드(3.427초)를 TAEH3 경량 디코더(0.028초)로 교체하고, 2단계는 밀집 LTX-2.5 Video VAE 디코더(매칭 121프레임 디코드 기준 6.404초)를 Sol-Attn 리파이너와 LTX TAEHV 최종 디코드로 교체합니다. 2단계 인코더는 의도적으로 그대로 두었습니다. 리파이너가 원래 LTX-2.5 VAE 잠재 분포로 학습되었기 때문입니다.

768p 출력 기준 측정 처리량은 GB200 하나를 완전히 가동했을 때 시간당 약 525개의 5초 영상으로, SGLang 베이스라인의 23.6개와 대비됩니다.

시각 비교

NVIDIA 페이지는 각 768p 및 1080p 샘플을 동일한 생성 입력을 사용한 SGLang 베이스라인 결과와 짝지어 비교합니다:

SGLang 베이스라인H3 슈퍼 가속
768p 5초 일본 거리, SGLang 베이스라인768p 5초 일본 거리, 가속
번잡한 일본 거리에서 남녀가 날카로운 말을 주고받는 장면(1344×768, 5초)동일 입력, 22.2배 빠름
SGLang 베이스라인H3 슈퍼 가속
1080p 5초 대나무 숲, SGLang 베이스라인1080p 5초 대나무 숲, 가속
대나무 숲에서 두 무술가가 마주 보는 장면(1080p, 5초)동일 입력, 가속

매칭 베이스라인 없이 독립 1440p 결과 2개(10초, 2560×1440)도 함께 공개되었습니다:

가용성

이 파이프라인은 공개 구성 요소로 만들어졌습니다: 공식 MiniMax-H3 체크포인트, 드래프트에 쓰는 LightX2V MiniMax-H3 Turbo 4단계 LoRA, LTX-2.5 사전 학습 체크포인트, TAEH3 및 LTX TAEHV 경량 디코더. GB200 하드웨어에서 Sol-Attn을 사용하는 NVIDIA Sol Engine 위에서 실행되며, ComfyUI 노드 팩이 아닌 측정 벤치마크를 포함한 프로덕션 레퍼런스로 제공됩니다. 이 글을 쓰는 시점에 NVIDIA의 공식 ComfyUI 워크플로는 없으며, Sol Engine 개별 구성 요소(예: Sol-Attn 패치)의 커뮤니티 포팅이 등장하기 시작했습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
NVIDIA H3 슈퍼 가속: MiniMax H3 영상 최대 27.7배 빨라져 | ComfyUI Wiki