MiniMax H3 TRT VAE: ComfyUI에서 H3 디코드 1.7배 가속

ComfyUI Wikinews

ComfyUI 노드 팩이 MiniMax H3 비디오 VAE를 TensorRT 엔진으로 컴파일해 VAE 인코드 및 디코드 시간을 최대 1.7배 단축합니다. 저 VRAM을 위한 w4a16 디코더도 제공합니다.

ComfyUI-H3VAE_TRT는 MiniMax H3 비디오 VAE를 TensorRT로 실행합니다. VAE를 한 번 컴파일한 뒤 엔진을 재사용하세요. 이 노드는 ComfyUI에서 최대 1.7배 빠른 VAE 인코드 및 디코드를 보고합니다.
프로젝트 README의 노드 및 워크플로 미리보기

프로젝트 README의 미리보기: ComfyUI 그래프 안의 TRT VAE 컴파일 및 로드 노드.

VAE 디코드는 모든 H3 실행에서 고정 비용입니다. 내장 ComfyUI 커널이 이미 PyTorch 측에서 그 비용을 줄여 주었고, 이 노드는 다른 방식을 택해 VAE를 컴파일된 TensorRT 엔진에 넘깁니다.

이 노드가 하는 일

이 팩은 두 개의 노드와 엔진으로 가는 ONNX 경로를 제공합니다.

  • MiniMax-H3 TRT VAE Compiler는 ONNX 인코더와 디코더를 받아 TensorRT 엔진을 빌드합니다. 이는 한 번만 수행하는 단계이며, 컴파일된 엔진은 이후에 재사용됩니다.
  • MiniMax-H3 TRT VAE Loader는 컴파일된 엔진을 로드해 일반 VAE 대신 사용할 수 있게 합니다.

가중치는 Hugging Face에 ONNX 파일로 공개되어 있으며 ComfyUI/models/vae에 넣으면 됩니다. 이 팩에는 ComfyUI 외부에서 엔진을 빌드하기 위한 독립 실행형 compile.py도 포함되어 있는데, 컴파일 단계가 UI를 막지 않아야 할 때 유용합니다.

설정

단계작업
1ComfyUI/custom_nodesgit clone https://github.com/lihaoyun6/ComfyUI-H3VAE_TRT로 복제하고 requirements.txt를 설치
2ONNX 인코더와 디코더를 ComfyUI/models/vae에 다운로드
3MiniMax-H3 TRT VAE Compiler를 한 번 실행해 엔진 빌드
4워크플로의 VAE를 MiniMax-H3 TRT VAE Loader로 전환

ONNX 저장소에는 w4a16_awq 디코더 변형도 있습니다. README는 GPU의 VRAM이 12GB 이상이 아닐 때 이 변형을 권장합니다.

이슈 트래커에서 나온 참고 사항

TensorRT 빌드는 설치된 스택에 민감하므로 컴파일 전에 저장소의 이슈를 읽어볼 가치가 있습니다.

  • 엔진 컴파일은 느립니다. 한 신고에서는 단일 빌드에 5시간이 넘게 걸렸다고 측정했으므로, 첫 컴파일은 세션 도중이 아니라 미리 해두는 것이 좋습니다.
  • TensorRT와 CUDA 버전이 일치해야 합니다. TensorRT 11.2와 CUDA 13.0 조합에 대한 미해결 신고가 있으며, 다른 환경에서는 IBuilder::buildSerializedNetwork API 사용 오류가 보고되었습니다.
  • 컴파일된 인코더가 첫 프레임, 마지막 프레임, 참조 프레임에 남기던 그리드 패턴이 신고되어 9월 초에 수정되었으므로, 현재 main에서 빌드하면 이 문제를 피할 수 있습니다.

이용 가능 여부

노드 팩과 ONNX 가중치 모두 공개되어 있습니다.

노드 팩: lihaoyun6/ComfyUI-H3VAE_TRT
ONNX 가중치: lihaoyun6/MiniMax-H3-VAE-ONNX
베이스 모델: MiniMaxAI/MiniMax-H3

이 팩에는 예제 워크플로가 포함되어 있지 않습니다. 컴파일러와 로더는 표준 VAE 노드 대신 기존 H3 그래프에 그대로 넣으면 됩니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
MiniMax H3 TRT VAE: ComfyUI에서 H3 디코드 1.7배 가속 | ComfyUI Wiki