MiniMax H3 w4a8: Kijai의 실험적 4비트 가중치, ComfyUI에 도착

ComfyUI Wikinews

Kijai가 실험적 w4a8 양자화 MiniMax H3 가중치(12.5GB FL2VA)와 int8 convrot VAE를 공개했습니다. ComfyUI 코어 지원이 PR #15308에서 병합되었습니다.

Kijai가 Hugging Face에 실험적 w4a8 양자화 MiniMax H3 가중치를 공개했으며, int8 convrot VAE도 함께 제공했습니다. 비대칭 4비트 레이아웃은 가중치를 요소당 약 0.56바이트로 저장하고 int8 GEMM으로 실행하여, 프루닝된 FL2VA checkpoint를 12.5GB로 줄입니다 (저장소).

이 형식은 ComfyUI 코어 작업으로 지원됩니다: 8월 7일에 병합된 Comfy-Org/ComfyUI #15308 'Support asym w4a8_int'와 8월 6일에 병합된 Comfy-Org/ComfyUI #15334 int8 convrot VAE 지원이 그 내용입니다.

테스트 전용으로 공개된 진행 중(work-in-progress) 릴리스입니다. 품질 및 속도 수치는 최종 결과가 아닌 초기 데이터 포인트로 간주하세요.

파일

파일크기역할
minimax_h3_fl2va_pruned_w4a8_mixed.safetensors12.5GBFL2VA 프루닝 diffusion 모델 (텍스트 기반 비디오 생성, 첫 번째/마지막 프레임)
minimax_h3_ref2va_pruned_w4a8_mixed.safetensors11.8GBRef2VA 프루닝 diffusion 모델 (레퍼런스 조건부)
minimax_h3_video_vae_int8_convrot.safetensors3.2GBint8 convrot 비디오 VAE, fp16 VAE보다 약 1.5배 빠름

w4a8 레이아웃 작동 방식

이 레이아웃은 comfy-kitchen PR #90('Add optimized w4a8 with int8 codebook')에서 비롯되었으며, ConvRot 활성화와 함께 int8 GEMM에서 실행되는 캘리브레이션 없는 4비트 가중치 저장 방식입니다:

  • ConvRot 회전 int4 가중치와 tensor 단위 Lloyd-Max 코드북 및 fp8 그룹 스케일
  • 그룹화된 int8로 역양자화되어 int8 CUTLASS GEMM에 입력
  • 실제 DiT 가중치에서 약 0.073의 가중치 relL2 오차 (NVFP4는 약 0.094)
  • 요소당 약 0.56바이트, int8보다 약 1.09배 빠르며, 캘리브레이션 과정 불필요
  • 백엔드: CUDA(청크 단위 융합 int4-to-int8 역양자화 + strided INT8 GEMM) 및 AMD/CPU용 Triton과 순수 torch eager 경로
RTX 5090에서 Kijai의 w4a8 테스트 데모 프레임

RTX 5090에서 Kijai의 예제 w4a8 결과 프레임 (comfy-kitchen PR #90에서 공유됨)

ComfyUI에서 사용하기

공식 H3 워크플로 템플릿(video_minimax_h3_t2v 등)으로 w4a8 diffusion 모델을 실행하고, 모델 로더를 w4a8 checkpoint로, VAE 로더를 minimax_h3_video_vae_int8_convrot.safetensors로 교체하세요. int8 convrot VAE는 PR #15334에서 병합된 ComfyUI 코어 지원이 필요합니다.

사용 가능한 곳

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
MiniMax H3 w4a8: Kijai의 실험적 4비트 가중치, ComfyUI에 도착 | ComfyUI Wiki