Unsloth MiniMax H3 GGUF 퀀트: 로컬 사용을 위한 전체 Q2-Q8 범위
Unsloth가 FL2VA 및 Ref2VA용 MiniMax H3 GGUF 퀀트(Q2_K 6.3GB부터 Q8_0 20GB까지)와 ComfyUI 및 stablediffusion.cpp용 Qwen3-VL 텍스트 인코더 GGUF를 공개했습니다.
Unsloth는 8월 10일 MiniMax H3의 GGUF 양자화 모델을 공개했습니다. H3 디노이저 두 개 모두와 여기에 필요한 Qwen3-VL 텍스트 인코더를 포함해 Q2:Q8 전체 범위를 다룹니다. 이 파일들은 ComfyUI, stablediffusion.cpp 및 Unsloth와 호환되므로, 초기 커뮤니티 양자화 물결보다 저VRAM 사용자에게 훨씬 더 폭넓은 선택지를 제공합니다.
가장 낮은 단계인 UD-Q2_K_XL로 생성된 데모 클립: 960x544, 124프레임, 24FPS, 8스텝, 가이드 1.0 (GIF는 다운샘플링되었고 무음입니다. 전체 MP4에는 H3 고유의 32kHz 스테레오 오디오가 포함되어 있습니다)
공개 내용
H3에는 디노이저 두 개가 포함되어 있으며, 두 모델 모두 동일한 단계로 양자화되었습니다:
| 퀀트 | FL2VA 프루닝 | Ref2VA 프루닝 |
|---|---|---|
| Q2_K | 6.26 GiB | 6.22 GiB |
| UD-Q2_K_XL | 7.51 GiB | — |
| Q3_K | 8.16 GiB | 8.12 GiB |
| UD-Q3_K_XL | 8.90 GiB | — |
| Q4_K | 10.64 GiB | 10.60 GiB |
| Q5_0 | 12.97 GiB | 12.93 GiB |
| Q6_K | 15.45 GiB | 15.42 GiB |
| Q8_0 | 19.96 GiB | 19.94 GiB |
FL2VA는 첫 번째 및 마지막 프레임 변형(텍스트와 프레임 0개, 1개 또는 2개)이고, Ref2VA는 참조 변형(텍스트와 참조 이미지, 비디오 및 오디오)입니다. 두 모델은 별도의 체크포인트이므로 작업에 맞는 것을 선택하세요.
H3에 필요한 Qwen3-VL 32B 텍스트 인코더도 GGUF로 제공됩니다: qwen3vl_32b_minimax_h3-Q2_K_M.gguf(12.20GiB) 및 qwen3vl_32b_minimax_h3-Q4_K_M.gguf(16.97GiB).
GPU에 맞는 파일 선택
| VRAM | 권장 단계 |
|---|---|
| 8–12 GB | Q2_K 또는 UD-Q2_K_XL |
| 12–16 GB | Q3_K / UD-Q3_K_XL 또는 Q4_K |
| 16–24 GB | Q5_0 또는 Q6_K |
| 24 GB 이상 | Q8_0 |
참고로 위 데모는 단일 GPU에서 UD-Q2_K_XL 단계로 960x544 해상도로 실행되었습니다.
ComfyUI에서 사용하는 방법
디퓨전 모델 GGUF는 이전 커뮤니티 H3 퀀트와 동일한 방식으로 표준 ComfyUI GGUF 로더 노드(ComfyUI-GGUF)를 통해 로드되며, 텍스트 인코더 GGUF는 GGUF 텍스트 인코더 로더를 통해 로드됩니다. 파일을 평소와 같이 MiniMax H3 비디오 및 오디오 VAE와 함께 사용하세요.
제공 정보
모든 파일은 Hugging Face의 unsloth/MiniMax-H3-GGUF에서 확인할 수 있습니다. ComfyUI 외에도 동일한 파일은 stablediffusion.cpp 및 Unsloth 자체 런타임에서도 실행할 수 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.