Unsloth MiniMax H3 GGUF 퀀트: 로컬 사용을 위한 전체 Q2-Q8 범위

ComfyUI Wikinews

Unsloth가 FL2VA 및 Ref2VA용 MiniMax H3 GGUF 퀀트(Q2_K 6.3GB부터 Q8_0 20GB까지)와 ComfyUI 및 stablediffusion.cpp용 Qwen3-VL 텍스트 인코더 GGUF를 공개했습니다.

Unsloth는 8월 10일 MiniMax H3의 GGUF 양자화 모델을 공개했습니다. H3 디노이저 두 개 모두와 여기에 필요한 Qwen3-VL 텍스트 인코더를 포함해 Q2:Q8 전체 범위를 다룹니다. 이 파일들은 ComfyUI, stablediffusion.cpp 및 Unsloth와 호환되므로, 초기 커뮤니티 양자화 물결보다 저VRAM 사용자에게 훨씬 더 폭넓은 선택지를 제공합니다.

MiniMax H3 GGUF UD-Q2_K_XL로 생성된 데모 클립

가장 낮은 단계인 UD-Q2_K_XL로 생성된 데모 클립: 960x544, 124프레임, 24FPS, 8스텝, 가이드 1.0 (GIF는 다운샘플링되었고 무음입니다. 전체 MP4에는 H3 고유의 32kHz 스테레오 오디오가 포함되어 있습니다)

공개 내용

H3에는 디노이저 두 개가 포함되어 있으며, 두 모델 모두 동일한 단계로 양자화되었습니다:

퀀트FL2VA 프루닝Ref2VA 프루닝
Q2_K6.26 GiB6.22 GiB
UD-Q2_K_XL7.51 GiB
Q3_K8.16 GiB8.12 GiB
UD-Q3_K_XL8.90 GiB
Q4_K10.64 GiB10.60 GiB
Q5_012.97 GiB12.93 GiB
Q6_K15.45 GiB15.42 GiB
Q8_019.96 GiB19.94 GiB

FL2VA는 첫 번째 및 마지막 프레임 변형(텍스트와 프레임 0개, 1개 또는 2개)이고, Ref2VA는 참조 변형(텍스트와 참조 이미지, 비디오 및 오디오)입니다. 두 모델은 별도의 체크포인트이므로 작업에 맞는 것을 선택하세요.

H3에 필요한 Qwen3-VL 32B 텍스트 인코더도 GGUF로 제공됩니다: qwen3vl_32b_minimax_h3-Q2_K_M.gguf(12.20GiB) 및 qwen3vl_32b_minimax_h3-Q4_K_M.gguf(16.97GiB).

GPU에 맞는 파일 선택

VRAM권장 단계
8–12 GBQ2_K 또는 UD-Q2_K_XL
12–16 GBQ3_K / UD-Q3_K_XL 또는 Q4_K
16–24 GBQ5_0 또는 Q6_K
24 GB 이상Q8_0

참고로 위 데모는 단일 GPU에서 UD-Q2_K_XL 단계로 960x544 해상도로 실행되었습니다.

ComfyUI에서 사용하는 방법

디퓨전 모델 GGUF는 이전 커뮤니티 H3 퀀트와 동일한 방식으로 표준 ComfyUI GGUF 로더 노드(ComfyUI-GGUF)를 통해 로드되며, 텍스트 인코더 GGUF는 GGUF 텍스트 인코더 로더를 통해 로드됩니다. 파일을 평소와 같이 MiniMax H3 비디오 및 오디오 VAE와 함께 사용하세요.

제공 정보

모든 파일은 Hugging Face의 unsloth/MiniMax-H3-GGUF에서 확인할 수 있습니다. ComfyUI 외에도 동일한 파일은 stablediffusion.cpp 및 Unsloth 자체 런타임에서도 실행할 수 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Unsloth MiniMax H3 GGUF 퀀트: 로컬 사용을 위한 전체 Q2-Q8 범위 | ComfyUI Wiki