Квантования MiniMax H3: GGUF, INT4 и NVFP4 для потребительских GPU
Квантования MiniMax H3 появились на Hugging Face: файлы GGUF Q2-Q5, прунингованные INT4/INT8 и NVFP4 с рабочими процессами ComfyUI.
Квантования MiniMax H3 от сообщества начали появляться на Hugging Face на следующий день после релиза открытых весов, упаковывая 33,1B омнимодальную видеомодель в размеры, которые вписываются в потребительские GPU. 3 августа вышли четыре репозитория, охватывающие форматы GGUF Q2-Q5, прунингованные INT4/INT8 и NVFP4, большинство с рабочими процессами ComfyUI в комплекте.
Сам релиз открытых весов вышел 3 августа с нативной поддержкой ComfyUI (читайте историю открытых весов). Официальная перепаковка Comfy-Org охватывает файлы bf16, INT8 и прунингованные INT8, но волна квантований от сообщества идет дальше: веса GGUF, работающие с загрузчиками GGUF в ComfyUI, файлы INT4 размером около 11-12 ГБ и варианты NVFP4 для GPU Blackwell.
Кадр из образца видео, включенного в репозиторий MiniMax-H3-GGUF от Abiray
Что вышло
| Репозиторий | Формат | Краткое описание |
|---|---|---|
| Abiray/MiniMax-H3-GGUF | GGUF | FL2VA + Ref2VA в Q3_K_M/S, Q4_0, Q4_K_M/S, Q5_0, Q5_K_M/S (15,6-23,9 ГБ); текстовые энкодеры GGUF, INT4 и NVFP4; рабочий процесс FL2V в комплекте |
| realrebelai/MiniMax-H3_GGUFs | GGUF | FL2VA + Ref2VA в Q2_K смешанной точности, Q3_K_M, Q4_K_M; текстовые энкодеры GGUF Q2_K и Q4_K_M; рабочие процессы FL2V/Ref2V |
| Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot | INT4 / INT8 / NVFP4 | Прунингованные INT4 (~11,3 ГБ), смешанные INT4/INT8 (~15,5 ГБ), INT8 (~21 ГБ), NVFP4 (12,5 ГБ) с руководством по выбору под каждую GPU |
| lilcheaty/MiniMax-H3-NVFP4 | NVFP4 | Прунингованные/полные/смешанные варианты NVFP4 для FL2VA и Ref2VA с JSON-профилями ComfyUI |
Как вписать H3 в вашу GPU
Репозитории с квантованиями группируют файлы в зависимости от вашей GPU:
| GPU | Рекомендуемые файлы |
|---|---|
| 16 ГБ VRAM (RTX 4070 Ti Super, RTX 4080) | GGUF Q3/Q4 или прунингованная INT4 / смешанная INT4-INT8 диффузионная модель + текстовый энкодер INT4 |
| 24 ГБ VRAM (RTX 3090, RTX 4090) | GGUF Q5 или прунингованная INT8 диффузионная модель + текстовый энкодер INT8 |
| Blackwell (RTX 5090, PRO 6000) | Прунингованная диффузионная модель NVFP4 + текстовый энкодер NVFP4 AWQ |
Всем по-прежнему нужны оба VAE: minimax_h3_video_vae_fp16.safetensors и minimax_h3_audio_vae_fp32.safetensors.
Пример вывода
Образец видео, включенный в репозиторий MiniMax-H3-GGUF
Рабочие процессы ComfyUI
Репозитории GGUF поставляются с готовыми рабочими процессами. В репозитории Abiray есть minimax_fl2v_gguf_workflow.json для генерации видео из текста с квантованной моделью FL2VA:
Официальные рабочие процессы bf16/INT8 от Comfy-Org смотрите в статье об открытых весах или во встроенной галерее шаблонов (video_minimax_h3_t2v, video_minimax_h3_i2v, video_minimax_h3_r2v).
Доступность
- Abiray/MiniMax-H3-GGUF — Hugging Face, GGUF Q3-Q5 для FL2VA и Ref2VA
- realrebelai/MiniMax-H3_GGUFs — Hugging Face, GGUF Q2-Q4 с рабочими процессами
- Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot — Hugging Face, прунингованные INT4/INT8/NVFP4
- lilcheaty/MiniMax-H3-NVFP4 — Hugging Face, варианты NVFP4
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.