Квантования MiniMax H3: GGUF, INT4 и NVFP4 для потребительских GPU

ComfyUI Wikinews

Квантования MiniMax H3 появились на Hugging Face: файлы GGUF Q2-Q5, прунингованные INT4/INT8 и NVFP4 с рабочими процессами ComfyUI.

Квантования MiniMax H3 от сообщества начали появляться на Hugging Face на следующий день после релиза открытых весов, упаковывая 33,1B омнимодальную видеомодель в размеры, которые вписываются в потребительские GPU. 3 августа вышли четыре репозитория, охватывающие форматы GGUF Q2-Q5, прунингованные INT4/INT8 и NVFP4, большинство с рабочими процессами ComfyUI в комплекте.

Сам релиз открытых весов вышел 3 августа с нативной поддержкой ComfyUI (читайте историю открытых весов). Официальная перепаковка Comfy-Org охватывает файлы bf16, INT8 и прунингованные INT8, но волна квантований от сообщества идет дальше: веса GGUF, работающие с загрузчиками GGUF в ComfyUI, файлы INT4 размером около 11-12 ГБ и варианты NVFP4 для GPU Blackwell.

Демонстрационный кадр из образца видео в репозитории GGUF MiniMax H3

Кадр из образца видео, включенного в репозиторий MiniMax-H3-GGUF от Abiray

Что вышло

РепозиторийФорматКраткое описание
Abiray/MiniMax-H3-GGUFGGUFFL2VA + Ref2VA в Q3_K_M/S, Q4_0, Q4_K_M/S, Q5_0, Q5_K_M/S (15,6-23,9 ГБ); текстовые энкодеры GGUF, INT4 и NVFP4; рабочий процесс FL2V в комплекте
realrebelai/MiniMax-H3_GGUFsGGUFFL2VA + Ref2VA в Q2_K смешанной точности, Q3_K_M, Q4_K_M; текстовые энкодеры GGUF Q2_K и Q4_K_M; рабочие процессы FL2V/Ref2V
Abiray/Minimax-H3-nvfp4-INT4-INT8-ConvrotINT4 / INT8 / NVFP4Прунингованные INT4 (~11,3 ГБ), смешанные INT4/INT8 (~15,5 ГБ), INT8 (~21 ГБ), NVFP4 (12,5 ГБ) с руководством по выбору под каждую GPU
lilcheaty/MiniMax-H3-NVFP4NVFP4Прунингованные/полные/смешанные варианты NVFP4 для FL2VA и Ref2VA с JSON-профилями ComfyUI

Как вписать H3 в вашу GPU

Репозитории с квантованиями группируют файлы в зависимости от вашей GPU:

GPUРекомендуемые файлы
16 ГБ VRAM (RTX 4070 Ti Super, RTX 4080)GGUF Q3/Q4 или прунингованная INT4 / смешанная INT4-INT8 диффузионная модель + текстовый энкодер INT4
24 ГБ VRAM (RTX 3090, RTX 4090)GGUF Q5 или прунингованная INT8 диффузионная модель + текстовый энкодер INT8
Blackwell (RTX 5090, PRO 6000)Прунингованная диффузионная модель NVFP4 + текстовый энкодер NVFP4 AWQ

Всем по-прежнему нужны оба VAE: minimax_h3_video_vae_fp16.safetensors и minimax_h3_audio_vae_fp32.safetensors.

Пример вывода

Образец видео, включенный в репозиторий MiniMax-H3-GGUF

Рабочие процессы ComfyUI

Репозитории GGUF поставляются с готовыми рабочими процессами. В репозитории Abiray есть minimax_fl2v_gguf_workflow.json для генерации видео из текста с квантованной моделью FL2VA:

Официальные рабочие процессы bf16/INT8 от Comfy-Org смотрите в статье об открытых весах или во встроенной галерее шаблонов (video_minimax_h3_t2v, video_minimax_h3_i2v, video_minimax_h3_r2v).

Доступность

  • Abiray/MiniMax-H3-GGUFHugging Face, GGUF Q3-Q5 для FL2VA и Ref2VA
  • realrebelai/MiniMax-H3_GGUFsHugging Face, GGUF Q2-Q4 с рабочими процессами
  • Abiray/Minimax-H3-nvfp4-INT4-INT8-ConvrotHugging Face, прунингованные INT4/INT8/NVFP4
  • lilcheaty/MiniMax-H3-NVFP4Hugging Face, варианты NVFP4

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Квантования MiniMax H3: GGUF, INT4 и NVFP4 для потребительских GPU | ComfyUI Wiki