MiniMax H3 w4a8: 4-битные веса Kijai для ComfyUI
Kijai публикует экспериментальные w4a8-квантованные веса MiniMax H3 (12,5 ГБ FL2VA) в паре с int8 convrot VAE. Поддержка ядра ComfyUI объединена в PR #15308.
Kijai опубликовал экспериментальные w4a8-квантованные веса MiniMax H3 на Hugging Face в паре с int8 convrot VAE. Асимметричный 4-битный формат хранит веса примерно по 0,56 байта на элемент и прогоняет их через int8 GEMM, сокращая обрезанный checkpoint FL2VA до 12,5 ГБ (репозиторий).
Формат поддерживается на уровне ядра ComfyUI: Comfy-Org/ComfyUI #15308 «Support asym w4a8_int» объединён 7 августа, а поддержка int8 convrot VAE в Comfy-Org/ComfyUI #15334 объединена 6 августа.
Это предварительный релиз, предназначенный только для тестирования. Относитесь к показателям качества и скорости как к ранним данным, а не к окончательным результатам.
Файлы
| Файл | Размер | Роль |
|---|---|---|
minimax_h3_fl2va_pruned_w4a8_mixed.safetensors | 12,5 ГБ | Обрезанная диффузионная модель FL2VA (text-to-video, первый/последний кадр) |
minimax_h3_ref2va_pruned_w4a8_mixed.safetensors | 11,8 ГБ | Обрезанная диффузионная модель Ref2VA (с кондиционированием по референсу) |
minimax_h3_video_vae_int8_convrot.safetensors | 3,2 ГБ | int8 convrot видео-VAE, примерно в 1,5 раза быстрее fp16 VAE |
Как устроен формат w4a8
Формат происходит из comfy-kitchen PR #90 («Add optimized w4a8 with int8 codebook»), схемы хранения 4-битных весов без калибровки, которая работает на int8 GEMM с активациями ConvRot:
- Повёрнутые ConvRot int4-веса плюс потензорный кодбук Ллойда-Макса и fp8-масштабы групп
- Деквантуются в сгруппированный int8 и подаются в int8 CUTLASS GEMM
- Относительная L2-ошибка весов ~0,073 на реальных весах DiT (NVFP4 показывает ~0,094)
- ~0,56 байта на элемент, ~в 1,09 раза быстрее int8, калибровка не требуется
- Бэкенды: CUDA (блочный объединённый деквант int4→int8 + страйдированный INT8 GEMM), а также пути на Triton и чистом torch (eager) для AMD/CPU
Кадр из примера результата w4a8 от Kijai на RTX 5090 (опубликован в comfy-kitchen PR #90)
Использование в ComfyUI
Запустите w4a8-диффузионную модель с официальными шаблонами рабочих процессов H3 (video_minimax_h3_t2v и другими), заменив загрузчик модели на checkpoint w4a8, а загрузчик VAE на minimax_h3_video_vae_int8_convrot.safetensors. Для int8 convrot VAE требуется объединённая поддержка ядра ComfyUI из PR #15334.
Доступность
- Веса: Kijai/MiniMax-H3-experimental на Hugging Face
- Поддержка ядра: ComfyUI #15308 (w4a8) и ComfyUI #15334 (int8 convrot VAE)
- Бэкенд квантования: comfy-kitchen #90
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.