Descarga MiniMax H3 w4a8: pesos FL2VA 4 bits de Kijai para ComfyUI
Descarga pesos experimentales w4a8 de MiniMax H3 de Kijai para ComfyUI: minimax_h3_fl2va_pruned_w4a8_mixed.safetensors (FL2VA de 12,5 GB), variante Ref2VA y VAE int8 convrot.
Kijai publicó pesos experimentales MiniMax H3 cuantizados en w4a8 en Hugging Face, junto con un VAE convrot int8. El diseño asimétrico de 4 bits almacena los pesos a unos 0.56 bytes por elemento y los procesa mediante GEMM int8, reduciendo el checkpoint FL2VA podado a 12.5 GB (Repositorio).
El formato está respaldado por el trabajo en el núcleo de ComfyUI: Comfy-Org/ComfyUI #15308 "Support asym w4a8_int" fusionado el 7 de agosto, y el soporte del VAE convrot int8 en Comfy-Org/ComfyUI #15334 fusionado el 6 de agosto.
Esta es una versión en desarrollo destinada únicamente a pruebas. Trata las cifras de calidad y velocidad como datos preliminares, no como resultados finales.
Archivos
| Archivo | Tamaño | Rol |
|---|---|---|
minimax_h3_fl2va_pruned_w4a8_mixed.safetensors | 12.5 GB | Modelo de difusión FL2VA podado (texto a vídeo, primer/último fotograma) |
minimax_h3_ref2va_pruned_w4a8_mixed.safetensors | 11.8 GB | Modelo de difusión Ref2VA podado (condicionado por referencia) |
minimax_h3_video_vae_int8_convrot.safetensors | 3.2 GB | VAE de vídeo convrot int8, aproximadamente 1.5x más rápido que el VAE fp16 |
Cómo funciona el diseño w4a8
El diseño proviene de comfy-kitchen PR #90 ("Add optimized w4a8 with int8 codebook"), un esquema de almacenamiento de pesos de 4 bits sin calibración que se ejecuta sobre GEMM int8 con activaciones ConvRot:
- Pesos int4 rotados con ConvRot más un codebook Lloyd-Max por tensor y escalas de grupo fp8
- Descuantizados a int8 agrupado y alimentados a un GEMM int8 CUTLASS
- Error relL2 de peso de ~0.073 en pesos DiT reales (NVFP4 mide ~0.094)
- ~0.56 bytes por elemento, ~1.09x más rápido que int8, sin necesidad de pase de calibración
- Backends: CUDA (descuantización fusionada int4 a int8 por bloques + GEMM INT8 con zancada) además de rutas eager Triton y torch puro para AMD/CPU
Un fotograma del resultado w4a8 de ejemplo de Kijai en una RTX 5090 (compartido en comfy-kitchen PR #90)
Cómo usarlo en ComfyUI
Ejecuta el modelo de difusión w4a8 con las Plantillas de flujo de trabajo oficiales de H3 (video_minimax_h3_t2v y otras), intercambiando el cargador de modelo por el checkpoint w4a8 y el cargador de VAE por minimax_h3_video_vae_int8_convrot.safetensors. El VAE convrot int8 requiere el soporte fusionado en el núcleo de ComfyUI del PR #15334.
Disponibilidad
- Pesos: Kijai/MiniMax-H3-experimental en Hugging Face
- Soporte en el núcleo: ComfyUI #15308 (w4a8) y ComfyUI #15334 (VAE convrot int8)
- Backend de cuantización: comfy-kitchen #90
Comentarios
Inicia sesión con GitHub para unirte a la conversación.