Descarga MiniMax H3 w4a8: pesos FL2VA 4 bits de Kijai para ComfyUI

ComfyUI Wikinews

Descarga pesos experimentales w4a8 de MiniMax H3 de Kijai para ComfyUI: minimax_h3_fl2va_pruned_w4a8_mixed.safetensors (FL2VA de 12,5 GB), variante Ref2VA y VAE int8 convrot.

Kijai publicó pesos experimentales MiniMax H3 cuantizados en w4a8 en Hugging Face, junto con un VAE convrot int8. El diseño asimétrico de 4 bits almacena los pesos a unos 0.56 bytes por elemento y los procesa mediante GEMM int8, reduciendo el checkpoint FL2VA podado a 12.5 GB (Repositorio).

El formato está respaldado por el trabajo en el núcleo de ComfyUI: Comfy-Org/ComfyUI #15308 "Support asym w4a8_int" fusionado el 7 de agosto, y el soporte del VAE convrot int8 en Comfy-Org/ComfyUI #15334 fusionado el 6 de agosto.

Esta es una versión en desarrollo destinada únicamente a pruebas. Trata las cifras de calidad y velocidad como datos preliminares, no como resultados finales.

Archivos

ArchivoTamañoRol
minimax_h3_fl2va_pruned_w4a8_mixed.safetensors12.5 GBModelo de difusión FL2VA podado (texto a vídeo, primer/último fotograma)
minimax_h3_ref2va_pruned_w4a8_mixed.safetensors11.8 GBModelo de difusión Ref2VA podado (condicionado por referencia)
minimax_h3_video_vae_int8_convrot.safetensors3.2 GBVAE de vídeo convrot int8, aproximadamente 1.5x más rápido que el VAE fp16

Cómo funciona el diseño w4a8

El diseño proviene de comfy-kitchen PR #90 ("Add optimized w4a8 with int8 codebook"), un esquema de almacenamiento de pesos de 4 bits sin calibración que se ejecuta sobre GEMM int8 con activaciones ConvRot:

  • Pesos int4 rotados con ConvRot más un codebook Lloyd-Max por tensor y escalas de grupo fp8
  • Descuantizados a int8 agrupado y alimentados a un GEMM int8 CUTLASS
  • Error relL2 de peso de ~0.073 en pesos DiT reales (NVFP4 mide ~0.094)
  • ~0.56 bytes por elemento, ~1.09x más rápido que int8, sin necesidad de pase de calibración
  • Backends: CUDA (descuantización fusionada int4 a int8 por bloques + GEMM INT8 con zancada) además de rutas eager Triton y torch puro para AMD/CPU
Fotograma de demostración de la prueba w4a8 de Kijai en una RTX 5090

Un fotograma del resultado w4a8 de ejemplo de Kijai en una RTX 5090 (compartido en comfy-kitchen PR #90)

Cómo usarlo en ComfyUI

Ejecuta el modelo de difusión w4a8 con las Plantillas de flujo de trabajo oficiales de H3 (video_minimax_h3_t2v y otras), intercambiando el cargador de modelo por el checkpoint w4a8 y el cargador de VAE por minimax_h3_video_vae_int8_convrot.safetensors. El VAE convrot int8 requiere el soporte fusionado en el núcleo de ComfyUI del PR #15334.

Disponibilidad

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Descarga MiniMax H3 w4a8: pesos FL2VA 4 bits de Kijai para ComfyUI | ComfyUI Wiki