MiniMax H3 w4a8: pesos 4-bit experimentales de Kijai para ComfyUI

ComfyUI Wikinews

Kijai publica pesos experimentales MiniMax H3 cuantizados en w4a8 (FL2VA de 12.5 GB) con un VAE convrot int8. El soporte en el núcleo de ComfyUI se fusionó en el PR #15308.

Kijai publicó pesos experimentales MiniMax H3 cuantizados en w4a8 en Hugging Face, junto con un VAE convrot int8. El diseño asimétrico de 4 bits almacena los pesos a unos 0.56 bytes por elemento y los procesa mediante GEMM int8, reduciendo el checkpoint FL2VA podado a 12.5 GB (Repositorio).

El formato está respaldado por el trabajo en el núcleo de ComfyUI: Comfy-Org/ComfyUI #15308 "Support asym w4a8_int" fusionado el 7 de agosto, y el soporte del VAE convrot int8 en Comfy-Org/ComfyUI #15334 fusionado el 6 de agosto.

Esta es una versión en desarrollo destinada únicamente a pruebas. Trata las cifras de calidad y velocidad como datos preliminares, no como resultados finales.

Archivos

ArchivoTamañoRol
minimax_h3_fl2va_pruned_w4a8_mixed.safetensors12.5 GBModelo de difusión FL2VA podado (texto a vídeo, primer/último fotograma)
minimax_h3_ref2va_pruned_w4a8_mixed.safetensors11.8 GBModelo de difusión Ref2VA podado (condicionado por referencia)
minimax_h3_video_vae_int8_convrot.safetensors3.2 GBVAE de vídeo convrot int8, aproximadamente 1.5x más rápido que el VAE fp16

Cómo funciona el diseño w4a8

El diseño proviene de comfy-kitchen PR #90 ("Add optimized w4a8 with int8 codebook"), un esquema de almacenamiento de pesos de 4 bits sin calibración que se ejecuta sobre GEMM int8 con activaciones ConvRot:

  • Pesos int4 rotados con ConvRot más un codebook Lloyd-Max por tensor y escalas de grupo fp8
  • Descuantizados a int8 agrupado y alimentados a un GEMM int8 CUTLASS
  • Error relL2 de peso de ~0.073 en pesos DiT reales (NVFP4 mide ~0.094)
  • ~0.56 bytes por elemento, ~1.09x más rápido que int8, sin necesidad de pase de calibración
  • Backends: CUDA (descuantización fusionada int4 a int8 por bloques + GEMM INT8 con zancada) además de rutas eager Triton y torch puro para AMD/CPU
Fotograma de demostración de la prueba w4a8 de Kijai en una RTX 5090

Un fotograma del resultado w4a8 de ejemplo de Kijai en una RTX 5090 (compartido en comfy-kitchen PR #90)

Cómo usarlo en ComfyUI

Ejecuta el modelo de difusión w4a8 con las Plantillas de flujo de trabajo oficiales de H3 (video_minimax_h3_t2v y otras), intercambiando el cargador de modelo por el checkpoint w4a8 y el cargador de VAE por minimax_h3_video_vae_int8_convrot.safetensors. El VAE convrot int8 requiere el soporte fusionado en el núcleo de ComfyUI del PR #15334.

Disponibilidad

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 w4a8: pesos 4-bit experimentales de Kijai para ComfyUI | ComfyUI Wiki