MiniMax H3 w4a8 : poids 4 bits expérimentaux de Kijai pour ComfyUI
Kijai publie des poids expérimentaux MiniMax H3 quantifiés w4a8 (FL2VA de 12,5 Go) avec un VAE int8 convrot. Le support du noyau ComfyUI a été fusionné dans la PR #15308.
Kijai a publié des poids expérimentaux MiniMax H3 quantifiés w4a8 sur Hugging Face, accompagnés d'un VAE int8 convrot. Le format asymétrique 4 bits stocke les poids à environ 0,56 octet par élément et les exécute via un GEMM int8, réduisant le checkpoint FL2VA élagué à 12,5 Go (Référentiel).
Le format s'appuie sur le travail du noyau ComfyUI : Comfy-Org/ComfyUI #15308 « Support asym w4a8_int » fusionné le 7 août, et le support du VAE int8 convrot dans Comfy-Org/ComfyUI #15334 fusionné le 6 août.
Ceci est une version en cours de développement réservée aux tests. Considérez les chiffres de qualité et de vitesse comme des points de données préliminaires, et non comme des résultats finaux.
Fichiers
| Fichier | Taille | Rôle |
|---|---|---|
minimax_h3_fl2va_pruned_w4a8_mixed.safetensors | 12,5 Go | Modèle de diffusion FL2VA élagué (texte-vers-vidéo, première/dernière image) |
minimax_h3_ref2va_pruned_w4a8_mixed.safetensors | 11,8 Go | Modèle de diffusion Ref2VA élagué (conditionné par référence) |
minimax_h3_video_vae_int8_convrot.safetensors | 3,2 Go | VAE vidéo int8 convrot, environ 1,5x plus rapide que le VAE fp16 |
Comment fonctionne le format w4a8
Le format provient de la PR #90 de comfy-kitchen (« Add optimized w4a8 with int8 codebook »), un schéma de stockage des poids 4 bits sans calibration qui s'exécute sur un GEMM int8 avec des activations ConvRot :
- Poids int4 pivotés par ConvRot, plus un codebook Lloyd-Max par tensor et des échelles de groupe fp8
- Déquantifiés en int8 groupé et injectés dans un GEMM int8 CUTLASS
- Erreur relL2 des poids d'environ 0,073 sur de vrais poids DiT (NVFP4 mesure ~0,094)
- ~0,56 octet par élément, ~1,09x plus rapide que l'int8, aucune passe de calibration requise
- Backends : CUDA (déquantification fusionnée par blocs int4 vers int8 + GEMM INT8 stridé) plus des chemins Triton et eager pure-torch pour AMD/CPU
Une image du résultat w4a8 d'exemple de Kijai sur une RTX 5090 (partagée dans la PR #90 de comfy-kitchen)
Utilisation dans ComfyUI
Exécutez le modèle de diffusion w4a8 avec les modèles de flux de travail H3 officiels (video_minimax_h3_t2v et autres), en faisant pointer le chargeur de modèle vers le checkpoint w4a8 et le chargeur de VAE vers minimax_h3_video_vae_int8_convrot.safetensors. Le VAE int8 convrot nécessite le support du noyau ComfyUI fusionné de la PR #15334.
Disponibilité
- Poids : Kijai/MiniMax-H3-experimental sur Hugging Face
- Support du noyau : ComfyUI #15308 (w4a8) et ComfyUI #15334 (VAE int8 convrot)
- Backend de quantification : comfy-kitchen #90
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.