MiniMax H3 Fused Turbo : 21 Go, Vidéo et Audio en 4 étapes

ComfyUI Wikinews

MATLOWAI intègre le turbo H3 et les LoRAs Mystic dans un seul fichier ComfyUI INT8 ConvRot : vidéo et référence vers vidéo en 4 étapes, environ 21 Go de VRAM en moins.

MiniMax-H3 Fused Turbo (INT8 ConvRot) (Hugging Face) est un fichier unique de modèle de diffusion ComfyUI de 21 Go de MATLOWAI qui réalise la conversion texte/image vers vidéo MiniMax H3 et référence vers vidéo en 4 étapes, avec un turbo distillé et un LoRA de lissage du mouvement déjà intégrés aux poids. Pas de chargeurs LoRA, pas de cycle de quantification, et environ 21 Go de VRAM en moins que la configuration équivalente avec LoRA en direct.

Exécution unique en référence sur 4 étapes : 1152x640, 243 images (10 s avec audio), 76 secondes sur une RTX PRO 6000.

Ce qui se trouve dans le fichier

Le processus de fusion commence à partir du transformateur fl2va élagué avec une SVD de rang-1024 du delta de poids (ref2va - fl2va) intégré, donc une seule partition sert à la fois au conditionnement de la première/dernière image et au conditionnement de référence. En plus de cela :

FusionnéForceSource
lightx2v FL2VA Turbo 8-step v1.01.0Kijai/MiniMax-H3_comfy, redimensionnement de rang-24 (original)
Mystic v2.0 (lissage du mouvement)0.7Civitai model 2856467

Un seul passage de quantification INT8 ConvRot s'exécute APRÈS la fusion : les quatre poids Linéaires lourds dans chacun des 50 blocs (qkv_proj, out_proj, fc1, fc2) sont INT8 avec ConvRot (groupe 256, par canal) dans la disposition native comfy_quant de ComfyUI, tout le reste reste en BF16/F32. Cet ordre compte : quantifier les poids fusionnés évite la dérive de base quantifiée avec des deltas FLOTTANTS, et les tests avec même graine ont mesuré la fusion identique au chemin LoRA en direct.

Pourquoi fusionner au lieu d'empiler des LoRAs

Les deux fichiers LoRA font au total environ 540 Mo, donc les adaptateurs ne sont pas le problème. Un LoRA est un delta de faible rang que ComfyUI ajoute au chargement ; pour rester supprimable, il conserve une copie intacte de chaque poids qu'il touche. Corriger tous les 200 calques principaux d'un modèle INT8 et cette sauvegarde devient un deuxième modèle complet en mémoire. Mesuré deux fois à 8 étapes sur la même graine :

ConfigurationVRAM MaxRésidentTemps écoulé
Intégré (ce fichier)47,8 Go42 Go103 s
LoRAs en direct68,9 Go64 Go103 s

Même prise, même temps écoulé, compteurs audio identiques dans le bruit. La fusion supprime simplement deux chargeurs, un cycle de quantification et la sauvegarde de correctif de ~21 Go. Si vous avez besoin de forces LoRA ajustables, le README documente le chemin équivalent en direct avec des fichiers publics.

Étapes : indique 8, exécutez-le à 4

Le turbo fusionné est le LoRA 8 étapes de lightx2v, mais c'est un modèle 4 ou 8 NFE. L'échelle mesurée sur une RTX PRO 6000 (96 Go), 1152x640, 243 images, attention sparse SLA :

PipelineÉtapesTemps
Référence, passe unique476 s
Référence, passe unique680 s
Référence, passe unique8103 s
Référence, passe unique25292 s
Dé-torsion (4 + 4)4 + 4~374 s

La même prise à 25 étapes : dessin un peu plus net, 292 secondes au lieu de 76, bande sonore inchangée.

La dé-torsion est la raison pour exécuter 4 étapes : le passage 2 consomme uniquement des étapes sur les images que l'oracle de jerk a signalées, donc 4 + 4 ensemble coûtent environ autant qu'un passage de 25 étapes tandis que les régions conservées ressortent plus propres. Deux résultats de recette comptent : res_multistep bat euler pour la qualité audio à 4 étapes (les graphiques d'exemple de lightx2v disent euler), et l'attention sparse bloc SLA à 0,90 de sparsité est audible, restaurant les détails de bande son haute fréquence que l'attention dense aplatit tout en exécutant environ 40 % plus vite.

Flux de travail

Le dépôt livre cinq graphiques ComfyUI (format UI et API), chacun avec une Boîte PROMPT alimentant chaque étape. Requiert ComfyUI-MAINodes et un Pack de Nœuds d'attention sparse SLA :

Commencer

  1. Télécharger minimax_h3_fused_refdelta_r1024_turbo8_mystic07_int8_convrot.safetensors (21 Go) dans ComfyUI/models/diffusion_models/ et le charger avec un UNETLoader standard, weight_dtype default. Aucun chargeur de quantification Personnalisé n'est nécessaire.
  2. Télécharger les fichiers compagnons depuis Comfy-Org/MiniMax-H3 : minimax_h3_video_vae_int8_convrot.safetensors, minimax_h3_audio_vae_fp32.safetensors (VAE) et qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors (encodeur de texte).
  3. Installer ComfyUI-MAINodes et un Pack de Nœuds d'attention sparse SLA, puis glisser un flux de travail ci-dessus.

Les cartes plus petites fonctionnent aussi : la gestion des modèles de ComfyUI charge et décharge le transformateur, l'encodeur de texte et les VAE selon les besoins, donc les mêmes graphiques fonctionnent, juste plus lentement. Sur AMD/ROCm, la recette a été développée sur un boîtier AMD avec la fourche ComfyUI ROCm de patientx, qui porte également une version ROCm du nœud d'attention SLA.

Liens

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 Fused Turbo : 21 Go, Vidéo et Audio en 4 étapes | ComfyUI Wiki