MiniMax H3 Acc LoRA : distillation PDD officielle en 8 étapes
Alibaba PAI propose des LoRAs d'accélération PDD pour MiniMax H3 : génération audio-Vidéo complète en 8 ou 4 étapes d'échantillonneur sans CFG, plus un Pack de Nœuds natif ComfyUI.
Ce que c'est
Les deux fichiers -Acc-8Step ne sont pas des LoRAs ordinaires. Avec un LoRA tronc de rang 64 (network_alpha = 64, BF16), chaque point de contrôle transporte une banque de têtes de distillation par décodage parallèle : 32 copies par intervalle des projections vidéo et audio de la couche finale qui sont fusionnées en une seule tête de vitesse Moyenne-Bloc à chaque étape d'échantillonneur. Un chargeur LoRA standard ne peut pas lire ces fichiers, et supprimer la banque de têtes perd silencieusement la distillation.
- 8 étapes, pas de CFG — la génération fonctionne à
guidance_scale = 1.0avec un seul passage avant par étape ; la guidance est distillée dans l'adaptateur. - Audio + Vidéo en un seul passage — la distillation couvre le flux audio conjoint, pas seulement les images visuelles.
- Deux troncs — un adaptateur cible le point de contrôle FL2VA (conditionné par texte/première-dernière image), l'autre le point de contrôle Ref2VA (conditionné par référence).
- Publication officielle — publié par Alibaba PAI le 26 août 2026, suivant la méthode PDD de Shaul et al. (arXiv 2607.26004).
Poids
| Fichier | Taille | Base cible | Lien |
|---|---|---|---|
MiniMax-H3-FL2VA-Acc-8Step.safetensors | 1,4 Go | MiniMax-H3 (FL2VA) | HF |
MiniMax-H3-Ref2VA-Acc-8Step.safetensors | 1,4 Go | MiniMax-H3 (Ref2VA) | HF |
Chaque fichier pèse 1,4 Go en BF16, rang 64, et est appliqué avec une force de 1,0 sur le transformateur H3 de base. Associez l'adaptateur FL2VA à un UNET FL2VA et l'adaptateur Ref2VA à un UNET Ref2VA (les originaux bf16 ou les versions int8 convrot fonctionnent toutes deux).
Résultats
Échantillons officiels de démo Générés avec l'adaptateur Acc-8Step à un poids LoRA de 1,0 :
FL2VA
Vidéo à partir de texte avec l'adaptateur FL2VA Acc-8Step
Ref2VA
Vidéo à partir de référence avec l'adaptateur Ref2VA Acc-8Step
La carte du modèle inclut également des comparaisons côte à côte contre la référence non distillée et les LoRAs communautaires Minimax-h3-Turbo en 4 étapes pour les deux troncs.
Support ComfyUI
ComfyUI-MiniMax-H3-PDD-Acc par Jalen-Brunson ajoute des Nœuds ComfyUI natifs pour la publication. Le nœud MiniMaxH3PDDAccApply applique le LoRA tronc et installe la banque de têtes PDD sur la couche finale, armé étape par étape par sigma, afin que les boucles et les échantillonneurs par chunks restent synchronisés. Le nœud scheduler compagnon émet la grille sigma entraînée pour les flux de travail de débruitage partiel.
La recette entraînée est stricte :
- Échantillonneur — Euler ; chaque étape consomme une vitesse de bloc Moyenne, donc les échantillonneurs multi-étapes évaluent hors grille.
- Étapes — 8 (par défaut, taille de bloc entraînée), 4 (regroupement officiellement sanctionné), ou 6 (partition non uniforme
8,8,4,4,4,4). D'autres nombres d'étapes sont rejetés par le nœud au lieu de se dégrader silencieusement. - Guidance — CFG 1,0 avec
BasicGuider. - Décalage Sigma — exactement 12,0 / 3,0.
- Points de contrôle élagués — sur les UNET H3 élagués (tableau de COURBE), les 50 modules LoRA dense-adaLN sont automatiquement rebasés sur la base de COURBE du modèle.
Supprimez les autres LoRAs de distillation (lightx2v turbo, etc.) lors de l'utilisation de ces adaptateurs : les distillations ne s'empilent pas. Les LoRAs de personnages s'empilent normalement.
Deux formats sont pris en charge : les fichiers Alibaba originaux (convertis en mémoire par le nœud) ou la redistribution préconvertie ComfyUI-key par aptech0081/MiniMax-H3-Acc-LoRAs-ComfyUI (1,7 Go par fichier).
Disponibilité
En dehors de ComfyUI, les adaptateurs s'exécutent via le pipeline d'inférence VideoX-Fun. Définissez model_path et pdd_lora_path dans les scripts d'exemple predict_t2v.py (FL2VA) ou predict_ref2v.py (Ref2VA) de VideoX-Fun, qui utilisent le ModularPipeline MiniMax-H3 de Diffusers et nécessitent diffusers >= 0.40.0. Chaque exemple charge le point de contrôle avec apply_pdd_lora et déduit le nombre requis d'étapes d'inférence de sa configuration.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.