PDMD : distillation MiniMax H3 en 4 étapes pour ComfyUI

ComfyUI Wikinews

L'UC San Diego et ByteDance publient PDMD, une modification d'une ligne à DMD qui distille MiniMax H3 en quatre étapes, avec une conversion ComfyUI de Kijai.

PDMD est une méthode de distillation de l'UC San Diego et de ByteDance qui ajoute une ligne de projection à DMD. Sa première publication est une famille d'élèves MiniMax H3 : un LoRA en 2 étapes, un LoRA en 4 étapes et un transformer complet en 4 étapes, tous distillés à partir de l'enseignant MiniMax H3 en 50 étapes. L'article (arXiv 2609.35768) et les poids ont été publiés fin septembre 2026.
Cible de mise à jour DMDCible de mise à jour PDMD
Cible DMDCible PDMD

Les deux panneaux décodent une véritable cible de mise à jour d'entraînement issue de la même étape de l'exécution MiniMax H3. La page du projet présente la cible PDMD comme portant moins d'artefacts, ce que la projection est censée produire.

Ce que PDMD change

DMD entraîne un élève sur la différence entre le score du critique et le score de l'élève lui-même. Cette mise à jour porte aussi l'erreur du critique, et cette erreur entre dans chaque mise à jour successive de l'élève et s'accumule, ce qui se manifeste par une sursaturation progressive et des textures peu naturelles. PDMD conserve la mise à jour DMD et en soustrait la partie qui pointe le long du résidu d'endpoint de l'élève et du critique :

r = x0_critic - x0_student
d = d - (d * r).sum() / r.pow(2).sum() * r

L'article montre qu'à une requête bruitée fixe, ce résidu est une estimation non biaisée de l'erreur d'endpoint du critique, et que, sous des hypothèses de haute dimension, la projection supprime une fraction constante de l'erreur du critique tout en ne rejetant qu'une fraction négligeable du signal DMD idéal. C'est une modification d'une ligne à DMD, sans perte auxiliaire, sans réseau supplémentaire, sans passe de modèle supplémentaire et sans étape d'entraînement supplémentaire.

La figure d'intuition de PDMD

La figure d'intuition de la page du projet. DMD déplace l'endpoint de l'élève le long de la direction de mise à jour ; PDMD projette hors de celle-ci la composante parallèle au résidu d'endpoint.

Ce qui a été publié

La publication constitue le volet MiniMax H3 de la méthode, sous la forme de trois artefacts :

ArtefactDescription
pdmd_2NFE_loraLoRA en 2 étapes, publié le 2026-09-23
pdmd_4NFE_fulltransformer complet bf16 en 4 étapes (MiniMaxH3Transformer3DModel), publié le 2026-09-27
pdmd_4NFE_loraLoRA en 4 étapes, publié le 2026-09-29

Les adaptateurs portent un rang 128 et alpha 128 sur 312 modules, 624 tenseurs, du transformer H3, dans la disposition de clés Diffusers (transformer.<module>.lora_A.weight / transformer.<module>.lora_B.weight). Tout le reste, le VAE, le VAE audio, les planificateurs, l'encodeur de texte et le processeur, provient du modèle de base, et les métadonnées safetensors enregistrent la règle de fusion W_base += lora_scale * (lora_B @ lora_A) avec lora_scale = 1.0. La carte demande quatre étapes de débruitage avec la configuration de planificateur publiée du modèle de base (shift 12 / 3). Le référentiel 2 étapes fournit également une copie fp32 de son adaptateur.

Résultats

L'article rapporte la méthode sur MiniMax H3 et Wan2.1. Sur MiniMax H3, il utilise VideoGen-Eval avec 387 prompts en 544p et une graine fixe :

| Méthode | NFE | Total | Qualité | Dynamique | Sémantique | PQ | CE | CU | IS | |--|--:|--:|--:|--:|--:|--:|--:|--:| | MiniMax-H3-33B, enseignant | 50 | 82.41 | 82.22 | 66.67 | 83.20 | 6.567 | 4.188 | 6.213 | 5.15 | | MiniMax-H3-33B | 4 | 79.48 | 79.54 | 44.44 | 79.23 | 6.056 | 3.167 | 5.580 | 3.35 | | H3 Turbo LoRA | 4 | 81.57 | 81.29 | 54.78 | 82.69 | 6.406 | 3.917 | 6.015 | 4.52 | | DMD2† | 4 | 82.27 | 82.51 | 59.95 | 81.34 | 6.305 | 3.434 | 5.871 | 4.06 | | DMD† | 4 | 82.76 | 82.68 | 61.76 | 83.05 | 6.381 | 3.801 | 5.931 | 4.79 | | rCM† | 4 | 81.18 | 80.98 | 58.40 | 81.95 | 6.063 | 3.711 | 5.446 | 3.69 | | AnyFlow† | 4 | 81.97 | 81.82 | 64.60 | 82.60 | 6.092 | 3.544 | 5.591 | 4.35 | | PDMD | 4 | 83.17 | 83.25 | 71.83 | 82.86 | 6.530 | 4.062 | 6.180 | 4.98 |

† indique les réimplémentations des auteurs, entraînées selon un protocole partagé.

Sur Wan2.1-T2V-1.3B, il utilise VBench avec 944 prompts en 480p et cinq graines chacun :

MéthodeNFETotalQualitéDynamiqueSémantique
Wan2.1-T2V-1.3B, enseignant50x283.0685.0268.6175.23
Wan2.1-T2V-1.3B4x268.5473.6018.6148.30
rCM483.1385.1478.0675.10
AnyFlow483.5485.2859.4476.57
DMD†482.7085.0686.3973.24
DMD2†483.4485.8476.6773.84
PDMD483.7385.8989.7275.09

Le résumé indique que, sur la génération conjointe vidéo et audio de MiniMax H3, l'élève PDMD en 4 étapes obtient 83,17 au total visuel de VideoGen-Eval, soit 0,41 point au-dessus de la meilleure baseline distillée, et décroche le meilleur résultat sur les six métriques audio parmi les modèles en quatre étapes comparés. Sur Wan2.1, il rapporte un total VBench de 83,73 en quatre étapes, soit 1,03 point au-dessus de l'exécution DMD équivalente. La page du projet ajoute des comparaisons qualitatives et une étude utilisateur qui placent PDMD devant les baselines distillées en matière de qualité visuelle, de mouvement et de qualité audio.

L'exécuter dans ComfyUI

La publication officielle cible Diffusers, pas les nœuds : inference.py et run_a10.py échantillonnent avec la règle de re-bruitage sous laquelle les élèves ont été entraînés, et aucun JSON de flux de travail n'accompagne la publication.

Pour ComfyUI, les adaptateurs sont des LoRA ordinaires une fois convertis. Kijai a publié des conversions à rang réduit sur Kijai/MiniMax-H3-experimental : minimax_h3_pdmd_2step_lora_avg_rank_38_bf16.safetensors et minimax_h3_pdmd_4step_lora_avg_rank_57_bf16.safetensors. Ils se chargent via le chemin LoRA standard de MiniMax H3, sans nœud personnalisé, avec la réserve habituelle que la réduction de rang et les paramètres d'échantillonnage ne sont pas ceux évalués dans l'article. Une conversion communautaire, Iwannapose/minimax_h3_pdmd_4nfe_comfyui, circule également.

La bande-annonce officielle de PDMD. Chaque image de la page du projet s'exécute en quatre évaluations de réseau ou moins.

Deux clips issus de la grille de comparaison MiniMax H3 de la page du projet, avec prompt et graine identiques, quatre étapes chacun :

DMD en 4 étapes.

PDMD en 4 étapes, même prompt et même graine que le clip ci-dessus.

Limites

  • Les élèves MiniMax H3 publiés ciblent le 1344x768 avec l'encodeur de texte et les composants audio du modèle de base ; la publication est donc un résultat de vitesse d'échantillonnage plutôt qu'un modèle plus petit.
  • Les conversions ComfyUI réduisent les adaptateurs de rang 128 à un rang moyen de 38 ou 57 ; ce ne sont donc pas les fichiers exacts évalués dans l'article.
  • Sans nœuds officiels ni JSON de flux de travail, la prise en charge de ComfyUI dépend des conversions communautaires et de leur disposition de clés. La publication elle-même privilégie Diffusers.
  • Plusieurs baselines marquées d'une dague dans les tableaux ci-dessus sont les propres réimplémentations des auteurs, entraînées selon un protocole partagé, et non les chiffres publiés par ces projets.

Disponibilité

Page du projet : pdmd2026.github.io
Article : arXiv 2609.35768
Code : ZeamoxWang/pdmd
Poids : pdmd2026
Conversion ComfyUI : Kijai/MiniMax-H3-experimental
Modèle de base : MiniMaxAI/MiniMax-H3

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
PDMD : distillation MiniMax H3 en 4 étapes pour ComfyUI | ComfyUI Wiki