PDMD: destilación de MiniMax H3 en 4 pasos para ComfyUI

ComfyUI Wikinews

UC San Diego y ByteDance publican PDMD, un cambio de una línea en DMD que destila MiniMax H3 a cuatro pasos, con una conversión de Kijai para ComfyUI.

PDMD es un método de destilación de UC San Diego y ByteDance que añade una línea de proyección a DMD. Su primera publicación es una familia de estudiantes de MiniMax H3: una LoRA de 2 pasos, una LoRA de 4 pasos y un transformer completo de 4 pasos, todos destilados del maestro MiniMax H3 de 50 pasos. El artículo (arXiv 2609.35768) y los pesos se publicaron a finales de septiembre de 2026.
Objetivo de actualización de DMDObjetivo de actualización de PDMD
Objetivo de DMDObjetivo de PDMD

Ambos paneles decodifican un objetivo de actualización de entrenamiento real del mismo paso de la ejecución de MiniMax H3. La página del proyecto presenta el objetivo de PDMD como portador de menos artefactos, que es precisamente lo que la proyección pretende producir.

Qué cambia PDMD

DMD entrena a un estudiante sobre la diferencia entre la puntuación del crítico y la puntuación del propio estudiante. Esa actualización también arrastra el error del crítico, y el error entra en cada actualización sucesiva del estudiante y se acumula, lo que se manifiesta como sobresaturación progresiva y texturas poco naturales. PDMD conserva la actualización de DMD y le resta la parte que apunta a lo largo del residual de punto final del estudiante y del crítico:

r = x0_critic - x0_student
d = d - (d * r).sum() / r.pow(2).sum() * r

El artículo muestra que, para una consulta ruidosa fija, este residual es una estimación insesgada del error de punto final del crítico, y que bajo supuestos de alta dimensionalidad la proyección elimina una fracción constante del error del crítico mientras descarta solo una fracción que tiende a cero de la señal DMD ideal. Es un cambio de una línea en DMD, sin pérdida auxiliar, sin red adicional, sin pasada adicional del modelo y sin etapa de entrenamiento extra.

La figura de intuición de PDMD

La figura de intuición de la página del proyecto. DMD mueve el punto final del estudiante a lo largo de la dirección de actualización; PDMD proyecta fuera la componente paralela al residual del punto final.

Qué se publicó

La publicación es el lado MiniMax H3 del método, en tres artefactos:

ArtefactoDescripción
pdmd_2NFE_loraLoRA de 2 pasos, publicada el 2026-09-23
pdmd_4NFE_fullTransformer completo en bf16 de 4 pasos (MiniMaxH3Transformer3DModel), publicado el 2026-09-27
pdmd_4NFE_loraLoRA de 4 pasos, publicada el 2026-09-29

Los adaptadores llevan rango 128 y alfa 128 sobre 312 módulos, 624 tensores, del transformer H3, con la disposición de claves de Diffusers (transformer.<module>.lora_A.weight / transformer.<module>.lora_B.weight). Todo lo demás, el VAE, el VAE de audio, los programadores, el codificador de texto y el procesador, proviene del modelo base, y los metadatos de safetensors registran la regla de fusión W_base += lora_scale * (lora_B @ lora_A) con lora_scale = 1.0. La tarjeta pide cuatro pasos de denoising con la configuración de programadores publicada del modelo base (shift 12 / 3). El repositorio de 2 pasos también incluye una copia en fp32 de su adaptador.

Resultados

El artículo reporta el método en MiniMax H3 y Wan2.1. En MiniMax H3 usa VideoGen-Eval con 387 prompts a 544p y una semilla fija:

| Método | NFE | Total | Calidad | Dinámica | Semántica | PQ | CE | CU | IS | |--|--:|--:|--:|--:|--:|--:|--:|--:| | MiniMax-H3-33B, maestro | 50 | 82.41 | 82.22 | 66.67 | 83.20 | 6.567 | 4.188 | 6.213 | 5.15 | | MiniMax-H3-33B | 4 | 79.48 | 79.54 | 44.44 | 79.23 | 6.056 | 3.167 | 5.580 | 3.35 | | H3 Turbo LoRA | 4 | 81.57 | 81.29 | 54.78 | 82.69 | 6.406 | 3.917 | 6.015 | 4.52 | | DMD2† | 4 | 82.27 | 82.51 | 59.95 | 81.34 | 6.305 | 3.434 | 5.871 | 4.06 | | DMD† | 4 | 82.76 | 82.68 | 61.76 | 83.05 | 6.381 | 3.801 | 5.931 | 4.79 | | rCM† | 4 | 81.18 | 80.98 | 58.40 | 81.95 | 6.063 | 3.711 | 5.446 | 3.69 | | AnyFlow† | 4 | 81.97 | 81.82 | 64.60 | 82.60 | 6.092 | 3.544 | 5.591 | 4.35 | | PDMD | 4 | 83.17 | 83.25 | 71.83 | 82.86 | 6.530 | 4.062 | 6.180 | 4.98 |

† marca las reimplementaciones de los autores, entrenadas bajo un protocolo compartido.

En Wan2.1-T2V-1.3B usa VBench con 944 prompts a 480p y cinco semillas cada uno:

MétodoNFETotalCalidadDinámicaSemántica
Wan2.1-T2V-1.3B, maestro50x283.0685.0268.6175.23
Wan2.1-T2V-1.3B4x268.5473.6018.6148.30
rCM483.1385.1478.0675.10
AnyFlow483.5485.2859.4476.57
DMD†482.7085.0686.3973.24
DMD2†483.4485.8476.6773.84
PDMD483.7385.8989.7275.09

El resumen afirma que, en la generación conjunta de vídeo y audio de MiniMax H3, el estudiante PDMD de 4 pasos obtiene 83.17 en el total visual de VideoGen-Eval, 0.41 puntos por encima del baseline destilado más fuerte, y logra el mejor resultado en las seis métricas de audio entre los modelos de cuatro pasos comparados. En Wan2.1 reporta un total de VBench de 83.73 a cuatro pasos, 1.03 puntos por encima de la ejecución DMD equivalente. La página del proyecto añade comparaciones cualitativas y un estudio de usuarios que favorecen a PDMD sobre los baselines destilados en calidad visual, movimiento y calidad de audio.

Cómo ejecutarlo en ComfyUI

La publicación oficial está dirigida a Diffusers, no a nodos: inference.py y run_a10.py muestrean con la regla de re-noise con la que se entrenó a los estudiantes, y no se distribuye ningún JSON de flujo de trabajo con la publicación.

Para ComfyUI, los adaptadores son LoRA comunes una vez convertidos. Kijai ha publicado conversiones con rango reducido en Kijai/MiniMax-H3-experimental: minimax_h3_pdmd_2step_lora_avg_rank_38_bf16.safetensors y minimax_h3_pdmd_4step_lora_avg_rank_57_bf16.safetensors. Se cargan a través de la ruta LoRA estándar de MiniMax H3 sin un nodo personalizado, con la advertencia habitual de que la reducción de rango y las configuraciones del muestreador no son las que evaluó el artículo. También circula una conversión de la comunidad, Iwannapose/minimax_h3_pdmd_4nfe_comfyui.

El tráiler oficial de PDMD. Cada fotograma de la página del proyecto se ejecuta con cuatro evaluaciones de red o menos.

Dos clips de la cuadrícula de comparación de MiniMax H3 de la página del proyecto, con el mismo prompt y semilla, cuatro pasos cada uno:

DMD a 4 pasos.

PDMD a 4 pasos, mismo prompt y semilla que el clip anterior.

Limitaciones

  • Los estudiantes de MiniMax H3 publicados apuntan a 1344x768 con el codificador de texto y los componentes de audio del modelo base, por lo que la publicación es un resultado de velocidad de muestreo más que un modelo más pequeño.
  • Las conversiones para ComfyUI reducen los adaptadores de rango 128 a un rango promedio de 38 o 57, por lo que no son exactamente los archivos que evaluó el artículo.
  • Al no existir nodos oficiales ni JSON de flujo de trabajo, el soporte en ComfyUI depende de las conversiones de la comunidad y de su disposición de claves. La publicación en sí prioriza Diffusers.
  • Varios baselines marcados con una daga en las tablas anteriores son reimplementaciones de los propios autores entrenadas bajo un protocolo compartido, no los números que publican esos proyectos.

Disponibilidad

Página del proyecto: pdmd2026.github.io
Artículo: arXiv 2609.35768
Código: ZeamoxWang/pdmd
Pesos: pdmd2026
Conversión para ComfyUI: Kijai/MiniMax-H3-experimental
Modelo base: MiniMaxAI/MiniMax-H3

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
PDMD: destilación de MiniMax H3 en 4 pasos para ComfyUI | ComfyUI Wiki