PDMD:面向 ComfyUI 的 4 步 MiniMax H3 蒸馏
加州大学圣地亚哥分校与字节跳动发布 PDMD,这是对 DMD 的一行改动,可将 MiniMax H3 蒸馏到四步,并配有 Kijai 的 ComfyUI 转换。
![]() | ![]() |
|---|---|
| DMD 目标 | PDMD 目标 |
两幅图都解码来自 MiniMax H3 训练同一步的真实训练更新目标。项目页面展示的 PDMD 目标包含更少的伪影,这正是该投影想要达到的效果。
PDMD 改变了什么
DMD 用评论家(critic)的得分与学生自身得分之间的差值来训练学生模型。该更新同时携带了评论家的误差,而这一误差会进入后续每一次学生更新并不断累积,表现为逐渐加重的过饱和与不自然的纹理。PDMD 保留 DMD 更新,并减去其中沿学生与评论家端点残差方向的分量:
r = x0_critic - x0_student
d = d - (d * r).sum() / r.pow(2).sum() * r论文表明,在固定的含噪查询下,该残差是评论家端点误差的无偏估计;并且在高维假设下,该投影去除了评论家误差的一个恒定比例,同时只舍弃了理想 DMD 信号中可忽略的一小部分。这是对 DMD 的一行改动,没有辅助损失、没有额外网络、没有额外模型前向、也没有额外训练阶段。
项目页面上的直觉示意图。DMD 沿更新方向移动学生端点;PDMD 则投影掉与端点残差平行的分量。
发布了什么
本次发布的是该方法在 MiniMax H3 这一侧的内容,共三个产物:
| 产物 | 描述 |
|---|---|
pdmd_2NFE_lora | 2 步 LoRA,发布于 2026-09-23 |
pdmd_4NFE_full | 4 步完整 bf16 transformer(MiniMaxH3Transformer3DModel),发布于 2026-09-27 |
pdmd_4NFE_lora | 4 步 LoRA,发布于 2026-09-29 |
这些适配器在 H3 transformer 的 312 个模块、624 个 tensor 上采用 rank 128 与 alpha 128,使用 Diffusers 的键布局(transformer.<module>.lora_A.weight / transformer.<module>.lora_B.weight)。其余一切,包括 VAE、音频 VAE、调度器、文本编码器与处理器,均来自基础模型;safetensors 元数据记录了融合规则 W_base += lora_scale * (lora_B @ lora_A),其中 lora_scale = 1.0。模型卡片要求使用基础模型发布的调度器配置(shift 12 / 3)进行四步去噪。2 步仓库还附带其适配器的 fp32 副本。
结果
论文在 MiniMax H3 和 Wan2.1 上报告了该方法的结果。在 MiniMax H3 上,它使用 VideoGen-Eval、387 条提示词、544p 分辨率和固定种子:
| 方法 | NFE | 总计 | 质量 | 动态 | 语义 | PQ | CE | CU | IS | |--|--:|--:|--:|--:|--:|--:|--:|--:| | MiniMax-H3-33B,教师模型 | 50 | 82.41 | 82.22 | 66.67 | 83.20 | 6.567 | 4.188 | 6.213 | 5.15 | | MiniMax-H3-33B | 4 | 79.48 | 79.54 | 44.44 | 79.23 | 6.056 | 3.167 | 5.580 | 3.35 | | H3 Turbo LoRA | 4 | 81.57 | 81.29 | 54.78 | 82.69 | 6.406 | 3.917 | 6.015 | 4.52 | | DMD2† | 4 | 82.27 | 82.51 | 59.95 | 81.34 | 6.305 | 3.434 | 5.871 | 4.06 | | DMD† | 4 | 82.76 | 82.68 | 61.76 | 83.05 | 6.381 | 3.801 | 5.931 | 4.79 | | rCM† | 4 | 81.18 | 80.98 | 58.40 | 81.95 | 6.063 | 3.711 | 5.446 | 3.69 | | AnyFlow† | 4 | 81.97 | 81.82 | 64.60 | 82.60 | 6.092 | 3.544 | 5.591 | 4.35 | | PDMD | 4 | 83.17 | 83.25 | 71.83 | 82.86 | 6.530 | 4.062 | 6.180 | 4.98 |
† 表示作者在统一协议下训练的重新实现版本。
在 Wan2.1-T2V-1.3B 上,它使用 VBench、944 条提示词、480p 分辨率,每条提示词五个种子:
| 方法 | NFE | 总计 | 质量 | 动态 | 语义 |
|---|---|---|---|---|---|
| Wan2.1-T2V-1.3B,教师模型 | 50x2 | 83.06 | 85.02 | 68.61 | 75.23 |
| Wan2.1-T2V-1.3B | 4x2 | 68.54 | 73.60 | 18.61 | 48.30 |
| rCM | 4 | 83.13 | 85.14 | 78.06 | 75.10 |
| AnyFlow | 4 | 83.54 | 85.28 | 59.44 | 76.57 |
| DMD† | 4 | 82.70 | 85.06 | 86.39 | 73.24 |
| DMD2† | 4 | 83.44 | 85.84 | 76.67 | 73.84 |
| PDMD | 4 | 83.73 | 85.89 | 89.72 | 75.09 |
摘要指出,在 MiniMax H3 的视频与音频联合生成任务上,4 步 PDMD 学生模型在 VideoGen-Eval 视觉总分上达到 83.17,比最强的蒸馏基线高 0.41 分,并在所比较的四步模型中取得了全部六项音频指标的最佳结果。在 Wan2.1 上,它报告四步时 VBench 总分为 83.73,比对应的 DMD 运行高 1.03 分。项目页面还补充了定性对比和一项用户研究,结果显示 PDMD 在视觉质量、运动表现和音频质量上均优于蒸馏基线。
在 ComfyUI 中运行
官方发布面向 Diffusers,而非节点:inference.py 和 run_a10.py 使用学生模型训练时所采用的 re-noise 规则进行采样,且发布中不附带任何工作流 JSON。
对于 ComfyUI,这些适配器在转换后就只是普通的 LoRA。Kijai 在 Kijai/MiniMax-H3-experimental 上发布了降秩转换版本:minimax_h3_pdmd_2step_lora_avg_rank_38_bf16.safetensors 和 minimax_h3_pdmd_4step_lora_avg_rank_57_bf16.safetensors。它们通过标准的 MiniMax H3 LoRA 路径加载,无需自定义节点,但需注意降秩和采样器设置并非论文所评估的配置。另有社区转换版本 Iwannapose/minimax_h3_pdmd_4nfe_comfyui 也在流传。
官方 PDMD 预告片。项目页面上的每一帧都在四次网络评估或更少次数下生成。
以下两个片段来自项目页面的 MiniMax H3 对比网格,提示词与种子相同,各为四步:
4 步的 DMD。
4 步的 PDMD,提示词与种子与上方片段相同。
局限
- 发布的 MiniMax H3 学生模型面向 1344x768,并使用基础模型的文本编码器和音频组件,因此该发布是采样速度上的成果,而不是更小的模型。
- ComfyUI 转换将 rank 128 的适配器降为平均 rank 38 或 57,因此它们并非论文所评估的确切文件。
- 由于没有官方节点或工作流 JSON,ComfyUI 支持依赖于社区转换及其键布局。该发布本身以 Diffusers 为优先。
- 上表中标有匕首号的若干基线是作者在统一协议下训练的自家重新实现版本,而非这些项目公布的数字。
获取方式
项目页面: pdmd2026.github.io
论文: arXiv 2609.35768
代码: ZeamoxWang/pdmd
权重: pdmd2026
ComfyUI 转换: Kijai/MiniMax-H3-experimental
基础模型: MiniMaxAI/MiniMax-H3


评论
使用 GitHub 登录后即可参与讨论。