FastH3 Trim:为 8 GB GPU 打造的剪枝版 8 步 MiniMax H3

ComfyUI Wikinews

FastVideo 发布 FastH3 Trim,这是一个移除 8 个块的 42 块剪枝版 MiniMax H3,可在低至 8 GB 的 GPU 内存中运行带音频的 8 步视频生成,并提供 ComfyUI 重打包文件。

FastH3 Trim 是 Hao AI Lab FastVideo 的 FastH3 V2 的实验性变体:同样是八步、音频同步的 MiniMax H3 蒸馏模型,但移除了 50 个 transformer 块中的 8 个。它的体积比基础 H3 小 4.2 倍,并且按团队给出的数据,在他们测试过的每一台设备上都比 V2 更快,最低可到内存受限的 8 GB RTX 4090。权重和 ComfyUI 重打包文件于 10 月 3 日至 6 日期间上架 Hugging Face,团队于 10 月 6 日发布了文章 FastH3 on Consumer Hardware。
FastH3 在消费级硬件上运行

Trim 改变了什么

基础 H3 由三个网络组成:一个 Qwen3-VL 文本编码器、一个将视频与音频 latent 一起去噪的 50 块 diffusion transformer,以及两个 VAE。以 BF16 计算是 137.7 GiB,无法装入 32 GB 显卡。FastH3 V2 通过量化把它缩小;Trim 还移除了块。

按组件划分的 checkpoint 大小

按组件划分的 checkpoint 大小。BF16 H3 为 137.7 GiB;FastH3 Trim NVFP4 版本为 33.0 GiB,其中 transformer 占 11.1 GiB。

  • 块剪枝: 团队从基础 H3 中逐个跳过块,并在三种噪波水平下、针对四类示例(运动、语音、音乐、声音事件)记录视频与音频预测的变化幅度,共 600 次测量。每个块按其在任一条件下造成的最大变化排名,因此对视频或音频任一重要的块都会被保留。被移除的八个块全部位于网络的前半部分;第一个和最后一个块对输出的影响最大。
  • 时间步条件: H3 通过 AdaLN 投影让每个块都受 diffusion 时间步的条件控制,该投影把 2,688 维的时间 embedding 映射为六个调制向量,而在 50 个块中这些投影以 BF16 存储要占 24 GiB。Trim 将其替换为一个共享的 2,688 到 16 的基向量加上一个小的逐块投影,并以 FP16 存储,因为 BF16 的重建误差约大 1.7 倍。
  • 训练: 新的 42 块模型直接使用八步 DMD2 并沿用 FastH3 V2 的目标函数进行训练。基础 H3 同时初始化冻结的 teacher 和可训练的 critic,注意力稀疏度为 80%,采样器步数为 999、874、749、624、500、375、250 和 125。
各格式下 FastH3 Trim transformer 的大小

各发布格式下的 FastH3 Trim transformer,按比例绘制:面积代表 checkpoint 大小。

ComfyUI 重打包包含什么

该版本在 FastVideo/FastVideo-FastH3-Trim-Comfy 中为 ComfyUI 重新打包。选择一个 diffusion model 文件以及匹配的文本编码器:

Diffusion model大小适用设备
fastvideo_fasth3_trim_8step_nvfp4.safetensors11.9 GBNVIDIA Blackwell:RTX 50 系列、RTX PRO 6000、DGX Spark
fastvideo_fasth3_trim_8step_fp8.safetensors19.7 GBNVIDIA Ada 及更新架构:RTX 40 系列
fastvideo_fasth3_trim_8step_int8_convrot.safetensors18.9 GB任意较新的 NVIDIA GPU;与模板默认值一致
fastvideo_fasth3_trim_8step_bf16.safetensors37.5 GB参考质量,或用于转换为其他格式

该仓库还包含 Qwen3-VL 文本编码器(BF16、INT8 ConvRot、NVFP4 AWQ)以及 MiniMax H3 的视频和音频 VAE。每个 NVFP4 层都使用在 1,000 条提示词上校准的激活缩放,Trim 共有 294 个已校准层。

在 ComfyUI 中运行

使用 ComfyUI 自带的 FastVideo FastH3: Text to Video 模板(0.36.0 或更高版本),并在其 UNETLoader 中选择一个 Trim diffusion model。保持模板的采样器设置不变:8 步、res_multistep、simple,以及 MiniMaxH3SigmaShift 节点在视频上设为 10、音频上设为 3。

运行速度如何

来自博客文章:一段 5 秒带音频片段从端到端的秒数,两个提示词各运行两次取中位数:

机器V2, 480pTrim, 480pV2, 768pTrim, 768p
RTX PRO 6000 96 GB13.512.036.532.5
RTX 5090 32 GB14.813.438.635.4
RTX 4090 24 GB54.643.9154.6132.8
RTX 4090,16 GB 限制79.972.1153.7139.9
RTX 4090,12 GB 限制91.274.1170.7147.1
RTX 4090,8 GB 限制-82.0--
DGX Spark 128 GB 统一内存141.4125.8340.1
2x DGX Spark87.278.3
Mac,M4 Max 36 GB 统一内存925.2

8 GB、12 GB 和 16 GB 三行是同一块 RTX 4090 在限制 GPU 内存后的结果;实际显存更少的显卡会更慢。博客指出,在 4090 上 FP8 路径没有 FP4 tensor core 可用,因此它用一个融合的逐 tensor 内核加输出缩放来绕开较慢的逐 token、逐通道 FP8 matmul,并把 query 和 key 量化为 INT8 以进行分数计算。

每台机器的端到端时间

每台机器上 5 秒、832x480 带音频片段的端到端时间。

在 RTX 5090 上使用相同的提示词和种子,先 FastH3 V2 后 FastH3 Trim:

RTX 5090 上的 FastH3 V2。

同一块 RTX 5090、相同提示词和种子下的 FastH3 Trim。

限制

  • Trim 被标注为实验性版本,而非质量标杆:博客称移除块会让模型更快更小,但会损失一些质量,并建议在质量最重要时使用 FastH3 V2。
  • 8 GB 这一数字是仅在 Trim、NVFP4 下、在内存受限显卡上测得的结果。在测试配置上,V2 无法装入 12 GB。
  • Trim 仅存在于八步 FastH3 系列中。它不改变基础 MiniMax H3 模型,后者仍然需要完整的 50 块 transformer。
  • ComfyUI 路径依赖于随 ComfyUI 0.36.0 或更高版本一同提供的 FastH3 模板。

获取方式

ComfyUI 重打包: FastVideo/FastVideo-FastH3-Trim-Comfy
源权重: FastVideo/FastVideo-FastH3-Trim-8-Step
博客文章: FastH3 on Consumer Hardware
代码: hao-ai-lab/FastVideo
质量对标版本: FastVideo/FastVideo-FastH3-8-Step-V2
基础模型: MiniMaxAI/MiniMax-H3

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
FastH3 Trim:为 8 GB GPU 打造的剪枝版 8 步 MiniMax H3 | ComfyUI Wiki