FastH3 预览 v1:来自 FastVideo 的 4 步 MiniMax H3 蒸馏

ComfyUI Wikinews

FastVideo 开源 FastH3 预览 v1:基于 MiniMax H3 的 4 步 DMD2 蒸馏,90% 稀疏注意力,在 Blackwell GPU 上文本生成视频和音频速度提升高达 14 倍。

FastVideo 与 Nuva Lab 及 NVIDIA FastGen 团队合作,开源了 FastH3 预览 v1,这是用于文生视频和音频生成的 MiniMax H3 的 4 步蒸馏版(checkpoint | blog | GitHub)。它用 4 次调用替换了基础模型的 49 次 transformer 调用,并增加了 90% 的稀疏注意力,在单个 NVIDIA Blackwell GPU 上实现高达 14 倍加速

FastH3 预览 v1

FastH3 预览 v1:来自 FastVideo 的开源权重 4 步稀疏蒸馏 MiniMax H3

基准测试速度

在配备 B200 硬件、1344x768 分辨率、24 FPS 且包含音频的情况下,推荐的 VSA / Data-Free checkpoint 在单个 B200 上生成 15 秒视频片段耗时 47.2 秒(比稠密基础模型快 14.38 倍),在八个 B200 上耗时 15.5 秒,单卡上 5 秒和 10 秒片段分别为 16.2 秒和 31.1 秒。计时涵盖完整 pipeline:编码、denoising、解码、音频、复用和文件输出。

蒸馏原理

FastH3 通过两种方式降低成本:

  • 4 次调用而非 49 次。 分布匹配蒸馏 (DMD2) 使用学习到的判别器,针对冻结的 Base H3 教师训练学生模型。仅提示运行使用反向模拟;合成数据变体从正向加噪的 Base-H3 视频和音频 latent 开始。
  • 每次调用的注意力计算更少。 学生模型采用 VSA(用于视频扩散的可训练稀疏注意力),稀疏度为 90%,运行于 FastVideo 的 tile-64 CUDA VSA 内核,配合区域 DiT 编译、H3 融合和编译后的视频 VAE。

发布内容

项目仓库说明
完整 checkpointFastVideo-FastH3-4-step-Preview-v1-VSA-DataFree推荐预览 v1,需要 VSA-H3 注意力后端
预提取 LoRAFastVideo-FastH3-4-step-Preview-v1-LoRA包含 VSA-datafree 适配器以及稠密和合成数据消融实验
推理代码hao-ai-lab/FastVideofasth3 扩展包附带已发布的 CUDA 内核 wheel;训练代码即将推出

这些 checkpoint 在多种宽高比下训练和验证,包括正方形、竖屏、横屏和超宽 768p,自定义高度和宽度为 32 的倍数。它们复用了 H3-Base 文本编码器、视频 VAE、音频 VAE、tokenizers 和 schedulers。

范围与 ComfyUI 可用性

预览 v1 仅覆盖文生视频和音频:FL2VA(首帧图像 conditioning)和 Ref2VA(参考图像 conditioning)未被蒸馏,复杂运动、精细细节和部分音频可能低于基础模型。FastVideo 路线图列出了图像参考支持、NVFP4 量化、RTX / DGX Spark / Apple MLX 优化,以及使用 NVIDIA PDD 方法的新运行。

对于今天的 ComfyUI 用户,FastH3 是 FastVideo 栈发布,而非即插即用 checkpoint:VSA 适配器需要 FastVideo 的 VSA-H3 后端和启动器,而不是通用的 LoRA 加载器。H3 的 ComfyUI 原生加速目前来自蒸馏 LoRA,如 H3 Turbo-SLAPDD Acc LoRA,它们在标准 ComfyUI H3 工作流上运行。随着团队将模型推向消费级硬件,值得关注的 ComfyUI 兼容 FastH3 路径。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
FastH3 预览 v1:来自 FastVideo 的 4 步 MiniMax H3 蒸馏 | ComfyUI Wiki