NVIDIA H3 超级加速:MiniMax H3 视频速度提升高达 27.7 倍
NVIDIA Sol Engine 将 MiniMax H3 作为 4 步草稿加 3 步 LTX 细化步骤运行:5 秒 768p 视频耗时 6.85 秒,在单个 GB200 上比 SGLang 快多达 27.7 倍。
NVIDIA 页面上的独立 1440p 结果之一(10 秒,2560×1440):两阶段加速,未记录 1440p 的匹配基线。
工作原理
与在全分辨率下运行多个 H3 denoise 步骤不同,H3 超级加速在短的低分辨率草稿中完成大部分生成工作,然后通过轻量级细化步骤恢复高分辨率细节。每个阶段是一个任务,两个阶段在单个 GB200 上串行运行:
| 阶段 | 模型 | 分辨率 | FPS | 步骤 | 输出 |
|---|---|---|---|---|---|
| 阶段 1 · 草稿 | MiniMax-H3 + 速度 LoRA | 896×512 | 24 | 4 | 草稿视频 |
| 阶段 2 · 细化 | LTX-2.5 + Sol-Attn | 768p / 1080p / 2K | 24 | 3 | 最终视频 |
阶段 1 使用 LightX2V MiniMax-H3 Turbo LoRA 以四个 denoise 步骤在 896×512 分辨率下生成初始视频。阶段 2 将草稿 upscale 到请求的输出分辨率,并运行三步 Sol-Attn 过程以恢复高分辨率细节和一致性。该 pipeline 与 SGLang 基线并非比特精确:它改变了采样路径,因此细节、纹理、运动或音频可能会出现差异:NVIDIA 页面上的配对视频让您可以直接判断这种权衡。
延迟测量
单个 NVIDIA GB200 上的端到端延迟,使用最新的 Sol-Super 结果,其中 Sol-Attn 用于完整的阶段 2 服务:
| 分辨率 | 时长 | Diffusers | SGLang | Sol Engine | Sol-Super E2E | 对比 SGLang |
|---|---|---|---|---|---|---|
| 1344×768 | 5 s | 167.8 s | 152.3 s | 45.4 s | 6.852 s | 22.2× |
| 1344×768 | 10 s | 468.2 s | 414.1 s | 132.5 s | 14.931 s | 27.7× |
这两个加速来自不同的地方。阶段 1 用 TAEH3 轻量级解码器(0.028 秒)替换了官方 H3 VAE 解码(3.427 秒),阶段 2 用 Sol-Attn 细化器和 LTX TAEHV 最终解码替换了密集的 LTX-2.5 Video VAE 解码器(在匹配的 121 帧解码中为 6.404 秒)。阶段 2 编码器故意保持不变:细化器是在原始 LTX-2.5 VAE Latent 分布上训练的。
在 768p 输出时,测量的吞吐量在单个充分利用的 GB200 上约为每小时 525 个五秒视频,而 SGLang 基线为 23.6。
视觉对比
NVIDIA 页面将每个 768p 和 1080p 样本与使用相同生成输入的匹配 SGLang 基线运行配对:
| SGLang 基线 | H3 超级加速 |
|---|---|
![]() | ![]() |
| 一名男子和女子在拥挤的日本街道上交换紧张的话语(1344×768,5 秒) | 相同输入,快 22.2 倍 |
| SGLang 基线 | H3 超级加速 |
|---|---|
![]() | ![]() |
| 两名武术家在竹林中对峙(1080p,5 秒) | 相同输入,已加速 |
两个独立的 1440p 结果(10 秒,2560×1440)也发布了,没有匹配基线:
可用性
该 pipeline 由公开组件构建:官方 MiniMax-H3 checkpoint,用于草稿的 LightX2V MiniMax-H3 Turbo 四步 LoRA,LTX-2.5 pre-trained checkpoint,以及 TAEH3 和 LTX TAEHV 轻量级解码器。它在 GB200 硬件上的 NVIDIA Sol Engine 上运行,带有 Sol-Attn,并作为带有测量基准的生产参考呈现,而不是 ComfyUI 节点包。撰写之时,NVIDIA 尚无此 pipeline 的官方 ComfyUI 工作流;Sol Engine 各个组件(如 Sol-Attn 补丁)的社区移植版已开始出现。




评论
使用 GitHub 登录后即可参与讨论。