MiniMax H3 Fused Turbo: 单文件 21GB,4 步图生视频与音频 | ComfyUI 模型指南
MATLOWAI 将 H3 turbo 和 Mystic LoRA 整合进单个 INT8 ConvRot ComfyUI 文件:支持 4 步文生图、图生视频及参考生视频并含音频,节省约 21 GB VRAM。
4 步单次参考运行:1152x640,243 帧(含音频 10 秒),在一张 RTX PRO 6000 上耗时 76 秒。
文件内容解析
烘焙基于剪枝后的 fl2va Transformer,融合了 (ref2va - fl2va) 权重差值的 rank-1024 SVD,因此一个分区同时服务于首尾帧条件和参考条件。在此基础上:
| 合并项 | 强度 | 来源 |
|---|---|---|
| lightx2v FL2VA Turbo 8-step v1.0 | 1.0 | Kijai/MiniMax-H3_comfy, rank-24 调整大小 (原始) |
| Mystic v2.0 (运动平滑) | 0.7 | Civitai model 2856467 |
单次 INT8 ConvRot 量化过程在合并之后运行:每个 50 个块中的四个重型 Linear 权重(qkv_proj, out_proj, fc1, fc2)为 INT8,使用 ConvRot(组 256,每通道),位于 ComfyUI 原生 comfy_quant 布局中,其余保持 BF16/F32。顺序很重要:量化合并后的权重可避免量化基座加浮点差值的漂移,同种子测试显示烘焙结果与实时 LoRA 路径一致。
为何合并而非堆叠 LoRA
两个 LoRA 文件总计约 540 MB,因此适配器不是问题。LoRA 是 ComfyUI 在加载时添加的低秩差值;为了保持可移除性,它保留所触及权重的纯净副本。修补 INT8 模型的 200 个核心图层,备份就会成为内存中的第二个完整模型。在同一种子上两次测量 8 步:
| 设置 | 峰值 VRAM | 常驻 | 实际耗时 |
|---|---|---|---|
| 烘焙 (本文件) | 47.8 GB | 42 GB | 103 s |
| 实时 LoRA | 68.9 GB | 64 GB | 103 s |
同一素材,相同实际耗时,音频电平在噪波内一致。烘焙仅移除了两个加载器、一次量化往返和约 21 GB 补丁备份。如需可调 LoRA 强度,README 文档记录了带有公开文件的等效实时路径。
步骤说明:标称 8 步,实际运行 4 步
合并后的 turbo 是 lightx2v 的 8 步 LoRA,但它是 4 或 8 NFE 模型。在一台 RTX PRO 6000 (96 GB),1152x640,243 帧,SLA 稀疏注意力下的实测阶梯:
| 流程 | 步骤 | 实际耗时 |
|---|---|---|
| 参考,单次通过 | 4 | 76 s |
| 参考,单次通过 | 6 | 80 s |
| 参考,单次通过 | 8 | 103 s |
| 参考,单次通过 | 25 | 292 s |
| 去抖动 (4 + 4) | 4 + 4 | ~374 s |
同一素材 25 步:画面稍锐利,292 秒而非 76 秒,音轨不变。
去抖动(de-rope)是运行 4 步的原因:第二遍仅在 jerk oracle 标记的帧上花费步骤,因此 4 + 4 总成本约等于一次 25 步通过,而保留区域更清晰。两个配方发现很重要:res_multistep 在 4 步下优于 euler 的音频质量(lightx2v 示例图说 euler),且 0.90 稀疏度的 SLA 块稀疏注意力是可听见的,恢复了密集注意力会扁平化的高音轨细节,同时运行速度提高约 40%。
工作流
仓库提供五个 ComfyUI 图(UI 和 API 格式),每个都有一个 PROMPT 框驱动每个阶段。需要 ComfyUI-MAINodes 和 SLA 稀疏注意力节点包:
入门
- 将
minimax_h3_fused_refdelta_r1024_turbo8_mystic07_int8_convrot.safetensors(21 GB) 下载到ComfyUI/models/diffusion_models/,并使用标准UNETLoader加载,weight_dtype 设为default。无需自定义量化加载器。 - 从 Comfy-Org/MiniMax-H3 下载配套文件:
minimax_h3_video_vae_int8_convrot.safetensors,minimax_h3_audio_vae_fp32.safetensors(VAEs) 和qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(文本编码器)。 - 安装 ComfyUI-MAINodes 和 SLA 稀疏注意力节点包,然后拖入上述工作流。
较小显存的显卡也能运行:ComfyUI 的模型管理按需加载和卸载 Transformer、文本编码器和 VAE,因此相同的图可以运行,只是较慢。在 AMD/ROCm 上,该配方是在搭载 patientx 的 ComfyUI ROCm 分支的 AMD 机器上开发的,该分支也包含 SLA 注意力节点的 ROCm 构建版本。
评论
使用 GitHub 登录后即可参与讨论。