MiniMax H3 Turbo LoRA:4 步音频视频生成预览(含 ComfyUI 工作流)

ComfyUI Wikinews

一个社区 LoRA 可在 4 步采样中生成带同步立体声音频的 MiniMax H3 视频,而通常需要约 20 步。文中包含 ComfyUI 转换方法和示例工作流。

MiniMax H3 的社区 LoRA 只需 4 步采样 即可同时生成 视频和同步立体声音频,而通常需要约 20 步,采样时间大约提速 5 倍。该 LoRA 由 larryvrh 于 8月5日作为早期预览发布,是开源权重 H3 模型的首个加速 LoRA(阅读开源权重相关报道)。

这是一个早期原型。权重和 ComfyUI 工具仍在开发中:4 步即可生成,但画面明显偏软;目前 6-8 步是锐度的最佳区间。请将其视为预览版,而非最终成品。

权重

所有文件均为 bf16 格式,约 744 MB,以标准低秩更新方式应用(W_eff = W + lora_B @ lora_A,alpha 等于秩,无额外缩放)。该 LoRA 作用于 H3 基础 Transformer;视频流和音频流在两种不同的流调度上运行,因此标准 sampler 在 4 步时会对音频过度采样并破坏音频。自定义 sampler 节点可以解决这一问题。

文件~训练步数说明
minimax_h3_turbo_4step_ckpt500.safetensors~500推荐默认:最新且最锐利(非 EMA)
minimax_h3_turbo_4step_ema_ckpt500.safetensors~500时间平均变体:更平滑,但在这一早期 checkpoint 可能出现重影
minimax_h3_turbo_4step.safetensors~200初始发布,非 EMA
minimax_h3_turbo_4step_ema.safetensors~200初始发布,时间平均(已被取代)

该 LoRA 需要 未剪枝 的基础 checkpoint:即 bf16 或完整 INT8 的 convrot diffusion 模型。剪枝变体使用不同的时间 conditioning 层,因此不兼容。另有一个兼容剪枝模型的转换版本可供使用(见下文)。

ComfyUI 使用方法

原始发布需要 自定义节点ComfyUI-MiniMax-H3-Turbo,可通过 ComfyUI-Manager 安装,或通过 git clone 克隆到 custom_nodes),并在 models/loras/ 中放入 minimax_h3_turbo_4step*.safetensors 文件:

  1. 安装自定义节点
  2. .safetensors 文件下载到 ComfyUI/models/loras/
  3. 从官方 MiniMax H3 开源权重工作流 开始,在模型加载器和 sampler 之间插入 Turbo LoRA,然后将 sampler 替换为 MiniMax-H3 Turbo Sampler (4-step),并将 scheduler 设置为 simple

仓库中附带了一个现成的文生视频工作流(minimax_h3_t2v_turbo.json),也可以在该节点仓库的示例工作流中找到。

这不是 ComfyUI 的原生支持:加速 LoRA 依赖第三方 ComfyUI-MiniMax-H3-Turbo 自定义节点。

剪枝模型转换

ComfyUI 使用的剪枝/曲线形式 H3 checkpoint 需要进行键名转换。drbaph 在 MiniMax-H3-Turbo-Lora-ComfyUI 发布了 minimax_h3_turbo_4step_ckpt500_pruned_comfyui.safetensors(以及一个 EMA 变体),可使用 ComfyUI 内置的 MiniMax-H3 LoRA 加载器加载,并附带了一个示例工作流(fl_minimax_h3_turbo_lora_example_workflow.json)。QrusherZA 还在 H3_Turbo_ComfyUI 发布了一个单文件剪枝转换版本。

社区早期测试反馈:在 LoRA 强度 1.0、使用 Euler/Beta 的情况下,4 步输出画面锐利;音频流是目前这个早期 checkpoint 的短板。

获取方式

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 Turbo LoRA:4 步音频视频生成预览(含 ComfyUI 工作流) | ComfyUI Wiki