MiniMax H3 Turbo Ref2VA 8 步 v1.0:参考生视频 LoRA
下载 minimax_h3_ref2v_turbo_8step_v1.0_comfyui_bf16.safetensors:Lightx2v 的 MiniMax H3 音频支持 8 步 768p Ref2VA 蒸馏,含更新示例工作流。
Lightx2v 团队和 ModelTC 更新了 Minimax-h3-Turbo,带来 Ref2VA Turbo 8-step v1.0 768p,这是参考生视频路径的 8 步 768p 蒸馏:一个或多个参考图像驱动生成带音频的视频,仅需基础模型步数的一小部分(发布仓库)。
这填补了 Turbo 系列的最后一个空白。FL2VA 侧自 v1.0 发布 以来已有 8 步和 768p 模型,而 Ref2VA 仅有 544p 4 步 v0.1。
模型规格
model spec table 现已列出 FL2VA 和 Ref2VA 跨六个 模型。新条目如下:
| 模型 | 使用例 | 训练分辨率 | 训练偏移(视频/音频) | 蒸馏步数(NFE) | 推荐推理步数 |
|---|---|---|---|---|---|
| Ref2VA Turbo 8-step v1.0 768p | Ref2VA | 768p (1344x768) | 6 / 3 | 8 | 8 |
在 Hugging Face 上提供两个文件:
minimax_h3_ref2v_turbo_8step_v1.0_768p_bf16.safetensors用于 Diffusersminimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors适用于 ComfyUI,无需转换
LightX2V Studio 当前提供 FL2VA Turbo 8-step v1.0 768p LoRA;同一仓库现在涵盖 8 步和 768p 的 Ref2VA 路径。
ComfyUI 用法
MiniMax H3 原生支持 ComfyUI,因此 LoRA 不需要自定义节点:
- 将
minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors下载到ComfyUI/models/loras/。 - 在 Ref2V 工作流中加载基础 MiniMax H3 模型,并在模型加载器和采样器之间应用 LoRA。
- 通过参考输入分支连接一个或多个参考图像,并以 768p(例如 1344x768)运行 8 次采样步骤。
官方 MiniMax H3 R2V 工作流模板 是一个很好的起点。项目自己的示例图也已更新:video_minimax_h3_ref2v_lightx2v_turbo.json 默认使用 Ref2VA Turbo 4 步 v0.1 模型,T2VA/I2VA 图默认使用 FL2VA Turbo 8 步 v1.0。
对于参考图像尺寸,项目推荐使用蒸馏训练中使用的 match 模式,该模式通过推理入口点的 --reference-resize-mode 暴露。
可用性
- 权重:lightx2v/Minimax-h3-Turbo 在 Hugging Face(Apache-2.0),bf16 Diffusers 和 ComfyUI 格式
- 代码和工作流:ModelTC/Minimax-H3-Turbo 在 GitHub
- 托管:LightX2V Studio 和 LightX2V API 在云端运行 Turbo 系列
评论
使用 GitHub 登录后即可参与讨论。