MiniMax H3 Turbo Ref2VA 8 步 v1.0:参考生视频 LoRA

ComfyUI Wikinews

下载 minimax_h3_ref2v_turbo_8step_v1.0_comfyui_bf16.safetensors:Lightx2v 的 MiniMax H3 音频支持 8 步 768p Ref2VA 蒸馏,含更新示例工作流。

Lightx2v 团队和 ModelTC 更新了 Minimax-h3-Turbo,带来 Ref2VA Turbo 8-step v1.0 768p,这是参考生视频路径的 8 步 768p 蒸馏:一个或多个参考图像驱动生成带音频的视频,仅需基础模型步数的一小部分(发布仓库)。

这填补了 Turbo 系列的最后一个空白。FL2VA 侧自 v1.0 发布 以来已有 8 步和 768p 模型,而 Ref2VA 仅有 544p 4 步 v0.1

模型规格

model spec table 现已列出 FL2VA 和 Ref2VA 跨六个 模型。新条目如下:

模型使用例训练分辨率训练偏移(视频/音频)蒸馏步数(NFE)推荐推理步数
Ref2VA Turbo 8-step v1.0 768pRef2VA768p (1344x768)6 / 388

Hugging Face 上提供两个文件:

  • minimax_h3_ref2v_turbo_8step_v1.0_768p_bf16.safetensors 用于 Diffusers
  • minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors 适用于 ComfyUI,无需转换
LightX2V Studio running the MiniMax H3 Turbo LoRA

LightX2V Studio 当前提供 FL2VA Turbo 8-step v1.0 768p LoRA;同一仓库现在涵盖 8 步和 768p 的 Ref2VA 路径。

ComfyUI 用法

MiniMax H3 原生支持 ComfyUI,因此 LoRA 不需要自定义节点:

  1. minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors 下载到 ComfyUI/models/loras/
  2. 在 Ref2V 工作流中加载基础 MiniMax H3 模型,并在模型加载器和采样器之间应用 LoRA。
  3. 通过参考输入分支连接一个或多个参考图像,并以 768p(例如 1344x768)运行 8 次采样步骤。

官方 MiniMax H3 R2V 工作流模板 是一个很好的起点。项目自己的示例图也已更新:video_minimax_h3_ref2v_lightx2v_turbo.json 默认使用 Ref2VA Turbo 4 步 v0.1 模型,T2VA/I2VA 图默认使用 FL2VA Turbo 8 步 v1.0。

对于参考图像尺寸,项目推荐使用蒸馏训练中使用的 match 模式,该模式通过推理入口点的 --reference-resize-mode 暴露。

可用性

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 Turbo Ref2VA 8 步 v1.0:参考生视频 LoRA | ComfyUI Wiki