MiniMax H3 FL2V Turbo 4 步 v1.2 LoRA:更纯净的音频

ComfyUI Wikinews

下载 minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensors:LightX2V 的 4 步 MiniMax H3 Turbo 更新,提供更纯净、更稳定的音频生成。

LightX2V 团队发布了 FL2V Turbo 4 步 v1.2 768p,这是 Minimax-h3-Turbo 蒸馏系列的最新条目。v1.2 保持了与 v1.1 相同的快速 4 步生成设置,并完全专注于一个弱点:音频质量。发布对比显示,在相同设置下,已生成的音频更纯净、更稳定,伪影更少(发布讨论)。

MiniMax H3 FL2V Turbo v1.2 example frame

v1.2 中的变更

v1.2 是对 FL2V(首帧/末帧)4 步 768p LoRA 的音频质量刷新,而非新架构:

  • 更纯净、更稳定的音频,伪影更少
  • 与 v1.1 相同的 4 步(NFE 4)生成设置
  • DiffusersComfyUI bf16 权重同时发布
文件格式
minimax_h3_fl2v_turbo_4step_v1.2_768p_bf16.safetensorsDiffusers
minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensorsComfyUI,无需转换

v1.1 与 v1.2 对比(启用音频)

团队分享了使用相同输入、提示词、种子和推理设置的背靠背对比:

v1.1v1.2

推荐设置

设置
步数4
视频偏移6
音频偏移3
采样器Euler
分辨率最高 768p

视频和音频偏移通过 ModelSamplingMiniMaxH3 节点设置,连接在扩散模型加载器之后。注意,Hugging Face 讨论线程中的一些早期测试人员认为,相对于 v1.1,视觉质量有所下降,因此如果您的工作流中视频质量比音频更重要,保留 v1.1 是一个合理的选择。

ComfyUI 用法

MiniMax H3 具有原生 ComfyUI 支持,因此 LoRA 不需要自定义节点:

  1. minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensors 下载到 ComfyUI/models/loras/
  2. 加载基础 MiniMax H3 checkpoint,并在模型加载器和采样器之间应用 LoRA。
  3. 通过 ModelSamplingMiniMaxH3 设置 4 个采样步骤、Euler 采样器、视频偏移 6 和音频偏移 3,然后在最高 768p 下生成。

项目自己的示例图在 ModelTC/Minimax-H3-Turbo 中也已更新;T2VA/I2VA 图最接近 FL2V 路径。

可用性

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 FL2V Turbo 4 步 v1.2 LoRA:更纯净的音频 | ComfyUI Wiki