MiniMax H3 FL2V Turbo 4 步 v1.2 LoRA:更纯净的音频
ComfyUI Wikinews
下载 minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensors:LightX2V 的 4 步 MiniMax H3 Turbo 更新,提供更纯净、更稳定的音频生成。
LightX2V 团队发布了 FL2V Turbo 4 步 v1.2 768p,这是 Minimax-h3-Turbo 蒸馏系列的最新条目。v1.2 保持了与 v1.1 相同的快速 4 步生成设置,并完全专注于一个弱点:音频质量。发布对比显示,在相同设置下,已生成的音频更纯净、更稳定,伪影更少(发布讨论)。
v1.2 中的变更
v1.2 是对 FL2V(首帧/末帧)4 步 768p LoRA 的音频质量刷新,而非新架构:
- 更纯净、更稳定的音频,伪影更少
- 与 v1.1 相同的 4 步(NFE 4)生成设置
- Diffusers 和 ComfyUI bf16 权重同时发布
| 文件 | 格式 |
|---|---|
minimax_h3_fl2v_turbo_4step_v1.2_768p_bf16.safetensors | Diffusers |
minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensors | ComfyUI,无需转换 |
v1.1 与 v1.2 对比(启用音频)
团队分享了使用相同输入、提示词、种子和推理设置的背靠背对比:
| v1.1 | v1.2 |
|---|---|
推荐设置
| 设置 | 值 |
|---|---|
| 步数 | 4 |
| 视频偏移 | 6 |
| 音频偏移 | 3 |
| 采样器 | Euler |
| 分辨率 | 最高 768p |
视频和音频偏移通过 ModelSamplingMiniMaxH3 节点设置,连接在扩散模型加载器之后。注意,Hugging Face 讨论线程中的一些早期测试人员认为,相对于 v1.1,视觉质量有所下降,因此如果您的工作流中视频质量比音频更重要,保留 v1.1 是一个合理的选择。
ComfyUI 用法
MiniMax H3 具有原生 ComfyUI 支持,因此 LoRA 不需要自定义节点:
- 将
minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensors下载到ComfyUI/models/loras/。 - 加载基础 MiniMax H3 checkpoint,并在模型加载器和采样器之间应用 LoRA。
- 通过
ModelSamplingMiniMaxH3设置 4 个采样步骤、Euler 采样器、视频偏移 6 和音频偏移 3,然后在最高 768p 下生成。
项目自己的示例图在 ModelTC/Minimax-H3-Turbo 中也已更新;T2VA/I2VA 图最接近 FL2V 路径。
可用性
- 权重:lightx2v/Minimax-h3-Turbo 上的 Hugging Face(Apache-2.0),bf16 Diffusers 和 ComfyUI 格式
- 代码和工作流:ModelTC/Minimax-H3-Turbo 上的 GitHub
- 托管版:LightX2V Studio 在云端运行 Turbo 系列
评论
使用 GitHub 登录后即可参与讨论。