MiniMax H3 Turbo LoRA:面向 ComfyUI 的 4 步 FL2V 蒸馏

ComfyUI Wikinews

Lightx2v 与 ModelTC 将 MiniMax H3 蒸馏为 4 步 FL2V Turbo LoRA,将采样步数从约 20 步降至 4 步,并提供 ComfyUI 转换与演示 Spaces。

Lightx2v 团队与 ModelTC 发布了面向 MiniMax H3 的 4 步 Turbo LoRA,将视频模型的首尾帧生视频(FL2V)生成从约 20 步采样缩减至 4 步(Hugging FaceGitHub)。该 LoRA 约 1.3 GB,属于早期预览:v0.1 专注于 FL2V 质量,Ref2V 蒸馏已列入路线图。

MiniMax H3 Turbo LoRA 示例帧

作者在 4 步采样下的示例输出帧

发布内容

  • 权重:Hugging Face 上的 minimax_h3_fl2v_turbo_4step_v0.1.safetensors,从 MiniMax-H3 基础模型蒸馏而来
  • 推理代码:ModelTC 仓库提供批处理 MiniMax-H3 推理,以及与基础模型在 50 NFE 下的 NFE/LoRA 对比
  • 演示 Spacesakhaliq 的 MiniMax-H3-Turbo-Lora Space官方组织 Space 让你无需本地硬件即可试用该 LoRA
  • 路线图:改进 FL2V 的视觉细节与整体质量,随后开发基于 Ref2V 的蒸馏

发布说明将 v0.1 标记为预览版:视觉细节仍有待改进,更新版本正在开发中。

ComfyUI 使用方法

ComfyUI 使用此 LoRA 无需自定义节点。Kijai 在发布后一小时内于 Kijai/MiniMax-H3_comfy 发布了与 ComfyUI 兼容的转换版本(minimax_h3_fl2v_lightx2v_turbo_4step_v0.1_comfy.safetensors,另附调整尺寸后的 bf16 变体)。将文件放入 models/loras/,加载基础 H3 checkpoint,然后按照 Kijai 的测试说明,使用 er_sdesa_solver 采样器以 0.75 强度配合 4 步 应用 LoRA。

官方 MiniMax H3 文生视频工作流模板 是一个不错的起点;在模型加载器与采样器之间插入 Turbo LoRA,并切换到上述 4 步设置。

注意:作者观察到 Diffusers 与 ComfyUI 的推理结果存在一些差异(Diffusers 中的音频听起来更自然)。ComfyUI 路径中的音频 bug 已在一次每夜更新中修复。如需复现与论文一致的结果,请遵循 ModelTC 推理脚本

作者在发布讨论中分享的示例输出

获取方式

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 Turbo LoRA:面向 ComfyUI 的 4 步 FL2V 蒸馏 | ComfyUI Wiki