MiniMax H3 Turbo LoRA v4:2 步音频视频生成
v4 600 步 Turbo LoRA 将 MiniMax H3 音频视频生成蒸馏至 2-3 步采样,已更新的 ComfyUI 节点支持剪枝 checkpoint,并附带工作流。
larryvrh 发布了 MiniMax H3 Turbo LoRA 的 v4 版本,少步数竞赛仍在加速:新的 minimax_h3_turbo_v4_step600_ema.safetensors checkpoint 原生即可在 3 步内渲染,社区测试更是跑通了 2 步生成,且音频保持干净(Hugging Face)。它取代了此前的 ckpt500 / ckpt850 文件,成为推荐的默认选择,微细节表现明显更好,早期 v1 系列过度锐化的"塑料感"也已完全解决。
Turbo LoRA 转换仓库中分享的示例输出(drbaph)
v4 的新特性
v4 版本采用全新的训练方案,而不仅仅是又一个步数。在 600 训练步下,它是 larryvrh 迄今发布的最强 checkpoint:
- 静态帧增强:对静态和小幅度运动内容的提升尤为显著
- 更细腻的微细节:面部、手指和精细纹理的呈现更加干净清晰
- 不再过度锐化:早期 v1(约 850)系列的塑料感已消失
唯一的权衡出现在 4 步且大幅快速运动的情况下,此时 v4 可能产生运动模糊 / 拖影。使用 6-8 步可基本消除该问题;对于 4 步加重度运动的特定情况,较旧的 v1(约 850)checkpoint 仍是更友好的选择。此外,v4 系列对更高步数的容忍度也优于 v1,后者在 strength 1.0 的高步数下容易过度锐化。
步数与设置
README 推荐 4-8 步(4 步为最低,6-8 步观感明显更好)、strength 1.0 以及 simple scheduler。MiniMax H3 Discord 社区的测试也得出了类似的甜点区间:0.6-0.8 strength 搭配 6-10 步,并已确认 2 步生成可正常工作且音频完整(视频输出略柔和)。训练仍在继续,音频和快速运动行为被标记为仍在改进的两个方面。
ComfyUI 用法
已更新的 ComfyUI-MiniMax-H3-Turbo 自定义节点现已覆盖所有基础模型:一个 LoRA 文件即可适用于完整的 bf16 / int8 checkpoint 以及剪枝的曲线形式变体。节点会自动检测剪枝基础模型,并在运行时重新注入时间条件。low_vram 开关会将 LoRA 合并进权重,以获得最低的峰值 VRAM;随附的 MiniMax-H3 Turbo Sampler 会自动适配你的 ComfyUI 版本(最近的构建版本可通过 ModelSamplingAV 原生处理视频/音频双流程调度,旧版本则使用节点自身的路径)。
节点仓库中附带了一个现成的文生视频工作流:
剪枝 checkpoint(drbaph)
针对 ComfyUI 内置的 MiniMax-H3 LoRA 加载器,drbaph 在 MiniMax-H3-Turbo-Lora-ComfyUI 发布了 v4 权重的剪枝模型转换版本:minimax_h3_turbo_v4_step600_ema_pruned_comfyui.safetensors(推荐)以及非 EMA 变体,并附带示例工作流(fl_minimax_h3_turbo_lora_example_workflow.json)。他推荐的起始配置为 6-8 步、Euler sampler、Beta scheduler、strength 1.0。
推荐 v4 600 步 EMA 工作流的演示输出,由 drbaph 分享
获取方式
- 权重: larryvrh/MiniMax-H3-Turbo-Lora:
minimax_h3_turbo_v4_step600_ema.safetensors(推荐)、minimax_h3_turbo_v4_step600.safetensors,以及更早的 v4 / v1 checkpoint - 自定义节点: Larryvrh/ComfyUI-MiniMax-H3-Turbo(可通过 ComfyUI-Manager 安装,搜索 "MiniMax-H3 Turbo")
- 剪枝转换版本: drbaph/MiniMax-H3-Turbo-Lora-ComfyUI
评论
使用 GitHub 登录后即可参与讨论。