MiniMax H3 Turbo LoRA v4:2 步音频视频生成

ComfyUI Wikinews

v4 600 步 Turbo LoRA 将 MiniMax H3 音频视频生成蒸馏至 2-3 步采样,已更新的 ComfyUI 节点支持剪枝 checkpoint,并附带工作流。

larryvrh 发布了 MiniMax H3 Turbo LoRA 的 v4 版本,少步数竞赛仍在加速:新的 minimax_h3_turbo_v4_step600_ema.safetensors checkpoint 原生即可在 3 步内渲染,社区测试更是跑通了 2 步生成,且音频保持干净(Hugging Face)。它取代了此前的 ckpt500 / ckpt850 文件,成为推荐的默认选择,微细节表现明显更好,早期 v1 系列过度锐化的"塑料感"也已完全解决。

MiniMax H3 Turbo LoRA v4 示例帧

Turbo LoRA 转换仓库中分享的示例输出(drbaph)

v4 的新特性

v4 版本采用全新的训练方案,而不仅仅是又一个步数。在 600 训练步下,它是 larryvrh 迄今发布的最强 checkpoint:

  • 静态帧增强:对静态和小幅度运动内容的提升尤为显著
  • 更细腻的微细节:面部、手指和精细纹理的呈现更加干净清晰
  • 不再过度锐化:早期 v1(约 850)系列的塑料感已消失

唯一的权衡出现在 4 步且大幅快速运动的情况下,此时 v4 可能产生运动模糊 / 拖影。使用 6-8 步可基本消除该问题;对于 4 步加重度运动的特定情况,较旧的 v1(约 850)checkpoint 仍是更友好的选择。此外,v4 系列对更高步数的容忍度也优于 v1,后者在 strength 1.0 的高步数下容易过度锐化。

步数与设置

README 推荐 4-8 步(4 步为最低,6-8 步观感明显更好)、strength 1.0 以及 simple scheduler。MiniMax H3 Discord 社区的测试也得出了类似的甜点区间:0.6-0.8 strength 搭配 6-10 步,并已确认 2 步生成可正常工作且音频完整(视频输出略柔和)。训练仍在继续,音频和快速运动行为被标记为仍在改进的两个方面。

ComfyUI 用法

已更新的 ComfyUI-MiniMax-H3-Turbo 自定义节点现已覆盖所有基础模型:一个 LoRA 文件即可适用于完整的 bf16 / int8 checkpoint 以及剪枝的曲线形式变体。节点会自动检测剪枝基础模型,并在运行时重新注入时间条件。low_vram 开关会将 LoRA 合并进权重,以获得最低的峰值 VRAM;随附的 MiniMax-H3 Turbo Sampler 会自动适配你的 ComfyUI 版本(最近的构建版本可通过 ModelSamplingAV 原生处理视频/音频双流程调度,旧版本则使用节点自身的路径)。

节点仓库中附带了一个现成的文生视频工作流:

剪枝 checkpoint(drbaph)

针对 ComfyUI 内置的 MiniMax-H3 LoRA 加载器,drbaph 在 MiniMax-H3-Turbo-Lora-ComfyUI 发布了 v4 权重的剪枝模型转换版本:minimax_h3_turbo_v4_step600_ema_pruned_comfyui.safetensors(推荐)以及非 EMA 变体,并附带示例工作流(fl_minimax_h3_turbo_lora_example_workflow.json)。他推荐的起始配置为 6-8 步、Euler sampler、Beta scheduler、strength 1.0

推荐 v4 600 步 EMA 工作流的演示输出,由 drbaph 分享

获取方式

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 Turbo LoRA v4:2 步音频视频生成 | ComfyUI Wiki