Fizgig v5 全量微调:在 16 GB 显存上训练 MiniMax H3 和 Krea 2 模型
Fizgig v5.0.0 带来 MiniMax H3 33B 和 Krea 2 12.9B 基础模型的全量微调,支持低至 16 GB 显存的消费级 GPU,并包含用于 ComfyUI 的 Checkpoint 转 LoRA 导出器。
Fizgig v5.0.0 于 8 月 29 日发布,支持在单个消费级 GPU 上对 MiniMax H3 (33B) 和 Krea 2 (12.9B) 基础模型 进行全量微调,最低仅需 16 GB 显存 (GitHub | 发布说明,Apache-2.0)。在此之前,每次 Fizgig 运行都是在冻结模型上训练 LoRA 适配器。此版本训练模型本身:全秩权重更新,无适配器且无秩瓶颈,使用旋转可训练窗口覆盖 4-bit NF4 冻结基础,并将 bf16 主副本保存在系统 RAM 中。
Fizgig:MiniMax H3、Krea 2 和 Flux 2 Klein 9B 的训练、微调、修复和探索工作台
你的显卡可以微调的内容
| 显存 | Krea 2 图片 | H3 图片 | H3 语音 | H3 视频(已确认) | H3 视频在相似性块上(预期) |
|---|---|---|---|---|---|
| 16 GB | 是 | 是 | 是 | 最高 2.3 秒 | 最高 3.8 秒 |
| 24 GB | 是 | 是 | 是 | 最高 2.3 秒 | 最高 5.2 秒 |
| 32 GB | 是 | 是 | 是 | 最高 3.8 秒 | 最高 5.2 秒 |
所有已确认的数字均来自实测运行,而非估算:16 GB 显卡上 H3 的峰值为 8.8 至 12.3 GB,Krea 2 为 8.4 至 11.0 GB。12 GB 显卡仅能训练 LoRA;16 GB 才是微调门槛。开发者有两个注意事项:目前微调尚未在 AMD/ROCm 上测试,且 Krea 2 微调实际需要 48 GB 或更多的系统 RAM,因为其约 24 GB 的主副本保存在 RAM 中。
33B 微调如何适配 16 GB
MiniMax H3 的 33B 参数的朴素全量微调大约需要 200 GB 内存。Fizgig 让可训练窗口在模型中旋转:每个权重在一个完整周期内训练,但梯度和优化器状态仅存在于活动切片中。模型其余冻结部分以 4-bit 形式保存在卡上,保存的 Checkpoint 从从未经过量化器的主副本中以 bf16 写入,因此输出是纯净的全精度微调。
一个概念解释了默认值:一个 epoch 训练模型的一个切片。可训练窗口每个 epoch 旋转,因此通常需要 4 个 epoch 的完整周期才能让模型的每一部分训练一次。这就是为什么 epoch 默认值看起来很高,以及为什么 Checkpoint 在周期边界保存。
学习率比 LoRA 训练中更重要
发布说明称这是唯一需要尊重的数字:微调需要的学习率远低于 LoRA 训练。勾选微调设置对两个系列都设定了安全的 1e-5。在 MiniMax H3 上,3e-5 是测试过的更快速率,也是你应使用的最大值;1e-4 会破坏 H3 微调。在 Krea 2 上你可以尝试高达 1e-4,但结果在更低时更佳。
用于 ComfyUI 的 Checkpoint 转 LoRA 导出
内置的 Checkpoint 转 LoRA 工具将你的微调与基础模型进行差异比较,并提取任何秩的普通、可分享 LoRA。在开发者的测试中,秩 64 提取在感知上与完整 Checkpoint 无法区分,且文件 ComfyUI 已正常加载。你也可以保留完整 Checkpoint 并在偏好设置中将其设为家族基础,然后在你的微调模型之上训练 LoRA。
.safetensors 文件,可直接放入 ComfyUI/models/loras/。全量微调功能标记为实验性,目前仅限 NVIDIA。
评论
使用 GitHub 登录后即可参与讨论。