Fizgig v6.5:用自定义适配器训练 Qwen Image 2.1 LoRA

ComfyUI Wikinews

Fizgig v6.5 新增 Qwen Image 2.1 的 LoRA 与 LoKR 训练,搭载工作室自研的训练适配器、turbo 预览和全新驱动系统,保存的 LoRA 可直接被 ComfyUI 加载。

Fizgig v6.5.0 于 9 月 27 日发布,让 Qwen Image 2.1 成为工作室中可训练的基础模型(GitHub | 发布说明 | Qwen Image 2.1 指南)。Fizgig 此前已能为 Flux 2 Klein、Krea 2 和 MiniMax H3 训练 LoRA、LoKR 以及完整微调。本次发布将同一套工具带到了 Qwen 的图像模型上,而 Qwen Image 2.1 也是首个通过工作室全新驱动系统加入的模型。

Fizgig LoRA 与微调工作室

Fizgig:面向 Flux 2 Klein 9B、Krea 2、MiniMax H3,如今还有 Qwen Image 2.1 的训练、微调、修复与探索工作台

Qwen Image 2.1 训练都包含什么

  • LoRA 或 LoKR 训练,支持 Adaptive LR 或 Automagic、EMA、Context LoRA,以及暂停与恢复。
  • 训练过程中的 turbo 预览,由 Viggle 的 6 步 turbo LoRA 驱动。Fizgig 默认以低于满强度的方式运行它,即 0.7 强度、10 步,因为在自身测试中发现这比 turbo 默认的 6 步满强度效果更好。
  • 逐图像损失监控:问题图像检测、逐图像学习率、异常值预热,以及使用 Captions 标签页所用的同一个 Qwen3-VL 字幕器自动重新为卡住的图像生成字幕。
  • 运行过程中的实时样本覆盖面板。
  • 全部五个工作台工具:Repair Studio、LoRA the Explorer、Profiler、Extract 和 LoRA Royale。

保存的 LoRA、LoKR、Repair Studio 保存结果和 Extract 输出均通过 ComfyUI 的标准 LoRA 加载器加载。

Fizgig 自有的训练适配器

Qwen 2.1 的 LoRA 常常会崩塌成纹理,或在训练途中出现抖动,而更低的 loss 并不会提醒你这件事正在发生。Fizgig 的解决办法是一个训练适配器:一个小型 LoRA,在你训练时保持冻结并处于激活状态,在预览时被关闭,并且永远不会进入你保存的 LoRA 中,因此成果在原始模型上同样可用。它以比现有 Qwen 2.1 训练助手更高的分辨率训练而成,作者报告说,用它训练出的 LoRA 不仅避免了崩塌,成品也锐利得多。它在所有 Qwen 预设中都默认开启,同时也在 Hugging Face 上发布,供任何训练器使用。

三个预设,一个最佳平衡点

三个预设都在 0.5 MP 下以 adamw8bit、EMA 0.98 和训练适配器训练 30 个 epoch,并每个 epoch 都保存:

预设Rank学习率适用场景
Qwen 2.1 Fast(默认)8Adaptive LR 2e-4 至 4e-4大多数主体。在作者的测试中最快达到相似的样貌,也最擅长保留皮肤细节。
Qwen 2.1 Standard16Adaptive LR 1e-4 至 2e-4更大或混合的数据集。Rank 16 若用 Fast 预设的学习率会过拟合。
Qwen 2.1 Style16固定 1.5e-4风格。Adaptive LR 在风格数据集上容易不断攀升,而风格正是在这里被烤过头。

采用更快训练速度的理由是:Qwen 开箱即能渲染非常锐利的图像,而 LoRA 会把皮肤纹理这类精细细节拉向你的数据集,因此在偏柔的照片上长时间训练,等于用 Qwen 的锐度去换取它们的柔度。0.5 MP 即五十万像素,方形图像约为 704×704,Fizgig 在该像素量下按形状为每张图像分桶:4:5 为 624×784,2:3 为 576×848,9:16 为 528×928。保存的各个 epoch 在 LoRA Royale 中仍可逐一切换查看,所以如果靠后的某个 epoch 看起来更柔,更早的那个往往才是更好的选择。

显存最低 10 GB 也能跑

基础精度和块交换大小会根据你的空闲 VRAM 自动决定。Auto 在 24 GB 及以上选 bf16,12 至 16 GB 选 INT8,10 GB 时选 4-bit NF4,这也是 Qwen Image 2.1 的下限;空闲显存低于约 20 GB 时,文本编码器会量化到 8-bit,这个阈值正是下限的来源。在作者的测试中,限制到 12 GB 的 RTX 5090 使用 INT8 训练,峰值 9.9 GB(含预览);限制到 10 GB 时使用 NF4 训练,峰值 7.3 GB。

驱动系统

Qwen Image 2.1 是首个通过 Fizgig 全新驱动系统加入的模型:一个模型只需描述一次,包括它的文件、LoRA 格式和置于标准接口之后的模型代码,训练、预览、下载、内存规划和全部五个工作台工具都基于这份描述工作。关于该系统的指南,以及添加更多模型的开放 pull request,预计将在下周公布。

如何获取

在 Preferences 标签页的 Qwen Image 2.1 区域点击 Download models for me,即可获取 DiT、VAE、文本编码器、训练适配器和 turbo LoRA(约 34 GB),如果你还没有 Qwen3-VL 字幕器也会一并获取,然后在 Training 标签页把基础模型选为 Qwen Image 2.1。Qwen Image 2.1 的编辑训练功能标注为即将推出。

Fizgig 是独立的训练器,不是 ComfyUI 节点:它保存 kohya 格式的 .safetensors LoRA,可直接放入 ComfyUI/models/loras/。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Fizgig v6.5:用自定义适配器训练 Qwen Image 2.1 LoRA | ComfyUI Wiki