Supra2-IMG:10 小时训练完成的 1 亿参数文生图模型

ComfyUI Wikinews

SupraLabs 发布 Supra2-IMG:一个 1.05 亿参数的 DiT 文生图模型,在单张 H100 上从零开始训练仅用 10 小时,样本分辨率为 256x256。

SupraLabs 发布了 Supra2-IMG,一个用于文生图的 1.05 亿参数扩散 transformer。它在单张 H100 上从零开始训练了 10 小时,作者称其结果是该参数预算下的当前最佳水平。
Supra2-IMG:一个 1 亿参数的文生图模型

来自模型仓库的 Supra2-IMG 官方横幅。

它是什么

Supra2-IMG 是一个极小的 DiT:1.041 亿参数,基于 128 个 token 的 Flan-T5 条件生成 256x256 图像。文本条件来自冻结的 Flan-T5-Base 编码器,Latent 由 SD-VAE-FT-MSE 解码,因此这两个组件都从各自的仓库获取,而不是打包在 checkpoint 中。

组件
参数1.041 亿(D_MODEL 576,深度 14,9 个注意力头,头维度 64,MLP 比例 4.0)
分辨率256x256(32x32 Latent,补丁大小 2)
文本编码器Flan-T5-Base,冻结,128 token 上下文
VAESD-VAE-FT-MSE
Checkpointmodel_final_ema.pt

SupraLabs 是 1 亿参数 Supra2 语言模型背后的独立实验室,Supra2-IMG 将同样的"小规模、从零开始训练"思路应用到图像生成上。该模型以原始 PyTorch 代码加权重的方式发布:inference.pyconfig.jsonmodel_final_ema.pt

训练

这次训练刻意保持克制,而这正是本次发布的意义所在:

  • 数据集:在完整的 LucasFang/FLUX-Reason-6M 数据集上训练 10 个 epoch,准备完成后共 560 万张图像
  • Caption 选择:每张图像按 caption_compositioncaption_entitycaption_textcaption_stylecaption_imaginative 的顺序取第一个可用的 caption,为每个样本保留质量最高的标注。
  • 硬件:RunPod 上的一张 Nvidia H100 SXM 80GB,包含数据准备在内共 9 小时,使用 2.5TB 磁盘。

由于整个模型只有几百兆字节,它非常适合作为研究小规模预训练以及微调实验的基础,而在 8B 规模下这些实验会昂贵得多。

样本

Supra2-IMG 样本

来自模型仓库的官方样本,全部使用推荐设置生成,而非精挑细选的运行结果。

Supra2-IMG 示例输出

由随附推理脚本生成的 256x256 示例输出。

可用性

目前没有 ComfyUI 支持:Supra2-IMG 是纯 PyTorch 发布版本,采用自定义的 SupraDiT 架构,因此它不是 diffusers pipeline,官方也没有发布 ComfyUI 模板或节点。运行它需要使用随附脚本加上两个外部组件:

wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py
python inference.py --prompt "a sea jellyfish floating in the pitch-black ocean depths" \
  --seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png

推荐的采样设置为种子 0、CFG 3.050 步。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Supra2-IMG:10 小时训练完成的 1 亿参数文生图模型 | ComfyUI Wiki