Anima-Light-Lavender:面向长自然语言提示词的 Anima 后训练模型

ComfyUI Wikinews

Anima-Light-Lavender 是 Anima-Base v1.0 的后训练版本,可读取 512 token 的自然语言描述,提供 BF16 与 MXFP8 权重,并能原样放入 ComfyUI 使用。

Anima-Light-Lavender(Hugging Face)是 Anima-Base v1.0 的后训练模型,后者是来自 Circlestone Labs 的 2B 动漫模型。Johnny-Z 于 9 月 18 日发布了它,它完整保留了基础模型的架构,因此可以逐个文件替换上游权重。

Anima-Base v1.0 以 Danbooru 风格标签作为原生输入。Anima-Light-Lavender 走的是另一个方向:它基于带有长自然语言 image_description 字段的结构化描述进行训练,本次发布重点在于理解 512 token 规模的描述。训练集约为 170 万张 Danbooru 图像,由一套数据处理流程完成标注与筛选,该流程所用的标注、筛选和偏好判断模型全部由作者自行训练,而非直接采用现成方案。

Anima-Light-Lavender 示例横幅

该模型面向动漫插画、角色与风格化艺术,由描述性段落驱动,而非标签堆叠。

有哪些变化,哪些没有变

Anima-Light-Lavender
基础模型Anima-Base v1.0(anima-base-v1.0.safetensors)
架构未改变:约 2B 参数,28 层 DiT,未增加层,也未做蒸馏
文本编码器Qwen3-0.6B(qwen_3_06b_base.safetensors)
VAEQwen-Image VAE(qwen_image_vae.safetensors)
权重anima-light-lavender.safetensors(BF16)和 anima-light-lavender_mxfp8.safetensors(MXFP8,推理更快)
训练重点512 token 规模的自然语言描述,以及更高质量的数据

由于层数、参数数量和文件布局都与基础模型一致,现有的 Anima 工作流只需替换其 checkpoint 即可。

在 ComfyUI 中安装

  1. 将一个权重文件放入 ComfyUI/models/diffusion_models/。请在 BF16 或 MXFP8 版本中二选一,不要两个都放。
  2. 复用你当前 Anima 环境中的文本编码器和 VAE:将 qwen_3_06b_base.safetensors 放入 ComfyUI/models/text_encoders/,将 qwen_image_vae.safetensors 放入 ComfyUI/models/vae/。
  3. 在 ComfyUI/custom_nodes/ 中执行 git clone https://github.com/aa0525/comfyui-zako-pe.git 安装配套节点,然后重新启动 ComfyUI。

comfyui-zako-pe 节点包新增了两个节点:Danbooru Caption JSON,用于组装结构化描述;以及 Danbooru Prompt Extend (OpenAI),用于调用兼容 OpenAI 的服务器,将标签风格的 image_description 扩展为自然语言。配套模型 zako-pe(ZAKO-V0.1)则用于在本地完成这一扩展。

本次发布附带两个工作流,二者都可通过把 JSON 拖拽到 ComfyUI 画布上加载:

两者默认都使用 MXFP8 权重。如果你安装的是 BF16 文件,请在 UNet加载器 节点中切换 checkpoint。

使用结构化描述进行提示

该模型基于固定字段的描述进行训练,其中描述内容以散文形式写出:

{
  "year": 2025,
  "preference_level": "best",
  "artist": [...],
  "copyright": [...],
  "character": [...],
  "image_description": "...",
  "extra_tags": [...]
}
字段用途
year年份锚点,默认 2025
preference_levelnormal、high、very_high 或 best(默认 best)
artist画师与风格标签
copyright系列或作品标签
character角色标签
image_description图像内容,以详细自然语言段落写出
extra_tags补充内容标签

如果你不想撰写长段落,基础工作流可以接受标签,并由提示词扩展节点将其改写。作者本人给出的另一种做法是:描述图像内容,其余交给模型完成。发布说明指出,即使不使用质量词或负面提示词,结果依然干净。

推荐设置

参数取值
采样器euler
调度器simple
步数25
CFG4.0
分辨率约 1280×1280
负面提示词留空

训练详情

训练以 BF16 运行,并在 MLP 与注意力的矩阵乘法中使用 MXFP8 GEMM,批处理大小为 1024,峰值学习率为 4e-5。MLP 与注意力的 2D 参数由 Muon 更新(动量 0.95、match_rms_adamw),其余参数则继续使用 AdamW(β 0.9 / 0.95,ε 1e-8)。描述的 preference_level 分层来自一个基于约 300 万样本训练的偏好模型,训练数据截止到 2025 年 11 月底。

不适用场景:照片写实不在 Anima 系列的能力范围内,长文本渲染(招牌、字幕、多行句子)也不可靠。单个词和短语通常能够正确生成。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Anima-Light-Lavender:面向长自然语言提示词的 Anima 后训练模型 | ComfyUI Wiki