Anima-Light-Lavender: дообучение Anima под длинные промпты

ComfyUI Wikinews

Anima-Light-Lavender это дообучение Anima-Base v1.0, понимающее естественные промпты на 512 токенов и работающее в ComfyUI без изменений.

Anima-Light-Lavender (Hugging Face): дообученная версия Anima-Base v1.0, 2B-модели для аниме от Circlestone Labs. Johnny-Z опубликовал её 18 сентября. Архитектура базовой модели осталась нетронутой, поэтому новые веса заменяют исходный файл один к одному.

Anima-Base v1.0 в качестве нативного ввода принимает теги в стиле Danbooru. Anima-Light-Lavender движется в обратном направлении: она обучена на структурированных подписях с длинным полем image_description на естественном языке, и релиз сосредоточен на понимании описаний масштаба 512 токенов. Обучающий набор включает примерно 1,7 млн изображений Danbooru, размеченных и отфильтрованных конвейером данных: модели аннотирования, фильтрации и оценки предпочтений для него обучены самим автором, а не взяты готовыми.

Баннер с примерами Anima-Light-Lavender

Модель ориентирована на аниме-иллюстрации, персонажей и стилизованное искусство, и управляется описательными текстами, а не наборами тегов.

Что изменилось, а что нет

Anima-Light-Lavender
Базовая модельAnima-Base v1.0 (anima-base-v1.0.safetensors)
АрхитектураБез изменений: ~2 млрд параметров, 28-слойный DiT, слои не добавлены, дистилляция не применялась
Текстовый энкодерQwen3-0.6B (qwen_3_06b_base.safetensors)
VAEQwen-Image VAE (qwen_image_vae.safetensors)
Весаanima-light-lavender.safetensors (BF16) и anima-light-lavender_mxfp8.safetensors (MXFP8, более быстрый вывод)
Фокус обученияОписания на естественном языке масштаба 512 токенов плюс более качественные данные

Поскольку число слоёв, число параметров и структура файлов совпадают с базовой моделью, в существующем рабочем процессе Anima достаточно заменить checkpoint.

Установка в ComfyUI

  1. Поместите один файл весов в ComfyUI/models/diffusion_models/. Выберите либо версию BF16, либо MXFP8, но не обе сразу.
  2. Используйте текстовый энкодер и VAE из текущей установки Anima: qwen_3_06b_base.safetensors в ComfyUI/models/text_encoders/, qwen_image_vae.safetensors в ComfyUI/models/vae/.
  3. Установите сопутствующие ноды командой git clone https://github.com/aa0525/comfyui-zako-pe.git внутри ComfyUI/custom_nodes/, затем перезапустите ComfyUI.

Пакет comfyui-zako-pe добавляет два нода: Danbooru Caption JSON, который собирает структурированную подпись, и Danbooru Prompt Extend (OpenAI), который обращается к серверу, совместимому с OpenAI, чтобы развернуть image_description в стиле тегов в естественный язык. Сопутствующая модель zako-pe (ZAKO-V0.1) предназначена для локального выполнения такого развёртывания.

В релиз входят два рабочих процесса, оба загружаются перетаскиванием JSON на холст ComfyUI:

Оба по умолчанию используют веса MXFP8. Если вы установили файл BF16, переключите checkpoint в ноде Загрузить модель диффузии.

Промптинг со структурированной подписью

Модель обучена на подписи с фиксированным набором полей, где описание записывается связным текстом:

{
  "year": 2025,
  "preference_level": "best",
  "artist": [...],
  "copyright": [...],
  "character": [...],
  "image_description": "...",
  "extra_tags": [...]
}
ПолеНазначение
yearГодовой ориентир, по умолчанию 2025
preference_levelnormal, high, very_high или best (по умолчанию best)
artistТеги автора и стиля
copyrightТеги серии или франшизы
characterТеги персонажей
image_descriptionСодержимое изображения, записанное подробным текстом на естественном языке
extra_tagsДополнительные теги содержимого

Если писать длинный текст не хочется, базовый рабочий процесс принимает теги, а нод расширения промпта переписывает их. Альтернатива от автора: описать изображение и позволить модели сделать остальное. В примечаниях к релизу отмечено, что результаты остаются чистыми даже без слов качества и без негативного промпта.

Рекомендуемые настройки

ПараметрЗначение
СЭМПЛЕРeuler
Планировщикsimple
Шаги25
CFG4.0
РазрешениеОколо 1280×1280
Негативный промптОставить пустым

Детали обучения

Обучение проходило в BF16 с MXFP8 GEMM в матричных умножениях MLP и внимания, размер пакета 1024 и пиковая скорость обучения 4e-5. 2D-параметры MLP и внимания обновлялись с помощью Muon (импульс 0.95, match_rms_adamw), тогда как остальные параметры оставались на AdamW (β 0.9 / 0.95, ε 1e-8). Уровни preference_level в подписях получены от модели предпочтений, обученной примерно на 3 млн образцов, а обучающие данные охватывают период до конца ноября 2025 года.

Где модель не подходит: фотореализм вне области применения серии Anima, а отрисовка длинного текста (вывески, субтитры, многострочные предложения) ненадёжна. Отдельные слова и короткие фразы обычно получаются корректно.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Anima-Light-Lavender: дообучение Anima под длинные промпты | ComfyUI Wiki