Anima-Light-Lavender: дообучение Anima под длинные промпты
Anima-Light-Lavender это дообучение Anima-Base v1.0, понимающее естественные промпты на 512 токенов и работающее в ComfyUI без изменений.
Anima-Base v1.0 в качестве нативного ввода принимает теги в стиле Danbooru. Anima-Light-Lavender движется в обратном направлении: она обучена на структурированных подписях с длинным полем image_description на естественном языке, и релиз сосредоточен на понимании описаний масштаба 512 токенов. Обучающий набор включает примерно 1,7 млн изображений Danbooru, размеченных и отфильтрованных конвейером данных: модели аннотирования, фильтрации и оценки предпочтений для него обучены самим автором, а не взяты готовыми.
Модель ориентирована на аниме-иллюстрации, персонажей и стилизованное искусство, и управляется описательными текстами, а не наборами тегов.
Что изменилось, а что нет
| Anima-Light-Lavender | |
|---|---|
| Базовая модель | Anima-Base v1.0 (anima-base-v1.0.safetensors) |
| Архитектура | Без изменений: ~2 млрд параметров, 28-слойный DiT, слои не добавлены, дистилляция не применялась |
| Текстовый энкодер | Qwen3-0.6B (qwen_3_06b_base.safetensors) |
| VAE | Qwen-Image VAE (qwen_image_vae.safetensors) |
| Веса | anima-light-lavender.safetensors (BF16) и anima-light-lavender_mxfp8.safetensors (MXFP8, более быстрый вывод) |
| Фокус обучения | Описания на естественном языке масштаба 512 токенов плюс более качественные данные |
Поскольку число слоёв, число параметров и структура файлов совпадают с базовой моделью, в существующем рабочем процессе Anima достаточно заменить checkpoint.
Установка в ComfyUI
- Поместите один файл весов в
ComfyUI/models/diffusion_models/. Выберите либо версию BF16, либо MXFP8, но не обе сразу. - Используйте текстовый энкодер и VAE из текущей установки Anima:
qwen_3_06b_base.safetensorsвComfyUI/models/text_encoders/,qwen_image_vae.safetensorsвComfyUI/models/vae/. - Установите сопутствующие ноды командой
git clone https://github.com/aa0525/comfyui-zako-pe.gitвнутриComfyUI/custom_nodes/, затем перезапустите ComfyUI.
Пакет comfyui-zako-pe добавляет два нода: Danbooru Caption JSON, который собирает структурированную подпись, и Danbooru Prompt Extend (OpenAI), который обращается к серверу, совместимому с OpenAI, чтобы развернуть image_description в стиле тегов в естественный язык. Сопутствующая модель zako-pe (ZAKO-V0.1) предназначена для локального выполнения такого развёртывания.
В релиз входят два рабочих процесса, оба загружаются перетаскиванием JSON на холст ComfyUI:
Оба по умолчанию используют веса MXFP8. Если вы установили файл BF16, переключите checkpoint в ноде Загрузить модель диффузии.
Промптинг со структурированной подписью
Модель обучена на подписи с фиксированным набором полей, где описание записывается связным текстом:
{
"year": 2025,
"preference_level": "best",
"artist": [...],
"copyright": [...],
"character": [...],
"image_description": "...",
"extra_tags": [...]
}| Поле | Назначение |
|---|---|
year | Годовой ориентир, по умолчанию 2025 |
preference_level | normal, high, very_high или best (по умолчанию best) |
artist | Теги автора и стиля |
copyright | Теги серии или франшизы |
character | Теги персонажей |
image_description | Содержимое изображения, записанное подробным текстом на естественном языке |
extra_tags | Дополнительные теги содержимого |
Если писать длинный текст не хочется, базовый рабочий процесс принимает теги, а нод расширения промпта переписывает их. Альтернатива от автора: описать изображение и позволить модели сделать остальное. В примечаниях к релизу отмечено, что результаты остаются чистыми даже без слов качества и без негативного промпта.
Рекомендуемые настройки
| Параметр | Значение |
|---|---|
| СЭМПЛЕР | euler |
| Планировщик | simple |
| Шаги | 25 |
| CFG | 4.0 |
| Разрешение | Около 1280×1280 |
| Негативный промпт | Оставить пустым |
Детали обучения
Обучение проходило в BF16 с MXFP8 GEMM в матричных умножениях MLP и внимания, размер пакета 1024 и пиковая скорость обучения 4e-5. 2D-параметры MLP и внимания обновлялись с помощью Muon (импульс 0.95, match_rms_adamw), тогда как остальные параметры оставались на AdamW (β 0.9 / 0.95, ε 1e-8). Уровни preference_level в подписях получены от модели предпочтений, обученной примерно на 3 млн образцов, а обучающие данные охватывают период до конца ноября 2025 года.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.