Anima-Light-Lavender: 長い自然言語プロンプト向けのAnimaポストトレイン

ComfyUI Wikinews

Anima-Light-LavenderはAnima-Base v1.0のポストトレインで、512トークンの自然言語キャプションを読み取り、BF16とMXFP8の重みを提供し、ComfyUIにそのまま導入できます。

Anima-Light-Lavender(Hugging Face)は、Circlestone Labsの2BアニメモデルであるAnima-Base v1.0のポストトレインです。Johnny-Zが9月18日に公開したもので、ベースモデルのアーキテクチャをそのまま維持しているため、アップストリームの重みファイルをファイル単位で置き換えられます。

Anima-Base v1.0はDanbooru形式のタグをネイティブ入力とします。Anima-Light-Lavenderは逆方向に進みます。長い自然言語のimage_descriptionフィールドを持つ構造化キャプションでトレーニングされており、このリリースは512トークン規模の説明の理解に焦点を当てています。トレーニングセットは約170万枚のDanbooru画像で、その注釈付けとフィルタリングは、アノテーション・フィルタリング・選好判定の各モデルを既製品ではなくすべて作者自身がトレーニングしたデータパイプラインによって行われています。

Anima-Light-Lavender サンプルバナー

このモデルはアニメイラスト、キャラクター、スタイライズドアートを対象とし、タグの羅列ではなく説明的な文章によって駆動されます。

変更された点と、変更されていない点

Anima-Light-Lavender
ベースモデルAnima-Base v1.0(anima-base-v1.0.safetensors)
アーキテクチャ変更なし: 約2Bパラメータ、28層DiT、レイヤー追加なし、蒸留なし
テキストエンコーダQwen3-0.6B(qwen_3_06b_base.safetensors)
VAEQwen-Image VAE(qwen_image_vae.safetensors)
重みanima-light-lavender.safetensors(BF16)と anima-light-lavender_mxfp8.safetensors(MXFP8、推論が高速)
トレーニングの焦点512トークン規模の自然言語による説明、およびより高品質なデータ

レイヤー数、パラメータ数、ファイル構成がベースモデルと一致しているため、既存のAnimaワークフローはチェックポイントを差し替えるだけで済みます。

ComfyUIへのインストール

  1. 重みファイルを1つ ComfyUI/models/diffusion_models/ に配置します。BF16版かMXFP8版のどちらか一方を選び、両方は入れないでください。
  2. 現在のAnima環境のテキストエンコーダとVAEを再利用します。qwen_3_06b_base.safetensors を ComfyUI/models/text_encoders/ に、qwen_image_vae.safetensors を ComfyUI/models/vae/ に置きます。
  3. コンパニオンノードをインストールします。ComfyUI/custom_nodes/ 内で git clone https://github.com/aa0525/comfyui-zako-pe.git を実行し、ComfyUIを再起動します。

comfyui-zako-peパックは2つのノードを追加します。構造化キャプションを組み立てる Danbooru Caption JSON と、OpenAI互換サーバーを呼び出してタグ形式の image_description を自然言語に展開する Danbooru Prompt Extend (OpenAI) です。コンパニオンモデル zako-pe(ZAKO-V0.1)は、その展開をローカルで処理するために設計されています。

このリリースには2つのワークフローが含まれており、どちらもJSONをComfyUIのキャンバスにドラッグするだけで読み込めます:

どちらもデフォルトでMXFP8の重みを使用します。代わりにBF16ファイルをインストールした場合は、Load Diffusion Model(拡散モデルを読み込む)ノードでチェックポイントを切り替えてください。

構造化キャプションを使ったプロンプト作成

モデルは固定フィールドのキャプションでトレーニングされており、説明は文章として記述されます:

{
  "year": 2025,
  "preference_level": "best",
  "artist": [...],
  "copyright": [...],
  "character": [...],
  "image_description": "...",
  "extra_tags": [...]
}
フィールド目的
year年のアンカー、デフォルトは 2025
preference_levelnormal、high、very_high、best(デフォルトは best)
artistアーティストとスタイルのタグ
copyrightシリーズまたはフランチャイズのタグ
characterキャラクターのタグ
image_description画像の内容を、詳細な自然言語の文章として記述
extra_tags補足のコンテンツタグ

長い文章を書くのが好みでない場合、基本ワークフローはタグを受け付け、プロンプト展開ノードにそれらを書き換えさせます。作者自身が挙げているもう一つの方法は、画像を説明して残りをモデルに任せるというものです。このリリースでは、品質ワードやネガティブプロンプトなしでも結果がクリーンに保たれることが報告されています。

推奨設定

パラメータ値
サンプラーeuler
スケジューラsimple
ステップ数25
CFG4.0
解像度約1280×1280
ネガティブプロンプト空のまま

トレーニングの詳細

トレーニングはBF16で実行され、MLPとアテンションの行列積にはMXFP8 GEMMを使用し、バッチサイズは1024、ピーク学習率は4e-5でした。MLPとアテンションの2DパラメータはMuon(momentum 0.95、match_rms_adamw)で更新され、残りのパラメータはAdamW(β 0.9 / 0.95、ε 1e-8)のままでした。キャプションのpreference_level階層は、約300万サンプルでトレーニングされた選好モデルに由来し、トレーニングデータは2025年11月末までのものを対象としています。

適合しない領域: フォトリアリズムはAnimaシリーズの対象外であり、長いテキストの描画(看板、字幕、複数行の文章)は信頼できません。単語1つや短いフレーズは通常正しく出力されます。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Anima-Light-Lavender: 長い自然言語プロンプト向けのAnimaポストトレイン | ComfyUI Wiki