LLaDA-Image: InclusionAIの6B画像生成・編集モデル

ComfyUI Wiki

LLaDA-Imageは、テキストから画像への生成とネイティブな指示編集に対応したInclusionAIのオープンな6Bモデルです。4ステップのTurbo版とコミュニティ製のComfyUIノードパックも利用できます。

L

LLaDA-Image

Text-to-ImageImage Editing6BText Rendering

InclusionAI(Ant Group)によるオープンな6B統合画像モデル。1つのcheckpointでテキストから画像への生成と、ネイティブな指示に基づく編集の両方を処理し、中国語と英語のバイリンガルテキスト描画に対応、トレーニングレシピも公開されています。LLaDA-Image Turboはパイプラインを2〜4サンプリングステップに蒸留したものです。

LLaDA-Imageは統合型のdiffusionモデルで、backboneとDiTの両方が単一のフレームワークでトレーニングされたdiffusionモデルです。テキストから画像への生成モデルに編集用のアドオンを後付けするのではなく、1つのcheckpointが生成、参照を保持した指示に基づく編集、そしてSigVQ条件付けモジュールによるVQ条件付き生成をカバーします。

Qwen-Image-Benchでは英語で53.53、中国語で53.38を記録し、公開時点でオープンな6Bモデルとして総合的に最先端の結果を達成しています。トレーニングレシピの全体は、付属のarXiv報告で文書化されています。

モデル

モデルステップ説明ライセンス公開日
LLaDA-Image Turbo2-4ComfyUI向けにパッケージ化されたTwin-DMD蒸留版(BF16 / INT8)Apache-2.02026-09-04

上記のモデルを選択すると、厳選された重みのダウンロード、チュートリアル、関連情報を確認できます。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…