LLaDA-Image:InclusionAI 开源 6B 图像生成与编辑模型

ComfyUI Wikinews

InclusionAI 发布 LLaDA-Image,一款 6B 统一生成与编辑模型,含 4 步 Turbo 变体,以及支持 INT8 和 GGUF 权重的社区 ComfyUI 节点包。

LLaDA-Image (GitHub, Hugging Face) 是 InclusionAI(Ling 背后的蚂蚁集团团队)发布的 6B 参数统一图像生成与编辑模型家族,于 9 月 4 日以 Apache-2.0 协议发布,并附带完整的开源训练配方。社区 ComfyUI 节点包 由 RebelAI 开发,现已支持本地运行。
LLaDA-Image 照片级真实感生成展示

官方仓库中的照片级真实感生成样本:自然光照、逼真细节及连贯的多主体场景。

一个模型用于生成与编辑

LLaDA-Image 是一个统一的扩散模型,其骨干网络和 DiT 均为在单一框架下训练的扩散模型。与附加到文生图模型的编辑器插件不同,单个模型可处理:

  • 文生图生成:基础模型需 50 步
  • 指令引导编辑:保留参考内容,使用模型原生编辑路径而非降噪强度 img2img 变通方案
  • VQ 条件生成:通过 SigVQ 条件模块实现
  • 中文和英文文本渲染:在生成的图像中

训练配方完全公开在附带的 arXiv 报告 中:仅图像预训练首先构建视觉先验,随后是配对语言监督,联合生成 - 编辑训练将两项技能统一。在 Qwen-Image-Bench 上,它获得英语 53.53 分和中文 53.38 分,作为开源 6B 模型在发布时整体结果达到最先进水平。

文本渲染与海报生成展示

中文和英文文本渲染,具备海报级排版。

指令引导编辑展示

原生编辑:内容保持忠实,仅应用指示的更改。

Turbo:50 步变为 4 步

除基础模型外,LLaDA-Image-Turbo 使用 Twin-DMD 蒸馏将流程简化为 2 至 4 个采样步骤,适用于生成和编辑。首日提供四种模型变体:Base 和 Turbo 各一种 BF16 和 FP8 版本,每种变体在 diffusers 布局下约 49 GB。

模型步数模型
LLaDA-Image (Base)50BF16, FP8
LLaDA-Image-Turbo2-4BF16, FP8
Qwen-Image-Bench 对比

Qwen-Image-Bench 总分:LLaDA-Image 在英语和中文方面均位居开源 6B 类别榜首。

使用 RebelAI 节点包在 ComfyUI 中运行

来自 RealRebelAI 的社区集成在权重发布当天上线。该包提供四个节点:LLaDA Image LoaderLLaDA Image Text to ImageLLaDA Image EditLLaDA Image Unload。编辑节点调用模型的原生编辑路径(generation_mode="editing"),而非降噪强度近似值,且编辑尺寸必须能被 32 整除。

该集成使用来自 RealRebelAI/LLaDa-Image-Turbo_ComfyUI 的优化权重及匹配的 Base 包,每个包约 29 GB:

文件位置大小
LLaDA-Image-Turbo-transformer-BF16.safetensorsmodels/diffusion_models/13.1 GB
LLaDA-Image-Turbo-INT8.safetensorsmodels/diffusion_models/6.6 GB
LLaDA-Image-Turbo-text_encoder-Q4_K_M.ggufmodels/text_encoders/9.2 GB
LLaDa_VAE.safetensorsmodels/vae/0.17 GB

INT8 transformer 是原生 safetensors 量化而非 GGUF;GGUF 仅用于量化的 LLaDA2-MoE 文本编码器。对于 Turbo,从 4 步和 CFG 1.0 开始。

训练代码在官方路线图中标注为即将推出。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
LLaDA-Image:InclusionAI 开源 6B 图像生成与编辑模型 | ComfyUI Wiki