LLaDA-Image:InclusionAI 开源 6B 图像生成与编辑模型
InclusionAI 发布 LLaDA-Image,一款 6B 统一生成与编辑模型,含 4 步 Turbo 变体,以及支持 INT8 和 GGUF 权重的社区 ComfyUI 节点包。
官方仓库中的照片级真实感生成样本:自然光照、逼真细节及连贯的多主体场景。
一个模型用于生成与编辑
LLaDA-Image 是一个统一的扩散模型,其骨干网络和 DiT 均为在单一框架下训练的扩散模型。与附加到文生图模型的编辑器插件不同,单个模型可处理:
- 文生图生成:基础模型需 50 步
- 指令引导编辑:保留参考内容,使用模型原生编辑路径而非降噪强度 img2img 变通方案
- VQ 条件生成:通过 SigVQ 条件模块实现
- 中文和英文文本渲染:在生成的图像中
训练配方完全公开在附带的 arXiv 报告 中:仅图像预训练首先构建视觉先验,随后是配对语言监督,联合生成 - 编辑训练将两项技能统一。在 Qwen-Image-Bench 上,它获得英语 53.53 分和中文 53.38 分,作为开源 6B 模型在发布时整体结果达到最先进水平。
中文和英文文本渲染,具备海报级排版。
原生编辑:内容保持忠实,仅应用指示的更改。
Turbo:50 步变为 4 步
除基础模型外,LLaDA-Image-Turbo 使用 Twin-DMD 蒸馏将流程简化为 2 至 4 个采样步骤,适用于生成和编辑。首日提供四种模型变体:Base 和 Turbo 各一种 BF16 和 FP8 版本,每种变体在 diffusers 布局下约 49 GB。
Qwen-Image-Bench 总分:LLaDA-Image 在英语和中文方面均位居开源 6B 类别榜首。
使用 RebelAI 节点包在 ComfyUI 中运行
来自 RealRebelAI 的社区集成在权重发布当天上线。该包提供四个节点:LLaDA Image Loader、LLaDA Image Text to Image、LLaDA Image Edit 和 LLaDA Image Unload。编辑节点调用模型的原生编辑路径(generation_mode="editing"),而非降噪强度近似值,且编辑尺寸必须能被 32 整除。
该集成使用来自 RealRebelAI/LLaDa-Image-Turbo_ComfyUI 的优化权重及匹配的 Base 包,每个包约 29 GB:
| 文件 | 位置 | 大小 |
|---|---|---|
LLaDA-Image-Turbo-transformer-BF16.safetensors | models/diffusion_models/ | 13.1 GB |
LLaDA-Image-Turbo-INT8.safetensors | models/diffusion_models/ | 6.6 GB |
LLaDA-Image-Turbo-text_encoder-Q4_K_M.gguf | models/text_encoders/ | 9.2 GB |
LLaDa_VAE.safetensors | models/vae/ | 0.17 GB |
INT8 transformer 是原生 safetensors 量化而非 GGUF;GGUF 仅用于量化的 LLaDA2-MoE 文本编码器。对于 Turbo,从 4 步和 CFG 1.0 开始。
训练代码在官方路线图中标注为即将推出。
评论
使用 GitHub 登录后即可参与讨论。