JoyAI Image Edit:原生 ComfyUI 图像编辑支持
京东开源的 JoyAI Image Edit 现已原生运行于 ComfyUI。支持指令引导的单图和多图编辑,具备空间控制能力,提供 BF16 和 INT8 格式。
京东开源(JD Open Source)已发布 JoyAI-Image-Edit 和 JoyAI-Image-Edit-Plus 的原生 ComfyUI 支持,将其强大的指令引导图像编辑模型直接引入 ComfyUI 生态。
JoyAI-Image 是什么?
JoyAI-Image 是京东开源(JD.com)开发的统一多模态基础模型。它结合了 8B 多模态大语言模型(MLLM) 与 16B 多模态扩散 Transformer(MMDiT),在同一架构中实现图像理解、文生图和指令引导图像编辑。
该模型系列围绕理解、生成和编辑之间的闭环协作构建——更强的空间理解有助于生成更准确的图像,而生成式变换则为空间推理提供互补证据。
ComfyUI 支持
自 2026 年 6 月 9 日起,JoyAI-Image-Edit 和 JoyAI-Image-Edit-Plus 均可原生运行于 ComfyUI,无需额外依赖。针对 ComfyUI 优化的模型仓库提供了两种格式的预打包模型文件:
- BF16 — 全精度,追求最高质量
- INT8 ConvRot — 量化版,降低 VRAM 占用,质量损失极小
每个仓库均附带打包好的 ComfyUI 工作流,开箱即用。
JoyAI-Image-Edit
单图指令引导编辑。接收输入图像和自然语言指令(例如“将盘子变成蓝色”或“把杯子向右移动”),输出编辑后的结果。
- HF 仓库: jdopensource/JoyAI-Image-Edit-ComfyUI
- 模型文件:
diffusion_models/joyai_image_edit_bf16.safetensorsdiffusion_models/joyai_image_edit_int8_convrot.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_bf16.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_int8_convrot.safetensorsvae/wan_2.1_vae.safetensors
JoyAI-Image-Edit-Plus
多图指令引导编辑。接收 1 至 6 张参考图像及文本指令,根据指令组合所有参考图像中的元素,生成新图像。支持多图合成、一致性保持和联合编辑。
- HF 仓库: jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
- 模型文件:
diffusion_models/joyai_image_edit_plus_bf16.safetensorsdiffusion_models/joyai_image_edit_plus_int8_convrot.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_plus_bf16.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_plus_int8_convrot.safetensorsvae/wan_2.1_vae.safetensors
安装
将下载的文件放入以下 ComfyUI 目录结构中:
ComfyUI/
└── models/
├── diffusion_models/
│ ├── joyai_image_edit_bf16.safetensors
│ └── joyai_image_edit_int8_convrot.safetensors
├── text_encoders/
│ ├── qwen3vl_8b_joyimage_edit_bf16.safetensors
│ └── qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
└── vae/
└── wan_2.1_vae.safetensors或者使用 hf download 直接安装:
hf download jdopensource/JoyAI-Image-Edit-ComfyUI --local-dir /path/to/ComfyUI/models功能
JoyAI-Image-Edit 在指令引导编辑的多个方面表现出色:
- 空间编辑 — 通过自然语言提示实现物体移动、物体旋转和相机控制
- 精准指令遵循 — 高度遵守编辑指令,同时保留未修改场景元素
- 多图合成(Edit-Plus) — 将多达 6 张参考图像中的元素组合成单一连贯输出
- 强场景保留 — 保持编辑区域之外的场景结构和内容
该模型的空间智能还可用于空间推理任务——通过忠实执行相机运动合成诊断视角,帮助消除复杂空间关系的歧义。
链接
| 资源 | 网址 |
|---|---|
| GitHub 仓库 | github.com/jd-opensource/JoyAI-Image |
| arXiv 论文 | arxiv.org/abs/2605.04128 |
| HF ComfyUI(Edit) | huggingface.co/jdopensource/JoyAI-Image-Edit-ComfyUI |
| HF ComfyUI(Edit-Plus) | huggingface.co/jdopensource/JoyAI-Image-Edit-Plus-ComfyUI |
| HF Diffusers(Edit) | huggingface.co/jdopensource/JoyAI-Image-Edit-Diffusers |
| 许可证 | Apache 2.0 |
评论
使用 GitHub 登录后即可参与讨论。