JoyAI Image Edit:原生 ComfyUI 图像编辑支持

news

京东开源的 JoyAI Image Edit 现已原生运行于 ComfyUI。支持指令引导的单图和多图编辑,具备空间控制能力,提供 BF16 和 INT8 格式。

京东开源(JD Open Source)已发布 JoyAI-Image-EditJoyAI-Image-Edit-Plus 的原生 ComfyUI 支持,将其强大的指令引导图像编辑模型直接引入 ComfyUI 生态。

JoyAI-Image 是什么?

JoyAI-Image 是京东开源(JD.com)开发的统一多模态基础模型。它结合了 8B 多模态大语言模型(MLLM)16B 多模态扩散 Transformer(MMDiT),在同一架构中实现图像理解、文生图和指令引导图像编辑。

该模型系列围绕理解、生成和编辑之间的闭环协作构建——更强的空间理解有助于生成更准确的图像,而生成式变换则为空间推理提供互补证据。

ComfyUI 支持

自 2026 年 6 月 9 日起,JoyAI-Image-Edit 和 JoyAI-Image-Edit-Plus 均可原生运行于 ComfyUI,无需额外依赖。针对 ComfyUI 优化的模型仓库提供了两种格式的预打包模型文件:

  • BF16 — 全精度,追求最高质量
  • INT8 ConvRot — 量化版,降低 VRAM 占用,质量损失极小

每个仓库均附带打包好的 ComfyUI 工作流,开箱即用。

JoyAI-Image-Edit

单图指令引导编辑。接收输入图像和自然语言指令(例如“将盘子变成蓝色”或“把杯子向右移动”),输出编辑后的结果。

  • HF 仓库jdopensource/JoyAI-Image-Edit-ComfyUI
  • 模型文件
    • diffusion_models/joyai_image_edit_bf16.safetensors
    • diffusion_models/joyai_image_edit_int8_convrot.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_bf16.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
    • vae/wan_2.1_vae.safetensors

JoyAI-Image-Edit-Plus

多图指令引导编辑。接收 1 至 6 张参考图像及文本指令,根据指令组合所有参考图像中的元素,生成新图像。支持多图合成、一致性保持和联合编辑。

  • HF 仓库jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
  • 模型文件
    • diffusion_models/joyai_image_edit_plus_bf16.safetensors
    • diffusion_models/joyai_image_edit_plus_int8_convrot.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_plus_bf16.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_plus_int8_convrot.safetensors
    • vae/wan_2.1_vae.safetensors

安装

将下载的文件放入以下 ComfyUI 目录结构中:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   ├── joyai_image_edit_bf16.safetensors
    │   └── joyai_image_edit_int8_convrot.safetensors
    ├── text_encoders/
    │   ├── qwen3vl_8b_joyimage_edit_bf16.safetensors
    │   └── qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
    └── vae/
        └── wan_2.1_vae.safetensors

或者使用 hf download 直接安装:

hf download jdopensource/JoyAI-Image-Edit-ComfyUI --local-dir /path/to/ComfyUI/models

功能

JoyAI-Image-Edit 在指令引导编辑的多个方面表现出色:

  • 空间编辑 — 通过自然语言提示实现物体移动、物体旋转和相机控制
  • 精准指令遵循 — 高度遵守编辑指令,同时保留未修改场景元素
  • 多图合成(Edit-Plus) — 将多达 6 张参考图像中的元素组合成单一连贯输出
  • 强场景保留 — 保持编辑区域之外的场景结构和内容

该模型的空间智能还可用于空间推理任务——通过忠实执行相机运动合成诊断视角,帮助消除复杂空间关系的歧义。

链接

资源网址
GitHub 仓库github.com/jd-opensource/JoyAI-Image
arXiv 论文arxiv.org/abs/2605.04128
HF ComfyUI(Edit)huggingface.co/jdopensource/JoyAI-Image-Edit-ComfyUI
HF ComfyUI(Edit-Plus)huggingface.co/jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
HF Diffusers(Edit)huggingface.co/jdopensource/JoyAI-Image-Edit-Diffusers
许可证Apache 2.0

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
JoyAI Image Edit:原生 ComfyUI 图像编辑支持 | ComfyUI Wiki