JoyAI Image: Unified Multimodal Image Editing Model by JD Open Source

JoyAI Image is a unified multimodal foundation model from JD Open Source for instruction-guided image editing. Combines 8B MLLM + 16B MMDiT with native ComfyUI support.

J

JoyAI Image by JD Open Source

Image EditingInstruction-GuidedSpatial EditingMultimodal

JoyAI-Image is a unified multimodal foundation model developed by JD Open Source that combines an 8B Multimodal Large Language Model (MLLM) with a 16B Multimodal Diffusion Transformer (MMDiT). It delivers image understanding, text-to-image generation, and instruction-guided image editing with strong spatial intelligence. Now natively supported in ComfyUI.

Variants

VariantDescriptionBest For
JoyAI-Image-EditSingle-image instruction-guided editingPrecise spatial edits, object manipulation, camera control
JoyAI-Image-Edit-PlusMulti-image instruction-guided editing (1-6 reference images)Cross-image composition, multi-reference consistency

Select a variant for tutorials, custom nodes, and related news. Curated weight downloads live in the Model Hub catalog.

Comments

Sign in with GitHub to join the discussion.

Loading comments…