JoyAI Image: Unified Multimodal Image Editing Model by JD Open Source
JoyAI Image is a unified multimodal foundation model from JD Open Source for instruction-guided image editing. Combines 8B MLLM + 16B MMDiT with native ComfyUI support.
J
JoyAI Image by JD Open Source
Image EditingInstruction-GuidedSpatial EditingMultimodalJoyAI-Image is a unified multimodal foundation model developed by JD Open Source that combines an 8B Multimodal Large Language Model (MLLM) with a 16B Multimodal Diffusion Transformer (MMDiT). It delivers image understanding, text-to-image generation, and instruction-guided image editing with strong spatial intelligence. Now natively supported in ComfyUI.
Variants
| Variant | Description | Best For |
|---|---|---|
| JoyAI-Image-Edit | Single-image instruction-guided editing | Precise spatial edits, object manipulation, camera control |
| JoyAI-Image-Edit-Plus | Multi-image instruction-guided editing (1-6 reference images) | Cross-image composition, multi-reference consistency |
Select a variant for tutorials, custom nodes, and related news. Curated weight downloads live in the Model Hub catalog.
Comments
Sign in with GitHub to join the discussion.