JoyAI Image Edit : prise en charge native de ComfyUI pour l'édition d'images
JoyAI Image Edit de JD Open Source fonctionne désormais nativement dans ComfyUI. Édition d'images unique et multiple guidée par instructions avec contrôle spatial, formats BF16 et INT8.
JD Open Source a publié une prise en charge native de ComfyUI pour JoyAI-Image-Edit et JoyAI-Image-Edit-Plus, intégrant leurs puissants modèles d'édition d'images guidée par instructions directement dans l'écosystème ComfyUI.
Qu'est-ce que JoyAI-Image ?
JoyAI-Image est un modèle fondamental multimodal unifié développé par JD Open Source (JD.com). Il combine un modèle de langage large multimodal (MLLM) de 8B avec un transformateur de diffusion multimodal (MMDiT) de 16B pour offrir la compréhension d'images, la génération texte-à-image et l'édition d'images guidée par instructions dans une seule architecture.
La famille de modèles est construite autour d'une collaboration en boucle fermée entre la compréhension, la génération et l'édition — une meilleure compréhension spatiale améliore la génération ancrée, tandis que les transformations génératives fournissent des preuves complémentaires pour le raisonnement spatial.
Prise en charge de ComfyUI
Depuis le 9 juin 2026, JoyAI-Image-Edit et JoyAI-Image-Edit-Plus s'exécutent nativement dans ComfyUI sans dépendances supplémentaires. Les dépôts de modèles optimisés pour ComfyUI fournissent des fichiers de modèle pré-emballés en deux formats :
- BF16 — Pleine précision pour une qualité maximale
- INT8 ConvRot — Quantifié pour une utilisation mémoire VRAM réduite avec une perte de qualité minimale
Un workflow ComfyUI intégré est inclus dans chaque dépôt pour une utilisation immédiate.
JoyAI-Image-Edit
Édition d'image unique guidée par instructions. Accepte une image d'entrée et une instruction en langage naturel (par exemple, « Mettre l'assiette en bleu » ou « Déplacer la tasse vers la droite ») et génère le résultat édité.
- Dépôt HF : jdopensource/JoyAI-Image-Edit-ComfyUI
- Fichiers du modèle :
diffusion_models/joyai_image_edit_bf16.safetensorsdiffusion_models/joyai_image_edit_int8_convrot.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_bf16.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_int8_convrot.safetensorsvae/wan_2.1_vae.safetensors
JoyAI-Image-Edit-Plus
Édition d'images multiples guidée par instructions. Accepte de 1 à 6 images de référence avec une instruction textuelle, et génère une nouvelle image combinant des éléments de toutes les références selon l'instruction. Prend en charge la composition multi-image, la cohérence et la manipulation conjointe.
- Dépôt HF : jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
- Fichiers du modèle :
diffusion_models/joyai_image_edit_plus_bf16.safetensorsdiffusion_models/joyai_image_edit_plus_int8_convrot.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_plus_bf16.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_plus_int8_convrot.safetensorsvae/wan_2.1_vae.safetensors
Installation
Placez les fichiers téléchargés dans la structure de répertoires ComfyUI suivante :
ComfyUI/
└── models/
├── diffusion_models/
│ ├── joyai_image_edit_bf16.safetensors
│ └── joyai_image_edit_int8_convrot.safetensors
├── text_encoders/
│ ├── qwen3vl_8b_joyimage_edit_bf16.safetensors
│ └── qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
└── vae/
└── wan_2.1_vae.safetensorsSinon, utilisez hf download pour installer directement :
hf download jdopensource/JoyAI-Image-Edit-ComfyUI --local-dir /path/to/ComfyUI/modelsCapacités
JoyAI-Image-Edit excelle dans plusieurs domaines de l'édition guidée par instructions :
- Édition spatiale — Déplacement d'objet, rotation d'objet et contrôle de la caméra via des instructions en langage naturel
- Suivi précis des instructions — Adhésion haute fidélité aux instructions d'édition tout en préservant les éléments non modifiés de la scène
- Composition multi-image (Edit-Plus) — Combinaison d'éléments provenant de jusqu'à 6 images de référence en une seule sortie cohérente
- Forte préservation de la scène — Maintien de la structure et du contenu de la scène en dehors de la région éditée
L'intelligence spatiale du modèle est également exploitée pour des tâches de raisonnement spatial — il peut synthétiser des points de vue de diagnostic en exécutant fidèlement des mouvements de caméra, aidant à désambiguïser des relations spatiales complexes.
Liens
| Ressource | URL |
|---|---|
| Dépôt GitHub | github.com/jd-opensource/JoyAI-Image |
| Article arXiv | arxiv.org/abs/2605.04128 |
| HF ComfyUI (Edit) | huggingface.co/jdopensource/JoyAI-Image-Edit-ComfyUI |
| HF ComfyUI (Edit-Plus) | huggingface.co/jdopensource/JoyAI-Image-Edit-Plus-ComfyUI |
| HF Diffusers (Edit) | huggingface.co/jdopensource/JoyAI-Image-Edit-Diffusers |
| Licence | Apache 2.0 |
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.