JoyAI Image Edit: ComfyUIネイティブ対応の画像編集
JD Open Sourceが開発したJoyAI Image EditがComfyUIでネイティブ動作。指示ガイドによる単一・複数画像編集と空間制御、BF16およびINT8形式をサポート。
JD Open SourceがJoyAI-Image-EditとJoyAI-Image-Edit-PlusのComfyUIネイティブ対応をリリースし、強力な指示ガイド画像編集モデルをComfyUIエコシステムに直接もたらしました。
JoyAI-Imageとは?
JoyAI-Imageは、JD Open Source(JD.com)が開発した統合型マルチモーダル基盤モデルです。**8Bマルチモーダル大規模言語モデル(MLLM)と16Bマルチモーダル拡散トランスフォーマー(MMDiT)**を組み合わせ、単一のアーキテクチャで画像理解、テキストから画像への生成、および指示ガイド画像編集を実現します。
このモデルファミリーは、理解、生成、編集の間のクローズドループ連携に基づいて構築されています。空間理解が強化されることで接地生成が向上し、生成変換が空間推論の補完的な証拠を提供します。
ComfyUI対応
2026年6月9日現在、JoyAI-Image-EditとJoyAI-Image-Edit-Plusの両方がComfyUIでネイティブ動作し、追加の依存関係は不要です。ComfyUI最適化モデルリポジトリは、2つの形式で事前パッケージ化されたモデルファイルを提供します。
- BF16 — 最大品質のためのフル精度
- INT8 ConvRot — 量子化によりVRAM使用量を抑え、品質低下を最小限に抑制
各リポジトリには、すぐに使用できるバンドル済みのComfyUIワークフローが含まれています。
JoyAI-Image-Edit
単一画像の指示ガイド編集。入力画像と自然言語の指示(例:「皿を青にする」「カップを右に移動する」)を受け取り、編集結果を生成します。
- HFリポジトリ: jdopensource/JoyAI-Image-Edit-ComfyUI
- モデルファイル:
diffusion_models/joyai_image_edit_bf16.safetensorsdiffusion_models/joyai_image_edit_int8_convrot.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_bf16.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_int8_convrot.safetensorsvae/wan_2.1_vae.safetensors
JoyAI-Image-Edit-Plus
複数画像の指示ガイド編集。1~6枚の参照画像とテキスト指示を受け取り、すべての参照から要素を組み合わせて指示に従った新しい画像を生成します。複数画像の合成、一貫性維持、共同操作をサポートします。
- HFリポジトリ: jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
- モデルファイル:
diffusion_models/joyai_image_edit_plus_bf16.safetensorsdiffusion_models/joyai_image_edit_plus_int8_convrot.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_plus_bf16.safetensorstext_encoders/qwen3vl_8b_joyimage_edit_plus_int8_convrot.safetensorsvae/wan_2.1_vae.safetensors
インストール
ダウンロードしたファイルを以下のComfyUIディレクトリ構造に配置します。
ComfyUI/
└── models/
├── diffusion_models/
│ ├── joyai_image_edit_bf16.safetensors
│ └── joyai_image_edit_int8_convrot.safetensors
├── text_encoders/
│ ├── qwen3vl_8b_joyimage_edit_bf16.safetensors
│ └── qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
└── vae/
└── wan_2.1_vae.safetensorsまたは、hf downloadを使って直接インストールすることもできます。
hf download jdopensource/JoyAI-Image-Edit-ComfyUI --local-dir /path/to/ComfyUI/models機能
JoyAI-Image-Editは、指示ガイド画像編集のいくつかの分野で優れた性能を発揮します。
- 空間編集 — 自然言語プロンプトによるオブジェクトの移動、回転、カメラ制御
- 正確な指示追従 — 編集指示への高い忠実度を維持しつつ、変更しないシーン要素を保持
- 複数画像の合成(Edit-Plus) — 最大6枚の参照画像から要素を組み合わせて一貫した単一の出力を生成
- 高いシーン保存性 — 編集領域外のシーン構造とコンテンツを維持
モデルの空間認識能力は、空間推論タスクにも活用されます。カメラ動作を忠実に実行することで診断視点を合成し、複雑な空間関係の曖昧性解消に役立ちます。
リンク
| リソース | URL |
|---|---|
| GitHubリポジトリ | github.com/jd-opensource/JoyAI-Image |
| arXiv論文 | arxiv.org/abs/2605.04128 |
| HF ComfyUI(Edit) | huggingface.co/jdopensource/JoyAI-Image-Edit-ComfyUI |
| HF ComfyUI(Edit-Plus) | huggingface.co/jdopensource/JoyAI-Image-Edit-Plus-ComfyUI |
| HF Diffusers(Edit) | huggingface.co/jdopensource/JoyAI-Image-Edit-Diffusers |
| ライセンス | Apache 2.0 |
コメント
GitHubでサインインしてディスカッションに参加しましょう。