JoyAI Image Edit: soporte nativo de ComfyUI para edición de imágenes

news

JoyAI Image Edit de JD Open Source ahora se ejecuta de forma nativa en ComfyUI. Edición de imágenes única y múltiple guiada por instrucciones con control espacial, formatos BF16 e INT8.

JD Open Source ha lanzado soporte nativo de ComfyUI para JoyAI-Image-Edit y JoyAI-Image-Edit-Plus, llevando sus potentes modelos de edición de imágenes guiada por instrucciones directamente al ecosistema de ComfyUI.

¿Qué es JoyAI-Image?

JoyAI-Image es un modelo fundacional multimodal unificado desarrollado por JD Open Source (JD.com). Combina un Modelo de Lenguaje Grande Multimodal (MLLM) de 8B con un Transformer de Difusión Multimodal (MMDiT) de 16B para ofrecer comprensión de imágenes, generación de texto a imagen y edición de imágenes guiada por instrucciones en una sola arquitectura.

La familia de modelos se construye en torno a una colaboración en bucle cerrado entre comprensión, generación y edición: una comprensión espacial más sólida mejora la generación fundamentada, mientras que las transformaciones generativas proporcionan evidencia complementaria para el razonamiento espacial.

Soporte de ComfyUI

A partir del 9 de junio de 2026, tanto JoyAI-Image-Edit como JoyAI-Image-Edit-Plus se ejecutan de forma nativa en ComfyUI sin dependencias adicionales. Los repositorios de modelos optimizados para ComfyUI proporcionan archivos de modelo preempaquetados en dos formatos:

  • BF16 — Precisión completa para máxima calidad
  • INT8 ConvRot — Cuantificado para menor uso de VRAM con pérdida mínima de calidad

Se incluye un workflow de ComfyUI empaquetado en cada repositorio para uso inmediato.

JoyAI-Image-Edit

Edición guiada por instrucciones de una sola imagen. Acepta una imagen de entrada y una instrucción en lenguaje natural (por ejemplo, "Vuelve el plato azul" o "Mueve la taza a la derecha") y genera el resultado editado.

  • Repositorio HF: jdopensource/JoyAI-Image-Edit-ComfyUI
  • Archivos del modelo:
    • diffusion_models/joyai_image_edit_bf16.safetensors
    • diffusion_models/joyai_image_edit_int8_convrot.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_bf16.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
    • vae/wan_2.1_vae.safetensors

JoyAI-Image-Edit-Plus

Edición guiada por instrucciones de múltiples imágenes. Acepta de 1 a 6 imágenes de referencia junto con una instrucción de texto, y genera una nueva imagen combinando elementos de todas las referencias según la instrucción. Admite composición multiimagen, consistencia y manipulación conjunta.

  • Repositorio HF: jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
  • Archivos del modelo:
    • diffusion_models/joyai_image_edit_plus_bf16.safetensors
    • diffusion_models/joyai_image_edit_plus_int8_convrot.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_plus_bf16.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_plus_int8_convrot.safetensors
    • vae/wan_2.1_vae.safetensors

Instalación

Coloque los archivos descargados en la siguiente estructura de directorios de ComfyUI:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   ├── joyai_image_edit_bf16.safetensors
    │   └── joyai_image_edit_int8_convrot.safetensors
    ├── text_encoders/
    │   ├── qwen3vl_8b_joyimage_edit_bf16.safetensors
    │   └── qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
    └── vae/
        └── wan_2.1_vae.safetensors

Alternativamente, use hf download para instalar directamente:

hf download jdopensource/JoyAI-Image-Edit-ComfyUI --local-dir /path/to/ComfyUI/models

Capacidades

JoyAI-Image-Edit sobresale en varias áreas de edición guiada por instrucciones:

  • Edición espacial — Movimiento de objetos, rotación de objetos y control de cámara mediante indicaciones en lenguaje natural
  • Seguimiento preciso de instrucciones — Adhesión de alta fidelidad a las instrucciones de edición mientras se preservan los elementos de la escena no modificados
  • Composición multiimagen (Edit-Plus) — Combina elementos de hasta 6 imágenes de referencia en una única salida coherente
  • Fuerte preservación de la escena — Mantiene la estructura y el contenido de la escena fuera de la región editada

La inteligencia espacial del modelo también se aprovecha para tareas de razonamiento espacial: puede sintetizar puntos de vista de diagnóstico ejecutando fielmente los movimientos de la cámara, ayudando a desambiguar relaciones espaciales complejas.

Enlaces

RecursoURL
Repositorio GitHubgithub.com/jd-opensource/JoyAI-Image
Artículo arXivarxiv.org/abs/2605.04128
HF ComfyUI (Edit)huggingface.co/jdopensource/JoyAI-Image-Edit-ComfyUI
HF ComfyUI (Edit-Plus)huggingface.co/jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
HF Diffusers (Edit)huggingface.co/jdopensource/JoyAI-Image-Edit-Diffusers
LicenciaApache 2.0

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
JoyAI Image Edit: soporte nativo de ComfyUI para edición de imágenes | ComfyUI Wiki