JoyAI Image Edit: нативная поддержка ComfyUI для редактирования изображений

news

JoyAI Image Edit от JD Open Source теперь работает нативно в ComfyUI. Редактирование одного и нескольких изображений по текстовой инструкции с пространственным контролем, форматы BF16 и INT8.

JD Open Source выпустила нативную поддержку ComfyUI для моделей JoyAI-Image-Edit и JoyAI-Image-Edit-Plus, интегрировав мощные модели редактирования изображений по текстовой инструкции непосредственно в экосистему ComfyUI.

Что такое JoyAI-Image?

JoyAI-Image — это унифицированная мультимодальная фундаментальная модель, разработанная JD Open Source (JD.com). Она объединяет 8B мультимодальную большую языковую модель (MLLM) с 16B мультимодальным диффузионным трансформером (MMDiT) для обеспечения понимания изображений, генерации текста в изображение и редактирования по текстовой инструкции в единой архитектуре.

Семейство моделей построено на принципе замкнутого цикла взаимодействия между пониманием, генерацией и редактированием: более сильное пространственное понимание улучшает обоснованную генерацию, а генеративные преобразования предоставляют дополнительную информацию для пространственного мышления.

Поддержка ComfyUI

По состоянию на 9 июня 2026 года обе модели — JoyAI-Image-Edit и JoyAI-Image-Edit-Plus — работают нативно в ComfyUI без каких-либо дополнительных зависимостей. Оптимизированные для ComfyUI репозитории моделей содержат предварительно упакованные файлы в двух форматах:

  • BF16 — Полная точность для максимального качества
  • INT8 ConvRot — Квантованный формат для уменьшения потребления VRAM с минимальной потерей качества

В каждый репозиторий включен готовый рабочий процесс ComfyUI для немедленного использования.

JoyAI-Image-Edit

Редактирование одного изображения по текстовой инструкции. Принимает входное изображение и инструкцию на естественном языке (например, «Сделай тарелку синей» или «Перемести чашку вправо») и генерирует отредактированный результат.

  • Репозиторий HF: jdopensource/JoyAI-Image-Edit-ComfyUI
  • Файлы модели:
    • diffusion_models/joyai_image_edit_bf16.safetensors
    • diffusion_models/joyai_image_edit_int8_convrot.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_bf16.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
    • vae/wan_2.1_vae.safetensors

JoyAI-Image-Edit-Plus

Редактирование нескольких изображений по текстовой инструкции. Принимает от 1 до 6 эталонных изображений вместе с текстовой инструкцией и генерирует новое изображение, объединяя элементы из всех эталонов в соответствии с инструкцией. Поддерживает композицию из нескольких изображений, согласованность и совместное манипулирование.

  • Репозиторий HF: jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
  • Файлы модели:
    • diffusion_models/joyai_image_edit_plus_bf16.safetensors
    • diffusion_models/joyai_image_edit_plus_int8_convrot.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_plus_bf16.safetensors
    • text_encoders/qwen3vl_8b_joyimage_edit_plus_int8_convrot.safetensors
    • vae/wan_2.1_vae.safetensors

Установка

Поместите загруженные файлы в следующую структуру каталогов ComfyUI:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   ├── joyai_image_edit_bf16.safetensors
    │   └── joyai_image_edit_int8_convrot.safetensors
    ├── text_encoders/
    │   ├── qwen3vl_8b_joyimage_edit_bf16.safetensors
    │   └── qwen3vl_8b_joyimage_edit_int8_convrot.safetensors
    └── vae/
        └── wan_2.1_vae.safetensors

Также можно использовать hf download для прямой установки:

hf download jdopensource/JoyAI-Image-Edit-ComfyUI --local-dir /path/to/ComfyUI/models

Возможности

JoyAI-Image-Edit превосходно справляется с несколькими задачами редактирования по текстовой инструкции:

  • Пространственное редактирование — перемещение объектов, их поворот и управление камерой с помощью подсказок на естественном языке
  • Точное следование инструкциям — высокая точность выполнения инструкций по редактированию при сохранении неизменённых элементов сцены
  • Композиция из нескольких изображений (Edit-Plus) — объединение элементов из до 6 эталонных изображений в единый согласованный результат
  • Сохранение сцены — поддержание структуры и содержимого сцены за пределами редактируемой области

Пространственный интеллект модели также используется для задач пространственного мышления: она может синтезировать диагностические виды, точно выполняя движения камеры, что помогает разрешать сложные пространственные отношения.

Ссылки

РесурсURL
Репозиторий GitHubgithub.com/jd-opensource/JoyAI-Image
Статья на arXivarxiv.org/abs/2605.04128
HF ComfyUI (Edit)huggingface.co/jdopensource/JoyAI-Image-Edit-ComfyUI
HF ComfyUI (Edit-Plus)huggingface.co/jdopensource/JoyAI-Image-Edit-Plus-ComfyUI
HF Diffusers (Edit)huggingface.co/jdopensource/JoyAI-Image-Edit-Diffusers
ЛицензияApache 2.0

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
JoyAI Image Edit: нативная поддержка ComfyUI для редактирования изображений | ComfyUI Wiki