LLaDA-Image: InclusionAI открыла модель генерации и редактирования изображений на 6B

ComfyUI Wikinews

InclusionAI выпустила LLaDA-Image, объединенную модель генерации и редактирования на 6B с вариантом Turbo на 4 шага, а также пакет узлов ComfyUI от сообщества с весами INT8 и GGUF.

LLaDA-Image (GitHub, Hugging Face) — это семейство объединенных моделей генерации и редактирования изображений на 6 млрд параметров от InclusionAI (команда Ant Group, стоящая за Ling), выпущенное 4 сентября по лицензии Apache-2.0 с полным открытым рецептом обучения. Пакет узлов ComfyUI от сообщества RebelAI уже позволяет запускать его локально.
LLaDA-Image photorealistic generation showcase

Примеры фотореалистичной генерации из официального репозитория: естественное освещение, реалистичные детали и связные сцены с несколькими объектами.

Один чекпойнт для генерации и редактирования

LLaDA-Image — это объединенная диффузионная модель, где и бэкбон, и DiT являются диффузионными моделями, обученными в едином фреймворке. В отличие от надстроек редактора, прикрепленных к модели Текст в изображение, один чекпойнт выполняет:

  • Генерация Текст в изображение за 50 шагов на Базовой модели
  • Редактирование по инструкциям с сохранением референса, используя нативный путь редактирования модели вместо обходного пути img2img с denoise-strength
  • Генерация с условным VQ через модуль условия SigVQ
  • Рендеринг китайского и английского текста в сгенерированных изображениях

Рецепт обучения полностью открыт в сопроводительном отчете arXiv: предварительное обучение только на изображениях сначала строит визуальный приоритет, затем следует языковой супербайз на парах, а совместное обучение генерации и редактирования объединяет эти два навыка. На Qwen-Image-Bench он набирает 53.53 на английском и 53.38 на китайском, являясь лучшим результатом среди открытых моделей на 6B на момент выпуска.

Text rendering and poster generation showcase

Рендеринг китайского и английского текста с макетами уровня постера.

Instruction-guided editing showcase

Нативное редактирование: содержимое остается верным, применяется только указанное изменение.

Turbo: 4 шага вместо 50

Вместе с Базовой моделью LLaDA-Image-Turbo дистиллирует пайплайн с помощью Twin-DMD дистилляции до 2–4 шагов выборки как для генерации, так и для редактирования. Четыре варианта чекпойнта доступны с первого дня: BF16 и FP8 для каждой из Базовой и Turbo, около 49 ГБ на вариант в формате diffusers.

МодельШагиЧекпойнты
LLaDA-Image (Базовая)50BF16, FP8
LLaDA-Image-Turbo2-4BF16, FP8
Qwen-Image-Bench comparison

Общие результаты Qwen-Image-Bench: LLaDA-Image лидирует в классе открытых моделей на 6B как на английском, так и на китайском.

Запустите его в ComfyUI с пакетом узлов RebelAI

Интеграция сообщества от RealRebelAI появилась в тот же день, когда были опубликованы веса. Пакет предоставляет четыре узла: LLaDA Image Loader, LLaDA Image Text to Image, LLaDA Image Edit и LLaDA Image Unload. Узел редактирования вызывает нативный путь редактирования модели (generation_mode="editing"), а не аппроксимацию denoise-strength, и размеры редактирования должны быть кратны 32.

Интеграция использует оптимизированные веса из RealRebelAI/LLaDa-Image-Turbo_ComfyUI и соответствующего пакета Базовой модели, около 29 ГБ на пакет:

ФайлРазмещениеРазмер
LLaDA-Image-Turbo-transformer-BF16.safetensorsmodels/diffusion_models/13.1 ГБ
LLaDA-Image-Turbo-INT8.safetensorsmodels/diffusion_models/6.6 ГБ
LLaDA-Image-Turbo-text_encoder-Q4_K_M.ggufmodels/text_encoders/9.2 ГБ
LLaDa_VAE.safetensorsmodels/vae/0.17 ГБ

Трансформер INT8 — это нативная квантование safetensors, а не GGUF; GGUF используется только для квантованного текстового энкодера LLaDA2-MoE. Для Turbo начните с 4 шагов и CFG 1.0.

Код обучения указан как Скоро будет на официальной дорожной карте.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
LLaDA-Image: InclusionAI открыла модель генерации и редактирования изображений на 6B | ComfyUI Wiki