LLaDA-Image: InclusionAI открыла модель генерации и редактирования изображений на 6B
InclusionAI выпустила LLaDA-Image, объединенную модель генерации и редактирования на 6B с вариантом Turbo на 4 шага, а также пакет узлов ComfyUI от сообщества с весами INT8 и GGUF.
Примеры фотореалистичной генерации из официального репозитория: естественное освещение, реалистичные детали и связные сцены с несколькими объектами.
Один чекпойнт для генерации и редактирования
LLaDA-Image — это объединенная диффузионная модель, где и бэкбон, и DiT являются диффузионными моделями, обученными в едином фреймворке. В отличие от надстроек редактора, прикрепленных к модели Текст в изображение, один чекпойнт выполняет:
- Генерация Текст в изображение за 50 шагов на Базовой модели
- Редактирование по инструкциям с сохранением референса, используя нативный путь редактирования модели вместо обходного пути img2img с denoise-strength
- Генерация с условным VQ через модуль условия SigVQ
- Рендеринг китайского и английского текста в сгенерированных изображениях
Рецепт обучения полностью открыт в сопроводительном отчете arXiv: предварительное обучение только на изображениях сначала строит визуальный приоритет, затем следует языковой супербайз на парах, а совместное обучение генерации и редактирования объединяет эти два навыка. На Qwen-Image-Bench он набирает 53.53 на английском и 53.38 на китайском, являясь лучшим результатом среди открытых моделей на 6B на момент выпуска.
Рендеринг китайского и английского текста с макетами уровня постера.
Нативное редактирование: содержимое остается верным, применяется только указанное изменение.
Turbo: 4 шага вместо 50
Вместе с Базовой моделью LLaDA-Image-Turbo дистиллирует пайплайн с помощью Twin-DMD дистилляции до 2–4 шагов выборки как для генерации, так и для редактирования. Четыре варианта чекпойнта доступны с первого дня: BF16 и FP8 для каждой из Базовой и Turbo, около 49 ГБ на вариант в формате diffusers.
Общие результаты Qwen-Image-Bench: LLaDA-Image лидирует в классе открытых моделей на 6B как на английском, так и на китайском.
Запустите его в ComfyUI с пакетом узлов RebelAI
Интеграция сообщества от RealRebelAI появилась в тот же день, когда были опубликованы веса. Пакет предоставляет четыре узла: LLaDA Image Loader, LLaDA Image Text to Image, LLaDA Image Edit и LLaDA Image Unload. Узел редактирования вызывает нативный путь редактирования модели (generation_mode="editing"), а не аппроксимацию denoise-strength, и размеры редактирования должны быть кратны 32.
Интеграция использует оптимизированные веса из RealRebelAI/LLaDa-Image-Turbo_ComfyUI и соответствующего пакета Базовой модели, около 29 ГБ на пакет:
| Файл | Размещение | Размер |
|---|---|---|
LLaDA-Image-Turbo-transformer-BF16.safetensors | models/diffusion_models/ | 13.1 ГБ |
LLaDA-Image-Turbo-INT8.safetensors | models/diffusion_models/ | 6.6 ГБ |
LLaDA-Image-Turbo-text_encoder-Q4_K_M.gguf | models/text_encoders/ | 9.2 ГБ |
LLaDa_VAE.safetensors | models/vae/ | 0.17 ГБ |
Трансформер INT8 — это нативная квантование safetensors, а не GGUF; GGUF используется только для квантованного текстового энкодера LLaDA2-MoE. Для Turbo начните с 4 шагов и CFG 1.0.
Код обучения указан как Скоро будет на официальной дорожной карте.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.