LLaDA-Image: 6B-модель изображений от InclusionAI
LLaDA-Image: открытая 6B-модель InclusionAI для генерации по тексту и нативного редактирования по инструкциям, с 4-шаговым Turbo и нодами ComfyUI.
LLaDA-Image
Генерация по текстуРедактирование изображений6BРендеринг текстаОткрытая унифицированная 6B-модель изображений от InclusionAI (Ant Group). Один checkpoint отвечает и за генерацию по тексту, и за нативное редактирование по инструкциям, с двуязычным рендерингом текста на китайском и английском и открытым рецептом обучения. LLaDA-Image Turbo сокращает pipeline до 2-4 шагов выборки.
LLaDA-Image представляет собой унифицированную diffusion-модель, в которой и backbone, и DiT являются diffusion-моделями, обученными в едином фреймворке. Вместо того чтобы надстраивать модуль редактирования поверх модели генерации по тексту, один checkpoint охватывает генерацию, редактирование по инструкциям с сохранением референса и генерацию с VQ-условием через модуль условий SigVQ.
На Qwen-Image-Bench модель набирает 53.53 в английском и 53.38 в китайском: это лучшие общие результаты среди открытых 6B-моделей на момент релиза. Полный рецепт обучения описан в сопроводительном отчёте arXiv.
Модели
| Модель | Шаги | Описание | Лицензия | Релиз |
|---|---|---|---|---|
| LLaDA-Image Turbo | 2-4 | Дистиллированный вариант Twin-DMD, упакованный для ComfyUI (BF16 / INT8) | Apache-2.0 | 2026-09-04 |
Выберите модель выше, чтобы получить подборку загрузок весов, учебники и связанную информацию.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.