LLaDA-Image: 6B-модель изображений от InclusionAI

ComfyUI Wiki

LLaDA-Image: открытая 6B-модель InclusionAI для генерации по тексту и нативного редактирования по инструкциям, с 4-шаговым Turbo и нодами ComfyUI.

L

LLaDA-Image

Генерация по текстуРедактирование изображений6BРендеринг текста

Открытая унифицированная 6B-модель изображений от InclusionAI (Ant Group). Один checkpoint отвечает и за генерацию по тексту, и за нативное редактирование по инструкциям, с двуязычным рендерингом текста на китайском и английском и открытым рецептом обучения. LLaDA-Image Turbo сокращает pipeline до 2-4 шагов выборки.

LLaDA-Image представляет собой унифицированную diffusion-модель, в которой и backbone, и DiT являются diffusion-моделями, обученными в едином фреймворке. Вместо того чтобы надстраивать модуль редактирования поверх модели генерации по тексту, один checkpoint охватывает генерацию, редактирование по инструкциям с сохранением референса и генерацию с VQ-условием через модуль условий SigVQ.

На Qwen-Image-Bench модель набирает 53.53 в английском и 53.38 в китайском: это лучшие общие результаты среди открытых 6B-моделей на момент релиза. Полный рецепт обучения описан в сопроводительном отчёте arXiv.

Модели

МодельШагиОписаниеЛицензияРелиз
LLaDA-Image Turbo2-4Дистиллированный вариант Twin-DMD, упакованный для ComfyUI (BF16 / INT8)Apache-2.02026-09-04

Выберите модель выше, чтобы получить подборку загрузок весов, учебники и связанную информацию.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…