Ming-Image 0.1 Design: модель 6B для UI и постеров в ComfyUI
Ming-Image 0.1 Design: открытая text-to-image модель 6B от inclusionAI для UI, инфографики и постеров с текстом, с RGBA-прозрачностью и поддержкой ComfyUI в разработке.
Примеры дизайнов из официальной карточки модели.
Что такое Ming-Image 0.1 Design
Ming-Image 0.1 Design создан командой inclusionAI, стоящей за семействами моделей Ling и Bailing, и нацелен на задачу, с которой общие модели изображений справляются плохо: создание чистого, читаемого дизайна, а не фотографии. Целевое содержимое: экраны, дашборды, адаптивные раскладки карточек, панели инфографики, продуктовые постеры и подборки логотипов. В официальных примерах основной упор сделан на читаемость и типографическую корректность отрисованного текста.
- 6B diffusion transformer. DiT представляет собой 30-слойную архитектуру размерностью 3840 с 16 входными каналами и патчингом 2x2, в паре с отдельным vision-language энкодером и собственным коннектором. Kijai описывает базу как производную от Z-Image с новым текстовым энкодером.
- Данные для обучения ориентированы в первую очередь на дизайн, а не на общий корпус фотографий, поэтому выходы выглядят как скомпонованные макеты с настоящими текстовыми блоками.
- Два нативных разрешения выхода: 1024 и 2048, причём 2048 РЕКОМЕНДУЕТСЯ для полноценных макетов.
- Настройки выборки по умолчанию короткие: 12 шагов при CFG 1.0, поэтому дизайн получается за небольшое число проходов.
- Улучшение промпта является частью предполагаемого процесса. Официальный pipeline рекомендует переписывать промпт с помощью
Ling-3.0-flash-VLилиqwen3.8-27BДО генерации; это особенно важно для плотных макетов с большим количеством текста, который нужно разместить.
Адаптивная раскладка карточек, один из официальных примеров text-to-image.
Прозрачный фон как полноценный тип выхода
Помимо обычных изображений, Ming-Image 0.1 Design может выдавать RGBA-изображение с настоящим альфа-каналом, поэтому сгенерированный элемент постера, вырезанный продукт или UI-ассет сразу готов к композитингу и не требует отдельного прохода матирования. Карточка модели содержит набор рекомендованных триггерных фраз и требует добавить ровно одну из них в начало промпта. Тот же подход Qwen-Image 2.1 использует для режима прозрачности.
Выходы с прозрачным фоном. Шахматный узор показывает альфа-канал и не является частью сгенерированного изображения.
Родственный Layer: из дизайна в редактируемые слои
В серии есть второй checkpoint на 6B, Ming-Image 0.1 Design Layer, который решает обратную задачу: он берёт плоское изображение дизайна и разбирает его на отдельные редактируемые прозрачные слои. Именно этот шаг превращает сгенерированный макет в то, с чем можно реально работать в дизайн-инструменте, и inclusionAI дополняет его двумя опубликованными рабочими процессами агентов: навыком Ling UI Design, который использует сгенерированные референсы вместе с разбором на слои для создания и визуальной проверки UI-кода, и навыком image-to-editable-PPT, который воссоздаёт сгенерированную страницу как нативные элементы PowerPoint.
Checkpoint Layer использует другие настройки выборки по умолчанию, чем модель дизайна: 12 шагов при CFG 2.0, с рабочими разрешениями 512 и 1024.
Место в рейтинге UI/UX
Вместе с релизом inclusionAI опубликовала модель в рейтинге Artificial Analysis UI/UX Design, что является самым ясным сигналом о том, с кем конкурирует модель.
Позиция Ming-Image 0.1 Design в рейтинге UI/UX Design, из официального репозитория.
Доступность в ComfyUI
Поддержка Ming-Image в ComfyUI находится в процессе, поэтому пока нет ни объединённой в ядро реализации, ни официального шаблона рабочего процесса. Использовать её уже сегодня позволяют две вещи:
- Kijai опубликовал ComfyUI-перепаковку весов в
Kijai/Ming-Image-ComfyUIс вариантами transformer и текстового энкодера BF16,int8_convrotиw4a8, а также соответствующим VAE, разложенными по обычным папкамdiffusion_models/text_encoders/vae. - Основная реализация находится в ComfyUI PR #16482, где Kijai заявляет, что нода уже поддерживает вывод RGBA. Pull request всё ещё открыт, поэтому неизменённая установка ComfyUI пока не может загрузить модель.
Раннее тестирование в канале Banodoco #ming-image показывает, что семплеры здесь важны больше обычного: Kijai отмечает, что выход LCM чистый, но слишком сглаженный, и что случайные сбои текста всё ещё часто встречаются при INT8, тогда как RuneX сообщает, что модель откликается на промпты в стиле bounding-box и благодаря малому размеру редактирует быстро. Checkpoint Layer пока не упаковывается, поскольку Kijai считает дополнительную обработку текстового энкодера и проектора значительным усложнением для более узкого случая использования.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.