Qwen-Image 2.1: единая генерация и редактирование 7B с выводом RGBA

ComfyUI Wiki

Qwen-Image 2.1 это 7B single-stream DiT от Alibaba для единой генерации и редактирования изображений, записывающая настоящий альфа-канал RGBA.

Q

Qwen-Image 2.1

Text-to-ImageImage EditingTransparencyOpen Source

Открытая по весам новинка Alibaba, пришедшая на смену Qwen-Image: 7B single-stream diffusion transformer (32 слоя), который генерирует и редактирует одними и теми же весами, записывает настоящие альфа-каналы RGBA, принимает до 10 референсных изображений и выдаёт результат нативно от 2048x2048 до 2752x1536.

РазработчикAlibaba Cloud (команда Qwen)
Дата выпуска2026-09
АрхитектураSingle-stream DiT (компонент визуальной генерации 7B, 32 слоя)
Текстовый энкодерQwen3-VL-8B (перепаковка Comfy-Org)
ЛицензияQwen Research License
Режимы генерацииText-to-image, редактирование по инструкции, вывод с прозрачностью (RGBA), извлечение объекта
Нативные разрешенияот 2048x2048 (1:1) до 2752x1536 (16:9), а также соответствующие портретные пропорции

Что такое Qwen-Image 2.1?

Qwen-Image 2.1 это второе поколение открытой линии Qwen-Image от Alibaba: оно заменяет 20B-бэкбон MMDiT из оригинального релиза на компонент визуальной генерации 7B из 32 слоёв single-stream DiT. В карточке модели описаны четыре изменения:

  • Компактность и эффективность. Внимание смешанной гранулярности и повторное использование префиксного KV-кэша сохраняют высокое качество изображения при значительно меньших вычислительных затратах, чем у 20B-поколения.
  • Нативная прозрачность с объединённым созданием и редактированием. Одна модель пишет обычные или прозрачные изображения RGBA по тексту, редактирует прозрачные слои и извлекает объект из фотографии.
  • Гибкое редактирование. До 10 референсных изображений на запрос, локальные правки, заданные кругами, нарисованными аннотациями или отдельной маской, а также сохранение внешности людей и товаров.
  • Реалистичные текстуры и отточенная эстетика. Улучшенная типографика, портретное освещение и мелкие детали.

Нативные размеры вывода начинаются с 2048x2048 для 1:1 и доходят до 2400x1792 (4:3), 2528x1696 (3:2) и 2752x1536 (16:9), с соответствующими портретными пропорциями.

Прозрачные изображения с настоящим альфа-каналом

Главное изменение это прозрачность, которая сохраняется в файле. Вместо генерации на плоском фоне и последующего вырезания объекта с помощью matting-модели Qwen-Image 2.1 сам записывает альфа-канал, поэтому стикеры, рендеры товаров и UI-ассеты получаются готовыми к композитингу. В карточке модели рекомендуется явный формат промпта для этого:

This is an RGBA image with transparency. <your subject description>.
The image has alpha channel and the background is transparent.

Поддержка ComfyUI

Qwen-Image 2.1 появился в ComfyUI в день релиза вместе с PR интеграции (Comfy-Org/ComfyUI #16400), а официальные шаблоны требуют ComfyUI 0.37.0 или новее. Перепакованные однофайловые веса лежат в Comfy-Org/Qwen-Image-2.1, включая трансформеры BF16 и INT8 convrot, а также текстовый энкодер Qwen3-VL-8B и опциональный улучшитель промптов.

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…