Модели улучшения промптов Qwen-Image 2.1 запускаются в ComfyUI

ComfyUI Wikinews

Модели переписывания промптов PE-T2I и PE-I2I от Qwen разворачивают короткие запросы и инструкции редактирования, а пакет узлов сообщества запускает обе в ComfyUI через Load CLIP.

Вместе с Qwen-Image 2.1 Qwen выпустила две специализированные модели переписывания промптов: Qwen-Image-2.1-PE-T2I для запросов text-to-image и Qwen-Image-2.1-PE-I2I для инструкций редактирования. В ComfyUI для них пока нет узлов, поэтому пакет сообщества ComfyUI-Qwen-Image-2.1-Prompt-Enhancer теперь подключает обе модели в граф.

Два переписывателя, по одному на каждую задачу

Чекпойнты PE представляют собой дообученные модели Qwen3.5-VL 9B, выпущенные 2026-09-20 вместе с базовой моделью, и официальный README Qwen-Image 2.1 рекомендует их как способ подготовки промптов по умолчанию: "Для лучших результатов мы рекомендуем использовать официальные модели переписывания промптов, чтобы разворачивать короткие промпты в подробные описания высокого качества."

  • PE-T2I превращает краткий запрос на любом языке в длинный английский промпт плюс рекомендуемое соотношение сторон. Её ответ возвращается в виде JSON после блока think: {"rewritten_prompt": ..., "wh_ratio": "16:9"}.
  • PE-I2I принимает инструкцию редактирования и до 10 референсных изображений, адресуемых как <image1>, <image2> и так далее, и возвращает точный промпт редактирования. В её JSON-ответ добавляется ratio_follow, который указывает входное изображение, чьё соотношение сторон должен унаследовать результат.

Обе модели предназначены для сэмплирования с включённым режимом thinking: официальный пример использует temperature 1.0, top_p 0.95, top_k 20, с max_new_tokens 16256 для чекпойнта text-to-image и 24000 для чекпойнта редактирования.

Официальный пример редактирования с несколькими референсами Qwen-Image 2.1

Официальный пример Qwen-Image 2.1: образ, собранный из пяти референсных изображений: именно такие инструкции с несколькими изображениями переписыватель PE-I2I обучен превращать в явный промпт.

Запуск внутри ComfyUI

Три официальных шаблона Qwen-Image 2.1 в ComfyUI охватывают text-to-image, редактирование изображений и удаление фона, и ни один из них не вызывает переписыватели. Comfy-Org действительно перепаковала два PE-веса в файлы int8 convrot внутри Comfy-Org/Qwen-Image-2.1 (text_encoders/qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors и ..._pe_i2i...), но загрузить их недостаточно: ещё нужно собрать chat-промпт, прочитать JSON обратно и передать результат сэмплеру.

Пакет узлов делает именно это с помощью двух узлов, оба зарегистрированы в категории Qwen Image:

УзелВходыВыходы
QwenImage21_T2IPromptRewriteCLIP, промпт, параметры сэмплированияpositive_prompt, negative_prompt, wh_ratio, thinking, parse_ok
QwenImage21_EditPromptRewriteCLIP, промпт, image_1image_10то же, плюс ratio_follow
Узел T2I Prompt Rewrite

Узел переписывания T2I: на входе короткий промпт, на выходе развёрнутый промпт, соотношение сторон и трейс рассуждений.

PE-файл загружается обычным узлом Load CLIP с type = qwen_image, а генерация проходит по собственному пути ComfyUI clip.tokenize()clip.generate()clip.decode(), тот же механизм, что и во встроенном узле TextGenerate. Никакого внешнего сервера, никакого отдельного пайплайна transformers.

Узел Edit Prompt Rewrite

Узел редактирования предоставляет десять слотов для изображений и возвращает переписанную инструкцию плюс соотношение сторон для наследования.

Несколько настроек стоит скопировать из README, поскольку у двух чекпойнтов они различаются:

ПараметрT2IEdit
presence_penalty1.50
max length1625624000
thinkingвкл.вкл.

Высокий штраф не даёт переписывателю text-to-image повторяться, тогда как переписыватель для редактирования должен работать без него. Обе модели обучались с блоками think, поэтому пакет отделяет трейс рассуждений от ответа перед разбором JSON и сообщает parse_ok, когда ответ разбирается без ошибок. Установка необязательного пакета json_repair позволяет спасти слегка повреждённые ответы вместо ошибки.

Подключение к графу

Улучшитель промптов, подключённый к графу Qwen-Image 2.1

Граф из README: Load CLIP с PE-чекпойнтом питает узел переписывания, а его positive_prompt идёт дальше в Text Encode Qwen Image 2.1.

При запуске text-to-image переписанная строка заменяет то, что вы ввели бы в узел text encode, а wh_ratio может управлять выбором разрешения вместо вручную заданных ширины и высоты. При запуске редактирования референсные изображения помещаются в слоты узла, инструкция ссылается на них как <image1> и <image2>, а ratio_follow определяет, какому входу должен соответствовать выходной холст.

Доступность

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Модели улучшения промптов Qwen-Image 2.1 запускаются в ComfyUI | ComfyUI Wiki