Модели улучшения промптов Qwen-Image 2.1 запускаются в ComfyUI
Модели переписывания промптов PE-T2I и PE-I2I от Qwen разворачивают короткие запросы и инструкции редактирования, а пакет узлов сообщества запускает обе в ComfyUI через Load CLIP.
Два переписывателя, по одному на каждую задачу
Чекпойнты PE представляют собой дообученные модели Qwen3.5-VL 9B, выпущенные 2026-09-20 вместе с базовой моделью, и официальный README Qwen-Image 2.1 рекомендует их как способ подготовки промптов по умолчанию: "Для лучших результатов мы рекомендуем использовать официальные модели переписывания промптов, чтобы разворачивать короткие промпты в подробные описания высокого качества."
- PE-T2I превращает краткий запрос на любом языке в длинный английский промпт плюс рекомендуемое соотношение сторон. Её ответ возвращается в виде JSON после блока
think:{"rewritten_prompt": ..., "wh_ratio": "16:9"}. - PE-I2I принимает инструкцию редактирования и до 10 референсных изображений, адресуемых как
<image1>,<image2>и так далее, и возвращает точный промпт редактирования. В её JSON-ответ добавляетсяratio_follow, который указывает входное изображение, чьё соотношение сторон должен унаследовать результат.
Обе модели предназначены для сэмплирования с включённым режимом thinking: официальный пример использует temperature 1.0, top_p 0.95, top_k 20, с max_new_tokens 16256 для чекпойнта text-to-image и 24000 для чекпойнта редактирования.
Официальный пример Qwen-Image 2.1: образ, собранный из пяти референсных изображений: именно такие инструкции с несколькими изображениями переписыватель PE-I2I обучен превращать в явный промпт.
Запуск внутри ComfyUI
Три официальных шаблона Qwen-Image 2.1 в ComfyUI охватывают text-to-image, редактирование изображений и удаление фона, и ни один из них не вызывает переписыватели. Comfy-Org действительно перепаковала два PE-веса в файлы int8 convrot внутри Comfy-Org/Qwen-Image-2.1 (text_encoders/qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors и ..._pe_i2i...), но загрузить их недостаточно: ещё нужно собрать chat-промпт, прочитать JSON обратно и передать результат сэмплеру.
Пакет узлов делает именно это с помощью двух узлов, оба зарегистрированы в категории Qwen Image:
| Узел | Входы | Выходы |
|---|---|---|
QwenImage21_T2IPromptRewrite | CLIP, промпт, параметры сэмплирования | positive_prompt, negative_prompt, wh_ratio, thinking, parse_ok |
QwenImage21_EditPromptRewrite | CLIP, промпт, image_1 … image_10 | то же, плюс ratio_follow |
Узел переписывания T2I: на входе короткий промпт, на выходе развёрнутый промпт, соотношение сторон и трейс рассуждений.
PE-файл загружается обычным узлом Load CLIP с type = qwen_image, а генерация проходит по собственному пути ComfyUI clip.tokenize() → clip.generate() → clip.decode(), тот же механизм, что и во встроенном узле TextGenerate. Никакого внешнего сервера, никакого отдельного пайплайна transformers.
Узел редактирования предоставляет десять слотов для изображений и возвращает переписанную инструкцию плюс соотношение сторон для наследования.
Несколько настроек стоит скопировать из README, поскольку у двух чекпойнтов они различаются:
| Параметр | T2I | Edit |
|---|---|---|
presence_penalty | 1.5 | 0 |
max length | 16256 | 24000 |
thinking | вкл. | вкл. |
Высокий штраф не даёт переписывателю text-to-image повторяться, тогда как переписыватель для редактирования должен работать без него. Обе модели обучались с блоками think, поэтому пакет отделяет трейс рассуждений от ответа перед разбором JSON и сообщает parse_ok, когда ответ разбирается без ошибок. Установка необязательного пакета json_repair позволяет спасти слегка повреждённые ответы вместо ошибки.
Подключение к графу
Граф из README: Load CLIP с PE-чекпойнтом питает узел переписывания, а его positive_prompt идёт дальше в Text Encode Qwen Image 2.1.
При запуске text-to-image переписанная строка заменяет то, что вы ввели бы в узел text encode, а wh_ratio может управлять выбором разрешения вместо вручную заданных ширины и высоты. При запуске редактирования референсные изображения помещаются в слоты узла, инструкция ссылается на них как <image1> и <image2>, а ratio_follow определяет, какому входу должен соответствовать выходной холст.
Доступность
- PE-T2I: Qwen/Qwen-Image-2.1-PE-T2I на Hugging Face
- PE-I2I: Qwen/Qwen-Image-2.1-PE-I2I на Hugging Face
- Готовые для ComfyUI копии: Comfy-Org/Qwen-Image-2.1 в
text_encoders/, int8 convrot - Пакет узлов: benjiyaya/ComfyUI-Qwen-Image-2.1-Prompt-Enhancer, клонируется в
ComfyUI/custom_nodes/ - Официальный код переписывания:
prompt_rewrite/в репозитории Qwen-Image 2.1, с точками входа для transformers, vLLM и vLLM server
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.