ComfyUI에서 실행되는 Qwen-Image 2.1 프롬프트 향상 모델

ComfyUI Wikinews

Qwen의 PE-T2I 및 PE-I2I 프롬프트 재작성 모델이 짧은 요청과 편집 지침을 확장하며, 커뮤니티 노드 팩이 CLIP 로드를 통해 두 모델을 ComfyUI에서 실행합니다.

Qwen은 Qwen-Image 2.1과 함께 두 개의 전용 프롬프트 재작성 모델을 공개했습니다. 텍스트 기반 이미지 생성 요청용 Qwen-Image-2.1-PE-T2I와 편집 지침용 Qwen-Image-2.1-PE-I2I입니다. ComfyUI에는 아직 이들을 위한 노드가 없어서, 커뮤니티 팩인 ComfyUI-Qwen-Image-2.1-Prompt-Enhancer가 이제 두 모델을 그래프에 연결해 줍니다.

각 작업에 하나씩, 두 개의 재작성기

PE 체크포인트는 Qwen3.5-VL 9B를 파인튜닝한 모델로, 2026-09-20에 베이스 모델과 함께 공개되었으며, 공식 Qwen-Image 2.1 README는 이들을 프롬프트를 준비하는 기본 방법으로 권장합니다. "최상의 결과를 얻으려면 공식 프롬프트 재작성 모델을 사용해 짧은 프롬프트를 상세하고 고품질의 설명으로 확장하는 것을 권장합니다."

  • PE-T2I는 모든 언어의 짧은 요청을 긴 영어 프롬프트와 권장 화면 비율로 변환합니다. 응답은 think 블록 뒤에 JSON으로 반환됩니다: {"rewritten_prompt": ..., "wh_ratio": "16:9"}.
  • PE-I2I는 편집 지침과 최대 10개의 참조 이미지를 입력으로 받으며, 이미지는 <image1>, <image2> 등으로 지칭되고, 정확한 편집 프롬프트를 반환합니다. JSON 응답에는 출력이 상속해야 할 화면 비율을 가진 입력 이미지의 이름을 담은 ratio_follow가 추가됩니다.

두 모델 모두 thinking을 활성화한 상태로 샘플링하도록 설계되었습니다. 공식 예시는 temperature 1.0, top_p 0.95, top_k 20을 사용하며, 텍스트 기반 이미지 생성 체크포인트에는 max_new_tokens 16256, 편집용에는 24000을 사용합니다.

공식 Qwen-Image 2.1 다중 참조 편집 예시

공식 Qwen-Image 2.1 예시: 다섯 개의 참조 이미지로 구성한 의상으로, PE-I2I 재작성기가 명시적 프롬프트로 변환하도록 훈련된 멀티 이미지 지침 유형입니다.

ComfyUI 내부에서 실행하기

ComfyUI의 공식 Qwen-Image 2.1 템플릿 세 개는 텍스트 기반 이미지 생성, 이미지 편집, 배경 제거를 다루며, 그중 어느 것도 재작성기를 호출하지 않습니다. Comfy-Org가 Comfy-Org/Qwen-Image-2.1에 두 PE 가중치를 int8 convrot 파일로 재패키징하기는 했지만(text_encoders/qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors..._pe_i2i...), 이를 로딩하는 것은 절반에 불과합니다. 채팅 프롬프트를 구성하고, JSON을 다시 읽고, 결과를 샘플러에 노출하는 작업이 여전히 필요합니다.

이 노드 팩은 두 개의 노드로 이를 정확히 수행하며, 둘 다 Qwen Image 카테고리에 등록됩니다.

노드입력출력
QwenImage21_T2IPromptRewriteCLIP, prompt, 샘플링 제어positive_prompt, negative_prompt, wh_ratio, thinking, parse_ok
QwenImage21_EditPromptRewriteCLIP, prompt, image_1image_10동일, 추가로 ratio_follow
T2I Prompt Rewrite 노드

T2I 재작성 노드: 짧은 프롬프트가 입력되면 확장된 프롬프트, 화면 비율, 추론 과정이 출력됩니다.

PE 파일은 일반 Load CLIP 노드에 type = qwen_image를 설정해 로드하며, 생성은 ComfyUI 자체의 clip.tokenize()clip.generate()clip.decode() 경로를 통해 실행됩니다. 내장 TextGenerate 노드 뒤에 있는 것과 동일한 메커니즘입니다. 외부 서버도, 별도의 transformers 파이프라인도 필요 없습니다.

Edit Prompt Rewrite 노드

편집 노드는 10개의 이미지 슬롯을 노출하고 재작성된 지침과 상속할 비율을 반환합니다.

몇 가지 설정은 README에서 그대로 가져올 가치가 있습니다. 두 체크포인트가 이를 공유하지 않기 때문입니다.

매개변수T2IEdit
presence_penalty1.50
max length1625624000
thinking켜짐켜짐

높은 페널티는 텍스트 기반 이미지 생성 재작성기가 같은 내용을 반복하지 않도록 막아 주는 반면, 편집 재작성기는 이를 사용하지 않고 실행되도록 설계되었습니다. 두 모델 모두 think 블록으로 훈련되었기 때문에, 이 팩은 JSON을 파싱하기 전에 추론 과정을 답변에서 분리하고, 답변이 깨끗하게 파싱되면 parse_ok를 보고합니다. 선택 사항인 json_repair 패키지를 설치하면 약간 잘못된 형식의 답변도 실패하는 대신 복구할 수 있습니다.

그래프에 연결하기

Qwen-Image 2.1 그래프에 연결된 프롬프트 향상기

README의 그래프: PE 체크포인트를 로드한 Load CLIP이 재작성 노드에 연결되고, 그 positive_prompt가 Text Encode Qwen Image 2.1로 이어집니다.

텍스트 기반 이미지 생성 실행에서는 재작성된 문자열이 텍스트 인코드 노드에 입력했을 내용을 대체하며, wh_ratio는 직접 고른 너비와 높이 대신 해상도 선택기를 구동할 수 있습니다. 편집 실행에서는 참조 이미지가 노드의 이미지 슬롯에 들어가고, 지침에서 <image1><image2>로 이들을 참조하며, ratio_follow가 출력 캔버스가 어느 입력과 일치해야 하는지 결정합니다.

사용 가능 여부

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
ComfyUI에서 실행되는 Qwen-Image 2.1 프롬프트 향상 모델 | ComfyUI Wiki