- 홈
- Models
- Qwen Image
- Qwen-Image 2.1: RGBA 출력을 지원하는 7B 통합 생성 및 편집 모델
Qwen-Image 2.1: RGBA 출력을 지원하는 7B 통합 생성 및 편집 모델
Qwen-Image 2.1은 알리바바의 7B 단일 스트림 DiT로, 텍스트 기반 이미지 생성과 편집을 하나로 처리하며 최대 10개의 참조 이미지에서 실제 RGBA 알파를 기록합니다.
Qwen-Image 2.1
텍스트 기반 이미지 생성이미지 편집투명도오픈 소스알리바바가 공개한 Qwen-Image의 오픈 웨이트 후속 모델입니다. 32개 레이어로 구성된 7B 단일 스트림 diffusion transformer로, 동일한 웨이트로 생성과 편집을 모두 수행하고 실제 RGBA 알파 채널을 기록하며 최대 10개의 참조 이미지를 입력받아 2048x2048부터 2752x1536까지 네이티브로 출력합니다.
| 개발사 | Alibaba Cloud (Qwen 팀) |
| 출시 날짜 | 2026-09 |
| 아키텍처 | 단일 스트림 DiT (7B 비주얼 생성 컴포넌트, 32 레이어) |
| 텍스트 인코더 | Qwen3-VL-8B (Comfy-Org 재패키징) |
| 라이선스 | Qwen Research 라이선스 |
| 생성 모드 | 텍스트 기반 이미지 생성, 지시 기반 편집, 투명(RGBA) 출력, 피사체 추출 |
| 네이티브 해상도 | 2048x2048 (1:1)부터 2752x1536 (16:9)까지, 대응하는 세로 비율 포함 |
Qwen-Image 2.1이란?
Qwen-Image 2.1은 알리바바의 오픈 웨이트 Qwen-Image 라인의 2세대 모델로, 초기 릴리스의 20B MMDiT 백본을 32개의 단일 스트림 DiT 레이어로 구성된 7B 비주얼 생성 컴포넌트로 대체했습니다. 모델 카드에서는 네 가지 변화를 설명합니다.
- 간결하고 효율적입니다. 혼합 세분성 어텐션과 프리픽스 KV 캐시 재사용을 통해 20B 세대보다 훨씬 낮은 연산 비용으로 높은 이미지 품질을 유지합니다.
- 통합 생성 및 편집과 결합된 네이티브 투명도. 하나의 모델이 텍스트로부터 일반 또는 투명 RGBA 이미지를 생성하고, 투명 레이어를 편집하며, 사진에서 피사체를 추출합니다.
- 다양한 편집 기능. 요청당 최대 10개의 참조 이미지, 원형 표시나 페인트 주석 또는 별도의 마스크로 지정하는 로컬 편집, 인물과 제품의 정체성 보존을 지원합니다.
- 사실적인 질감과 개선된 미학. 향상된 타이포그래피, 인물 조명, 세밀한 디테일.
네이티브 출력 크기는 1:1의 2048x2048부터 2400x1792(4:3), 2528x1696(3:2), 2752x1536(16:9)까지이며, 이에 대응하는 세로 비율도 제공합니다.
실제 알파 채널을 사용한 투명 이미지
가장 눈에 띄는 변화는 파일까지 유지되는 투명도입니다. 단색 배경 위에서 생성한 뒤 매팅 모델로 피사체를 잘라내는 대신, Qwen-Image 2.1은 알파 채널 자체를 기록하므로 스티커, 제품 렌더, UI 에셋이 바로 합성 가능한 상태로 나옵니다. 모델 카드에서는 이를 작동시키기 위한 명시적인 프롬프트 형식을 권장합니다.
This is an RGBA image with transparency. <your subject description>.
The image has alpha channel and the background is transparent.ComfyUI 지원
Qwen-Image 2.1은 출시 첫날 통합 PR(Comfy-Org/ComfyUI #16400)과 함께 ComfyUI에 추가되었으며, 공식 템플릿은 ComfyUI 0.37.0 이상이 필요합니다. 재패키징된 단일 파일 웨이트는 Comfy-Org/Qwen-Image-2.1에 있으며, BF16 및 INT8 convrot 트랜스포머와 Qwen3-VL-8B 텍스트 인코더, 선택적 프롬프트 인핸서가 포함되어 있습니다.
Guides and workflows related to this model series.
댓글
GitHub로 로그인하고 토론에 참여하세요.