- ホーム
- Models
- Qwen Image
- Qwen-Image 2.1: RGBA出力に対応した7B統合生成・編集モデル
Qwen-Image 2.1: RGBA出力に対応した7B統合生成・編集モデル
Qwen-Image 2.1は、テキストから画像への生成と編集を1つに統合したAlibabaの7BシングルストリームDiTです。最大10枚の参照画像から実際のRGBAアルファを書き出します。
Qwen-Image 2.1
Text-to-ImageImage EditingTransparencyOpen SourceAlibabaによるオープンウェイトなQwen-Imageの後継モデルです。7Bのシングルストリーム拡散Transformer(32層)で、同一のウェイトのまま生成と編集を行い、実際のRGBAアルファチャンネルを書き出し、最大10枚の参照画像を受け付け、2048x2048から2752x1536までネイティブに出力します。
| 開発元 | Alibaba Cloud(Qwenチーム) |
| リリース日 | 2026-09 |
| アーキテクチャ | シングルストリームDiT(7Bの視覚生成コンポーネント、32層) |
| テキストエンコーダー | Qwen3-VL-8B(Comfy-Org 再パッケージ版) |
| ライセンス | Qwen Research License |
| 生成モード | テキストから画像への生成、指示による編集、透過(RGBA)出力、被写体抽出 |
| ネイティブ解像度 | 2048x2048(1:1)から2752x1536(16:9)まで、対応する縦位置の比率も含む |
Qwen-Image 2.1とは?
Qwen-Image 2.1は、AlibabaのオープンウェイトなQwen-Imageシリーズの第2世代モデルです。オリジナル版の20B MMDiTバックボーンを、32層のシングルストリームDiTレイヤーで構成された7Bの視覚生成コンポーネントに置き換えています。モデルカードでは4つの変更点が説明されています。
- コンパクトで効率的。 混合粒度アテンションとプレフィックスKVキャッシュの再利用により、20B世代よりはるかに低い計算コストで高い画像品質を維持します。
- 作成と編集を統合したネイティブな透過。 1つのモデルが、テキストから通常画像または透過RGBA画像を書き出し、透過レイヤーを編集し、写真から被写体を抽出します。
- 多用途な編集。 1リクエストにつき最大10枚の参照画像、円や描き込み注釈、または別途用意したマスクで指定する局所編集、人物や製品の同一性保持に対応します。
- リアルなテクスチャと洗練された美学。 文字組み、ポートレートのライティング、細部のディテールが改善されています。
ネイティブの出力サイズは、1:1なら2048x2048から始まり、2400x1792(4:3)、2528x1696(3:2)、2752x1536(16:9)まで対応し、それぞれに対応する縦位置の比率も用意されています。
実際のアルファチャンネルを持つ透過画像
最大の変更点は、ファイルにそのまま残る透過です。平坦な背景の上で生成してからマッティングモデルで被写体を切り抜くのではなく、Qwen-Image 2.1はアルファチャンネル自体を書き出すため、ステッカーや製品レンダリング、UIアセットはそのまま合成できる状態で出力されます。モデルカードでは、これをトリガーするための明示的なプロンプト形式が推奨されています。
This is an RGBA image with transparency. <your subject description>.
The image has alpha channel and the background is transparent.ComfyUIのサポート
Qwen-Image 2.1は統合PR(Comfy-Org/ComfyUI #16400)とともに初日からComfyUIに搭載され、公式テンプレートにはComfyUI 0.37.0以降が必要です。再パッケージされた単一ファイルのウェイトはComfy-Org/Qwen-Image-2.1にあり、BF16とINT8のconvrot transformer、Qwen3-VL-8Bテキストエンコーダー、オプションのプロンプトエンハンサーが含まれます。
Guides and workflows related to this model series.
コメント
GitHubでサインインしてディスカッションに参加しましょう。