Qwen-Image 2.1: RGBA出力に対応した7B統合生成・編集モデル

ComfyUI Wiki

Qwen-Image 2.1は、テキストから画像への生成と編集を1つに統合したAlibabaの7BシングルストリームDiTです。最大10枚の参照画像から実際のRGBAアルファを書き出します。

Q

Qwen-Image 2.1

Text-to-ImageImage EditingTransparencyOpen Source

AlibabaによるオープンウェイトなQwen-Imageの後継モデルです。7Bのシングルストリーム拡散Transformer(32層)で、同一のウェイトのまま生成と編集を行い、実際のRGBAアルファチャンネルを書き出し、最大10枚の参照画像を受け付け、2048x2048から2752x1536までネイティブに出力します。

開発元Alibaba Cloud(Qwenチーム)
リリース日2026-09
アーキテクチャシングルストリームDiT(7Bの視覚生成コンポーネント、32層)
テキストエンコーダーQwen3-VL-8B(Comfy-Org 再パッケージ版)
ライセンスQwen Research License
生成モードテキストから画像への生成、指示による編集、透過(RGBA)出力、被写体抽出
ネイティブ解像度2048x2048(1:1)から2752x1536(16:9)まで、対応する縦位置の比率も含む

Qwen-Image 2.1とは?

Qwen-Image 2.1は、AlibabaのオープンウェイトなQwen-Imageシリーズの第2世代モデルです。オリジナル版の20B MMDiTバックボーンを、32層のシングルストリームDiTレイヤーで構成された7Bの視覚生成コンポーネントに置き換えています。モデルカードでは4つの変更点が説明されています。

  • コンパクトで効率的。 混合粒度アテンションとプレフィックスKVキャッシュの再利用により、20B世代よりはるかに低い計算コストで高い画像品質を維持します。
  • 作成と編集を統合したネイティブな透過。 1つのモデルが、テキストから通常画像または透過RGBA画像を書き出し、透過レイヤーを編集し、写真から被写体を抽出します。
  • 多用途な編集。 1リクエストにつき最大10枚の参照画像、円や描き込み注釈、または別途用意したマスクで指定する局所編集、人物や製品の同一性保持に対応します。
  • リアルなテクスチャと洗練された美学。 文字組み、ポートレートのライティング、細部のディテールが改善されています。

ネイティブの出力サイズは、1:1なら2048x2048から始まり、2400x1792(4:3)、2528x1696(3:2)、2752x1536(16:9)まで対応し、それぞれに対応する縦位置の比率も用意されています。

実際のアルファチャンネルを持つ透過画像

最大の変更点は、ファイルにそのまま残る透過です。平坦な背景の上で生成してからマッティングモデルで被写体を切り抜くのではなく、Qwen-Image 2.1はアルファチャンネル自体を書き出すため、ステッカーや製品レンダリング、UIアセットはそのまま合成できる状態で出力されます。モデルカードでは、これをトリガーするための明示的なプロンプト形式が推奨されています。

This is an RGBA image with transparency. <your subject description>.
The image has alpha channel and the background is transparent.

ComfyUIのサポート

Qwen-Image 2.1は統合PR(Comfy-Org/ComfyUI #16400)とともに初日からComfyUIに搭載され、公式テンプレートにはComfyUI 0.37.0以降が必要です。再パッケージされた単一ファイルのウェイトはComfy-Org/Qwen-Image-2.1にあり、BF16とINT8のconvrot transformer、Qwen3-VL-8Bテキストエンコーダー、オプションのプロンプトエンハンサーが含まれます。

Guides and workflows related to this model series.

No articles found.

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…