Ming-Image 0.1 Design: ComfyUIで使える6BのUI・ポスターモデル
Ming-Image 0.1 Designは、UI、インフォグラフィック、テキスト主体のポスター向けのinclusionAIによる6Bのテキストから画像へのモデルで、RGBA透過と進行中のComfyUIサポートを備えています。
公式モデルカードのデザイン例。
Ming-Image 0.1 Designとは
Ming-Image 0.1 Designは、LingおよびBailingモデルファミリーを手がけたチームであるinclusionAIによるもので、一般的な画像モデルが苦手とする仕事、つまり写真ではなくクリーンで読みやすいデザインをレイアウトすることを目的としています。画面、ダッシュボード、レスポンシブなカードレイアウト、インフォグラフィックパネル、製品ポスター、ロゴシートがターゲットコンテンツであり、公式サンプルはレンダリングされたテキストが判読可能でタイポグラフィ的にも妥当であることに大きく依存しています。
- 6B diffusion transformer。 DiTは30層、3840次元の設計で、16個の入力チャンネルと2x2パッチングを備え、別個のvision-languageエンコーダーと専用のコネクターが組み合わされています。Kijaiはベースを、新しいテキストエンコーダーを伴うZ-Image派生のものと説明しています。
- デザイン優先のトレーニングデータであり、一般的な写真コーパスではありません。そのため出力は、実際のテキストブロックを伴う構成されたレイアウトとして読めます。
- 2つのネイティブ出力バケット、1024と2048。フルレイアウトには2048が推奨されます。
- サンプリングのデフォルトは短め: CFG 1.0で12ステップなので、デザインは少ないパス数で出力されます。
- プロンプト拡張は想定されたフローの一部です。 公式パイプラインでは生成前に
Ling-3.0-flash-VLまたはqwen3.8-27Bでプロンプトを書き換えることが推奨されており、配置すべきテキストが多い高密度なレイアウトで特に重要になります。
公式のテキストから画像へのサンプルの1つ、レスポンシブなカードレイアウト。
透過背景を第一級の出力として
通常の画像に加えて、Ming-Image 0.1 Designは実際のアルファチャンネルを持つRGBA画像を出力できるため、生成されたポスター要素、製品の切り抜き、UIアセットは、別途マッティング処理を必要とせず、合成可能な状態で得られます。モデルカードには推奨トリガーフレーズのセットが用意されており、そのうち正確に1つをプロンプトの先頭に付けるよう求めています。これはQwen-Image 2.1が透過モードで使うのと同じパターンです。
透過背景の出力。チェッカーボードはアルファチャンネルをプレビューするもので、生成画像の一部ではありません。
姉妹モデルのLayer: デザインから編集可能なレイヤーへ
このシリーズには2つ目の6Bチェックポイント、Ming-Image 0.1 Design Layerがあり、これは問題を逆方向に解きます。つまり、フラット化されたデザイン画像を受け取り、個別に編集可能な透過レイヤーへと分解します。これは生成されたモックアップを、デザインツールで実際に作業できるものに変えるステップであり、inclusionAIはこれを2つの公開エージェントワークフローと組み合わせています。生成された参照とレイヤー分解を使ってUIコードを構築し視覚的に確認するLing UI Designスキルと、生成されたページをネイティブのPowerPoint要素として再現するimage-to-editable-PPTスキルです。
Layerチェックポイントは、デザインモデルとは異なるサンプリングのデフォルトを使用します。CFG 2.0で12ステップ、対応するバケットは512と1024です。
UI/UXリーダーボードでの位置づけ
inclusionAIはリリースとともに、このモデルをArtificial AnalysisのUI/UX Designリーダーボードで公開しました。これはこのモデルが誰と競合しているかを示す最も明確なシグナルです。
公式リポジトリによる、UI/UX Designリーダーボード上でのMing-Image 0.1 Designの位置。
ComfyUIのサポート状況
Ming-ImageのComfyUIサポートは進行中であるため、マージされたコア実装や公式ワークフローテンプレートはまだありません。今日すぐに使えるようにする要素は2つあります。
- Kijaiは重みのComfyUI向け再パッケージを
Kijai/Ming-Image-ComfyUIで公開しています。transformerとテキストエンコーダーのBF16、int8_convrot、w4a8バリアント、および対応するVAEが含まれ、通常のdiffusion_models/text_encoders/vaeフォルダー構成で配置されています。 - コア実装はComfyUI PR #16482にあり、そこではKijaiがノードがすでにRGBA出力を扱えると述べています。プルリクエストはまだオープンなので、未改変のComfyUIインストールではまだこのモデルを読み込めません。
Banodocoの#ming-imageチャンネルでの初期テストでは、ここではサンプラーがいつも以上に重要であることが示唆されています。KijaiはLCMの出力はクリーンだがスムーズすぎること、INT8ではランダムなテキストの失敗が依然としてよく起こることを指摘しており、一方RuneXは、このモデルがバウンディングボックス形式のプロンプトに反応し、その小さなサイズゆえに素早く編集できると報告しています。Layerチェックポイントはまだパッケージ化されていません。Kijaiは、追加のテキストエンコーダーとプロジェクターの処理を、より限定的なユースケースに対して大きな複雑さだと見ているためです。
コメント
GitHubでサインインしてディスカッションに参加しましょう。