Ming-Image 0.1 Design: ComfyUI용 6B UI 및 포스터 모델

ComfyUI Wikinews

Ming-Image 0.1 Design은 UI, 인포그래픽, 텍스트가 많은 포스터를 위한 inclusionAI의 6B 텍스트 기반 이미지 생성 모델로, RGBA 투명도와 진행 중인 ComfyUI 지원을 제공합니다.

Ming-Image 0.1 Design(Hugging Face | GitHub | ModelScope)은 비주얼 디자인을 겨냥한 inclusionAI의 6B 오픈 웨이트 텍스트 기반 이미지 생성 모델입니다. UI 화면, 인포그래픽, 포스터 및 기타 텍스트가 많은 구성이 대상입니다. 실제 RGBA 투명도도 생성하며, 자매 checkpoint는 완성된 디자인을 편집 가능한 레이어로 분해합니다. ComfyUI 지원은 현재 작업 중입니다.
Ming-Image 0.1 Design 생성 예시

공식 모델 카드의 디자인 예시.

Ming-Image 0.1 Design이란

Ming-Image 0.1 Design은 Ling과 Bailing 모델 제품군을 만든 팀인 inclusionAI에서 나왔으며, 일반 이미지 모델이 잘 처리하지 못하는 작업, 즉 사진이 아닌 깔끔하고 읽기 쉬운 디자인을 배치하는 일을 목표로 합니다. 화면, 대시보드, 반응형 카드 레이아웃, 인포그래픽 패널, 제품 포스터, 로고 시트가 대상 콘텐츠이며, 공식 샘플은 렌더링된 텍스트가 읽기 쉽고 타이포그래피가 제대로 잡히는 것에 크게 의존합니다.

  • 6B diffusion transformer. DiT는 16개 입력 채널과 2x2 패칭을 갖춘 30레이어, 3840차원 설계이며, 별도의 비전-언어 인코더와 자체 커넥터가 결합됩니다. Kijai는 이 베이스를 새로운 텍스트 인코더를 사용한 Z-Image 파생 모델이라고 설명합니다.
  • 일반 사진 코퍼스가 아닌 디자인 우선 학습 데이터를 사용하며, 그래서 출력이 실제 텍스트 블록이 있는 구성된 레이아웃으로 읽힙니다.
  • 두 가지 기본 출력 버킷인 1024와 2048을 제공하며, 전체 레이아웃에는 2048을 권장합니다.
  • 샘플링 기본값이 짧습니다. CFG 1.0에서 12 스텝이므로 적은 횟수의 패스로 디자인이 나옵니다.
  • 프롬프트 강화는 의도된 흐름의 일부입니다. 공식 pipeline은 생성 이전에 Ling-3.0-flash-VL 또는 qwen3.8-27B로 프롬프트를 다시 작성할 것을 권장하며, 이는 배치할 텍스트가 많은 밀집 레이아웃에서 가장 중요합니다.
Ming-Image 0.1 Design이 생성한 반응형 카드 레이아웃

공식 텍스트 기반 이미지 생성 샘플 중 하나인 반응형 카드 레이아웃.

일급 출력으로서의 투명 배경

일반 이미지와 함께 Ming-Image 0.1 Design은 실제 알파 채널이 있는 RGBA 이미지를 출력할 수 있어, 생성된 포스터 요소, 제품 컷아웃 또는 UI 에셋이 별도의 매팅 패스 없이 바로 합성할 수 있는 상태로 나옵니다. 모델 카드에는 권장 트리거 문구 세트가 포함되어 있으며 그중 정확히 하나를 앞에 붙이라고 안내합니다. 이는 Qwen-Image 2.1이 투명도 모드에 사용하는 것과 동일한 패턴입니다.

투명 배경 생성 결과

투명 배경 출력. 체커보드는 알파 채널을 미리 보여주는 것이며 생성된 이미지의 일부가 아닙니다.

Layer 자매 모델: 디자인을 편집 가능한 레이어로

이 시리즈에는 두 번째 6B checkpoint인 Ming-Image 0.1 Design Layer가 있으며, 이는 문제를 반대로 풉니다. 평탄화된 디자인 이미지를 받아 각각 편집 가능한 투명 레이어로 분해합니다. 이것이 생성된 목업을 디자인 도구에서 실제로 작업할 수 있는 것으로 바꿔 주는 단계이며, inclusionAI는 이를 두 가지 공개 에이전트 워크플로와 함께 제공합니다. 생성된 레퍼런스와 레이어 분해를 활용해 UI 코드를 만들고 시각적으로 확인하는 Ling UI Design skill과, 생성된 페이지를 네이티브 PowerPoint 요소로 재현하는 image-to-editable-PPT skill입니다.

Layer checkpoint는 디자인 모델과 다른 샘플링 기본값을 사용합니다. CFG 2.0에서 12 스텝이며, 512와 1024 버킷이 작동합니다.

UI/UX 리더보드에서의 위치

inclusionAI는 이 모델을 출시와 함께 Artificial Analysis UI/UX Design 리더보드에 공개했으며, 이는 이 모델이 누구와 경쟁하는지 보여 주는 가장 명확한 신호입니다.

UI/UX Design 리더보드에서의 Ming-Image 0.1 Design

공식 저장소에서 가져온 UI/UX Design 리더보드에서의 Ming-Image 0.1 Design 순위.

ComfyUI 사용 가능 여부

Ming-Image에 대한 ComfyUI 지원은 진행 중이므로, 아직 병합된 코어 구현이나 공식 워크플로 템플릿이 없습니다. 오늘 바로 사용할 수 있게 하는 두 가지가 있습니다.

  • Kijai는 Kijai/Ming-Image-ComfyUI에 가중치의 ComfyUI 재패키징을 공개했습니다. transformer와 텍스트 인코더의 BF16, int8_convrot, w4a8 변형과 그에 맞는 VAE가 포함되어 있으며, 일반적인 diffusion_models / text_encoders / vae 폴더 구조로 배치되어 있습니다.
  • 코어 구현은 ComfyUI PR #16482에 있으며, Kijai는 해당 node가 이미 RGBA 출력을 처리한다고 밝혔습니다. pull request는 아직 열려 있으므로, 수정되지 않은 ComfyUI 설치로는 아직 이 모델을 불러올 수 없습니다.

Banodoco #ming-image 채널의 초기 테스트는 여기서 샘플러가 평소보다 더 중요하다는 것을 시사합니다. Kijai는 LCM 출력이 깔끔하지만 지나치게 부드럽고 INT8에서 무작위 텍스트 실패가 여전히 흔하다고 언급했으며, RuneX는 이 모델이 바운딩 박스 스타일 프롬프트에 반응하고 작은 크기 덕분에 빠르게 편집된다고 보고합니다. Layer checkpoint는 아직 패키징되지 않고 있는데, Kijai가 추가 텍스트 인코더와 projector 처리를 더 좁은 사용 사례에 비해 상당한 복잡도로 보기 때문입니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Ming-Image 0.1 Design: ComfyUI용 6B UI 및 포스터 모델 | ComfyUI Wiki