LLaDA-Image: InclusionAI의 6B 이미지 생성 및 편집 모델
ComfyUI Wiki
LLaDA-Image는 텍스트 기반 이미지 생성과 네이티브 인스트럭션 편집을 지원하는 InclusionAI의 오픈 6B 모델이며, 4스텝 Turbo 변형과 커뮤니티 ComfyUI 노드 팩을 제공합니다.
L
LLaDA-Image
텍스트 기반 이미지 생성이미지 편집6B텍스트 렌더링InclusionAI(Ant Group)의 오픈 6B 통합 이미지 모델입니다. 하나의 checkpoint가 텍스트 기반 이미지 생성과 네이티브 인스트럭션 기반 편집을 모두 처리하며, 중국어와 영어 이중 언어 텍스트 렌더링과 공개된 학습 레시피를 갖추고 있습니다. LLaDA-Image Turbo는 파이프라인을 2~4 샘플링 스텝으로 증류했습니다.
LLaDA-Image는 백본과 DiT가 모두 하나의 프레임워크에서 학습된 diffusion 모델인 통합 diffusion 모델입니다. 텍스트 기반 이미지 생성 모델에 편집 기능을 덧붙이는 방식이 아니라, 하나의 checkpoint가 생성, 참조 보존을 지원하는 인스트럭션 기반 편집, 그리고 SigVQ 조건화 모듈을 통한 VQ 조건화 생성을 모두 담당합니다.
Qwen-Image-Bench에서 영어 53.53점, 중국어 53.38점을 기록했으며, 공개 당시 오픈 6B 모델 중 종합 성능 최고 수준입니다. 전체 학습 레시피는 함께 공개된 arXiv 보고서에 문서화되어 있습니다.
모델
| 모델 | 스텝 | 설명 | 라이선스 | 출시 |
|---|---|---|---|---|
| LLaDA-Image Turbo | 2-4 | ComfyUI용으로 패키징된 Twin-DMD 증류 변형 (BF16 / INT8) | Apache-2.0 | 2026-09-04 |
위에서 모델을 선택하면 엄선된 가중치 다운로드, 튜토리얼 및 관련 정보를 확인할 수 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.