LLaDA-Image: InclusionAI 오픈소스 6B 이미지 생성 및 편집 모델 출시

ComfyUI Wikinews

InclusionAI 가 4 단계 Turbo 변형과 INT8 및 GGUF 가중치를 가진 커뮤니티 ComfyUI 노드 팩을 포함한 6B 통합 생성 및 편집 모델 LLaDA-Image 를 출시했습니다.

LLaDA-Image (GitHub, Hugging Face) 는 InclusionAI(링을 개발한 알리바바 그룹 팀) 에서 공개한 6B 파라미터 통합 이미지 생성 및 편집 모델 패밀리입니다. 9 월 4 일 Apache-2.0 라이선스로 전체 오픈 학습 레시피와 함께 출시되었습니다. RebelAI 의 커뮤니티 ComfyUI 노드 팩 이 이미 로컬에서 실행 중입니다.
LLaDA-Image photorealistic generation showcase

공식 저장소의 사진 사실적 생성 샘플: 자연스러운 조명, 생생한 디테일 및 일관된 다중 피사체 장면.

생성 및 편집을 위한 단일 체크포인트

LLaDA-Image 는 백본과 DiT 모두 단일 프레임워크에서 훈련된 확산 모델인 통합 확산 모델입니다. 텍스트 기반 이미지 모델에 부착된 에디터 애드온과는 달리, 단일 체크포인트가 다음을 처리합니다:

  • 텍스트 기반 이미지 생성 베이스 모델에서 50 스텝
  • 지시 가이드 편집 참조 보존, denoise-strength img2img 우회책 대신 모델의 네이티브 편집 경로 사용
  • SigVQ 조건화 모듈 을 통한 VQ 조건화 생성
  • 생성된 이미지의 중국어 및 영어 텍스트 렌더링

동반된 arXiv 보고서 에서 학습 레시피가 완전히 공개되었습니다: 이미지 전용 사전 훈련이 시각적 사전 지식을 먼저 구축하고, 짝지어진 언어 감독이 그다음이며, 결합 생성 - 편집 훈련이 두 기술을 통합합니다. Qwen-Image-Bench 에서 영어 53.53 점, 중국어 53.38 점을 기록하여 출시 당시 오픈 6B 모델로서 최신 기술 수준의 전반적인 결과를 달성했습니다.

Text rendering and poster generation showcase

포스터 등급 레이아웃의 중국어 및 영어 텍스트 렌더링.

Instruction-guided editing showcase

네이티브 편집: 콘텐츠는 충실하게 유지되지만 지시된 변경 사항만 적용됩니다.

Turbo: 50 대신 4 스텝

베이스 모델과 함께 LLaDA-Image-Turbo 는 Twin-DMD 증류로 파이프라인을 증류하여 생성 및 편집 모두를 위해 2~4 개의 샘플링 스텝으로 줄입니다. 첫날 4 가지 체크포인트 변형이 제공됩니다: 베이스와 Turbo 각각에 대해 BF16 및 FP8, diffusers 레이아웃당 변형당 약 49GB.

모델스텝체크포인트
LLaDA-Image (Base)50BF16, FP8
LLaDA-Image-Turbo2-4BF16, FP8
Qwen-Image-Bench comparison

Qwen-Image-Bench 전체 점수: LLaDA-Image 는 영어와 중국어 모두 오픈 6B 카테고리에서 1 위를 차지합니다.

RebelAI 노드 팩으로 ComfyUI 에서 실행하기

RealRebelAI 의 커뮤니티 통합은 가중치가 공개된 같은 날 제공되었습니다. 팩은 4 개의 노드를 제공합니다: LLaDA Image Loader, LLaDA Image Text to Image, LLaDA Image EditLLaDA Image Unload. 편집 노드는 모델의 네이티브 편집 경로 (generation_mode="editing") 를 호출하며, denoise-strength 근사치가 아니며, 편집 크기는 32 로 나누어 떨어져야 합니다.

통합은 RealRebelAI/LLaDa-Image-Turbo_ComfyUI 의 최적화된 가중치와 일치하는 베이스 팩을 사용하며, 팩당 약 29GB 입니다:

파일위치크기
LLaDA-Image-Turbo-transformer-BF16.safetensorsmodels/diffusion_models/13.1 GB
LLaDA-Image-Turbo-INT8.safetensorsmodels/diffusion_models/6.6 GB
LLaDA-Image-Turbo-text_encoder-Q4_K_M.ggufmodels/text_encoders/9.2 GB
LLaDa_VAE.safetensorsmodels/vae/0.17 GB

INT8 트랜스포머는 GGUF 가 아닌 네이티브 safetensors 양자화입니다; GGUF 는 양자화된 LLaDA2-MoE 텍스트 인코더에만 사용됩니다. Turbo 의 경우 4 스텝과 CFG 1.0 으로 시작하세요.

학습 코드는 공식 로드맵에서 곧 출시 예정으로 표시되어 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
LLaDA-Image: InclusionAI 오픈소스 6B 이미지 생성 및 편집 모델 출시 | ComfyUI Wiki