LLaDA-Image: InclusionAI 오픈소스 6B 이미지 생성 및 편집 모델 출시
InclusionAI 가 4 단계 Turbo 변형과 INT8 및 GGUF 가중치를 가진 커뮤니티 ComfyUI 노드 팩을 포함한 6B 통합 생성 및 편집 모델 LLaDA-Image 를 출시했습니다.
공식 저장소의 사진 사실적 생성 샘플: 자연스러운 조명, 생생한 디테일 및 일관된 다중 피사체 장면.
생성 및 편집을 위한 단일 체크포인트
LLaDA-Image 는 백본과 DiT 모두 단일 프레임워크에서 훈련된 확산 모델인 통합 확산 모델입니다. 텍스트 기반 이미지 모델에 부착된 에디터 애드온과는 달리, 단일 체크포인트가 다음을 처리합니다:
- 텍스트 기반 이미지 생성 베이스 모델에서 50 스텝
- 지시 가이드 편집 참조 보존,
denoise-strengthimg2img 우회책 대신 모델의 네이티브 편집 경로 사용 - SigVQ 조건화 모듈 을 통한 VQ 조건화 생성
- 생성된 이미지의 중국어 및 영어 텍스트 렌더링
동반된 arXiv 보고서 에서 학습 레시피가 완전히 공개되었습니다: 이미지 전용 사전 훈련이 시각적 사전 지식을 먼저 구축하고, 짝지어진 언어 감독이 그다음이며, 결합 생성 - 편집 훈련이 두 기술을 통합합니다. Qwen-Image-Bench 에서 영어 53.53 점, 중국어 53.38 점을 기록하여 출시 당시 오픈 6B 모델로서 최신 기술 수준의 전반적인 결과를 달성했습니다.
포스터 등급 레이아웃의 중국어 및 영어 텍스트 렌더링.
네이티브 편집: 콘텐츠는 충실하게 유지되지만 지시된 변경 사항만 적용됩니다.
Turbo: 50 대신 4 스텝
베이스 모델과 함께 LLaDA-Image-Turbo 는 Twin-DMD 증류로 파이프라인을 증류하여 생성 및 편집 모두를 위해 2~4 개의 샘플링 스텝으로 줄입니다. 첫날 4 가지 체크포인트 변형이 제공됩니다: 베이스와 Turbo 각각에 대해 BF16 및 FP8, diffusers 레이아웃당 변형당 약 49GB.
Qwen-Image-Bench 전체 점수: LLaDA-Image 는 영어와 중국어 모두 오픈 6B 카테고리에서 1 위를 차지합니다.
RebelAI 노드 팩으로 ComfyUI 에서 실행하기
RealRebelAI 의 커뮤니티 통합은 가중치가 공개된 같은 날 제공되었습니다. 팩은 4 개의 노드를 제공합니다: LLaDA Image Loader, LLaDA Image Text to Image, LLaDA Image Edit 및 LLaDA Image Unload. 편집 노드는 모델의 네이티브 편집 경로 (generation_mode="editing") 를 호출하며, denoise-strength 근사치가 아니며, 편집 크기는 32 로 나누어 떨어져야 합니다.
통합은 RealRebelAI/LLaDa-Image-Turbo_ComfyUI 의 최적화된 가중치와 일치하는 베이스 팩을 사용하며, 팩당 약 29GB 입니다:
| 파일 | 위치 | 크기 |
|---|---|---|
LLaDA-Image-Turbo-transformer-BF16.safetensors | models/diffusion_models/ | 13.1 GB |
LLaDA-Image-Turbo-INT8.safetensors | models/diffusion_models/ | 6.6 GB |
LLaDA-Image-Turbo-text_encoder-Q4_K_M.gguf | models/text_encoders/ | 9.2 GB |
LLaDa_VAE.safetensors | models/vae/ | 0.17 GB |
INT8 트랜스포머는 GGUF 가 아닌 네이티브 safetensors 양자화입니다; GGUF 는 양자화된 LLaDA2-MoE 텍스트 인코더에만 사용됩니다. Turbo 의 경우 4 스텝과 CFG 1.0 으로 시작하세요.
학습 코드는 공식 로드맵에서 곧 출시 예정으로 표시되어 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.