Krea 2 Turbo SDA LoRA, 샘플링 다양성 복원
F16이 Semantic Directional Alignment로 학습한 Krea 2 Turbo LoRA를 출시: 동일한 프롬프트도 시드마다 다른 결과를 만들며 품질 저하가 없습니다.
가장 명확한 예시는 *"창턱에 앉아 있는 고양이"*의 16개 시드입니다. 기본 Turbo는 매번 동일한 얼룩무늬 흰 고양이를 다시 그립니다. LoRA를 활성화하면 시드에 따라 털 무늬, 조명, 계절, 심지어 창 설정까지 달라집니다:
![]() | ![]() |
|---|---|
| 기본 Turbo: 같은 고양이 16회 | SDA LoRA 적용: 다양한 털, 라이트, 설정 |
동일한 패턴은 정물(하나의 파인애플 템플릿 대비 다양한 구도)과 인물 사진(동일한 스튜디오 헤드샷 프레임 대비 다양한 연령, 헤어, 장면)에서도 나타납니다.
SDA 작동 방식
Semantic Directional Alignment은 다양성 붕괴를 방향 문제로 취급합니다. 하나의 학습 이미지에 대해 두 개의 무작위 노이즈를 추출하고 구성이 결정되는 8단계 Turbo 스케줄의 가장 높은 학습 가능 단계인 sigma 0.9567로 노이즈화합니다. 고정된 티처(Krea 2 RAW, 비증류 원본 모델)와 학생(Turbo + LoRA)은 각각 두 노이즈에 대해 이미지가 어떻게 될지 예측하고, 고정된 CLIP 스택이 예측을 임베딩합니다. 티처의 지각 방향 변화는 노이즈 교체가 이미지를 어떻게 이동해야 하는지를 기록하며, 손실 함수는 모든 노이즈를 하나의 템플릿으로 붕괴시키는 대신 학생의 방향이 이를 일치하도록 학습합니다. 최상위 5개 후보 탐색은 약 3배의 학습 속도 향상을 추가로 제공합니다.
학습에는 1024x1024 크기의 이미지 109장만 사용되었으며, 이는 스타일 이탈 없이 구도를 변경할 수 있는 소형 어댑터가 가능한 이유를 설명합니다.
게이트의 중요성: 2단계 후 비활성화
LoRA는 단일 고노이즈 노드에서 학습되었으므로 8개 디노이즈 단계 중 처음 2개 단계에서만 활성화되어야 합니다. 작성자의 측정 결과:
| 게이트(8단계 중 활성 단계) | 결과 |
|---|---|
| 1 | 작동하지만 다양성 20% 감소 |
| 2 | 의도된 구성, 위의 모든 수치 |
| 8(항상 활성) | 품질 붕괴: 노이즈 또는 블러, HPS -10% |
기본 ComfyUI는 모든 단계에서 LoRA를 적용하므로, 2단계 이후 어댑터를 전환하려면 단계별 LoRA 스케줄링 노드(후크 또는 스케줄링 커스텀 노드)가 필요합니다. 저장소에는 게이트가 연결된 ClownsharKSampler Beta를 기반으로 구축된 준비된 워크플로인 Krea2_turbo_sda_workflow.json도 포함되어 있습니다.
파일
| 파일 | 크기 | 용도 |
|---|---|---|
krea2_turbo_sda_v1.0_comfy.safetensors | 447 MB | ComfyUI 키 형식 |
krea2_turbo_sda_v1.0_diffusers.safetensors | 447 MB | diffusers Krea2Pipeline |
모델 카드의 diffusers 파이프라인 스니펫은 게이트를 한 줄 단계 콜백으로 구현합니다. 중국어 모델 카드도 저장소에 포함되어 있습니다.


댓글
GitHub로 로그인하고 토론에 참여하세요.