Batch CLIPSeg(BatchCLIPSeg)
이 노드는 사전 훈련된 CLIPSeg 모델을 기술적으로 활용하여 입력된 텍스트 프롬프트와 이미지 특징을 정렬하고, 각 픽셀과 텍스트 간의 관련성 점수를 계산합니다.
Batch CLIP Seg
Batch CLIPSeg 노드는 기술적으로 사전 학습된 CLIPSeg 모델을 활용하여 입력된 텍스트 프롬프트와 이미지 특징을 정렬하고, 각 픽셀과 텍스트 간의 관련성 점수를 계산합니다.
Batch CLIPSeg 노드는 CLIP 모델 기반의 이미지 분할 도구로, 텍스트 설명에 따라 단일 이미지 또는 이미지 배치에 대한 해당 마스크를 자동 생성할 수 있습니다. 핵심 기능은 자연어 지시를 시각적 영역의 정확한 선택 영역으로 변환하여 의미론적으로 구동되는 마스크 생성을 구현하는 것입니다.
노드 기능
이 노드는 기술적으로 사전 학습된 CLIPSeg 모델을 활용하여 입력된 텍스트 프롬프트와 이미지 특징을 정렬하고, 각 픽셀과 텍스트 간의 관련성 점수를 계산합니다. 단일 또는 다중 이미지로 구성된 IMAGE 타입의 배치 입력을 처리할 수 있으며, 임계값 처리를 통해 관련성 점수 맵을 이진 또는 연속 마스크로 변환하고, 선택적으로 가우시안 블러와 같은 후처리를 마스크에 적용할 수 있습니다.
노드 파라미터 설명 - Batch CLIPSeg
연결 입력 (Inputs)
| 파라미터 이름 | 데이터 타입 | 필수 | 기본값 | 범위/옵션 | 설명 |
|---|---|---|---|---|---|
images | IMAGE | 예 | - | - | images (입력 파라미터): 분할할 이미지 또는 이미지 배치를 입력합니다. 단일 또는 다중 이미지를 지원합니다. |
opt_model | CLIPSEGMODEL | 아니요 | - | - | opt_model (입력 파라미터): 노드 내부에서 로드하는 기본 모델을 대체하기 위해 사용할 수 있는 외부 CLIPSeg 모델 입력입니다. |
컨트롤 파라미터 (Parameters)
| 파라미터 이름 | 데이터 타입 | 필수 | 기본값 | 범위/옵션 | 설명 |
|---|---|---|---|---|---|
text | STRING | 예 | - | - | "하늘". |
threshold | FLOAT | 예 | 0.5 | 0.0 - 10.0 (스텝: 0.001) | threshold (입력 파라미터): 분할의 신뢰도 임계값을 설정합니다. 이 값보다 높은 영역이 유지됩니다. 범위 0.0 - 10.0, 스텝 0.001. |
binary_mask | BOOLEAN | 예 | True | - | binary_mask (입력 파라미터): 마스크를 이진화(흑백)할지 여부를 제어합니다. '아니요'인 경우 연속 회색조 마스크를 출력합니다. |
combine_mask | BOOLEAN | 예 | False | - | combine_mask (입력 파라미터): 현재 생성된 모든 마스크를 단일 마스크로 병합할지 여부를 제어합니다. |
use_cuda | BOOLEAN | 예 | True | - | use_cuda (입력 파라미터): 처리 속도를 향상시키기 위해 CUDA(GPU)를 사용하여 계산을 가속할지 여부를 제어합니다. |
blur_sigma | FLOAT | 아니요 | 0.0 | 0.0 - 100.0 (스텝: 0.1) | - |
prev_mask | MASK | 아니요 | None | - | - |
image_bg_level | FLOAT | 아니요 | 0.5 | 0.0 - 1.0 (스텝: 0.01) | - |
invert | BOOLEAN | 아니요 | False | - | - |
출력 (Output)
| 파라미터 이름 | 데이터 타입 | 설명 |
|---|---|---|
| Mask | MASK | Mask (출력 파라미터): 출력된 마스크로, 후속 이미지 처리 노드에 사용할 수 있습니다. |
| Image | IMAGE | Image (출력 파라미터): 출력된 이미지로, 일반적으로 입력 이미지와 동일하며 워크플로우 연결에 사용됩니다. |
사용 시나리오
실제 응용에서 이 노드는 객체 또는 장면 설명에 따라 자동화된 이미지 추출이 필요한 워크플로우에 자주 사용됩니다. 예를 들어, 제품 이미지를 배치 처리할 때 "신발 한 켤레"라는 텍스트를 입력하여 신발이 포함된 모든 이미지에 대해 신발의 정확한 마스크를 빠르게 생성한 후, 배경 교체 또는 부분 조정을 수행할 수 있습니다.
주의사항
노드의 처리 속도는 모델 크기와 GPU 가속 사용 여부의 영향을 받습니다. 고해상도 또는 대량의 이미지의 경우 처리 시간이 길어질 수 있으며, 분할 정확도는 텍스트 설명의 정확성과 모델 학습 데이터의 커버리지에 크게 의존합니다.
Batch CLIPSeg 노드 소스 코드 링크
Batch CLIPSeg 노드는 ComfyUI-KJNodes 노드 패키지에서 제공됩니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.