Batch CLIPSeg(BatchCLIPSeg)
Este nodo utiliza técnicamente el modelo preentrenado CLIPSeg para alinear el texto de entrada con las características de la imagen y calcular la puntuación de relevancia entre cada píxel y el texto.
Batch CLIP Seg
El nodo Batch CLIPSeg utiliza técnicamente el modelo CLIPSeg preentrenado para alinear las indicaciones de texto de entrada con las características de la imagen y calcular una puntuación de relevancia entre cada píxel y el texto.
El nodo Batch CLIPSeg es una herramienta de segmentación de imágenes basada en el modelo CLIP, capaz de generar automáticamente máscaras correspondientes para una imagen o un lote de imágenes según una descripción de texto. Su función principal es transformar instrucciones en lenguaje natural en selecciones precisas de regiones visuales, logrando la creación de máscaras impulsadas semánticamente.
Funcionalidad del Nodo
Este nodo utiliza técnicamente el modelo CLIPSeg preentrenado para alinear las indicaciones de texto de entrada con las características de la imagen y calcular una puntuación de relevancia entre cada píxel y el texto. Admite el procesamiento de entradas de tipo IMAGE, ya sean imágenes individuales o lotes compuestos por múltiples imágenes. A través del procesamiento por umbral, convierte el mapa de puntuaciones de relevancia en máscaras binarias o continuas, y opcionalmente puede aplicar postprocesamiento como desenfoque gaussiano a las máscaras.
Explicación de Parámetros - Batch CLIPSeg
Entradas (Inputs)
| Nombre del Parámetro | Tipo de Dato | Obligatorio | Valor por Defecto | Rango/Opciones | Descripción |
|---|---|---|---|---|---|
images | IMAGE | Sí | - | - | images (parámetro de entrada): Imagen o lote de imágenes a segmentar. Admite una sola imagen o múltiples imágenes. |
opt_model | CLIPSEGMODEL | No | - | - | opt_model (parámetro de entrada): Entrada opcional para un modelo CLIPSeg externo, utilizado para reemplazar el modelo predeterminado cargado internamente por el nodo. |
Parámetros de Control (Parameters)
| Nombre del Parámetro | Tipo de Dato | Obligatorio | Valor por Defecto | Rango/Opciones | Descripción |
|---|---|---|---|---|---|
text | STRING | Sí | - | - | "cielo". |
threshold | FLOAT | Sí | 0.5 | 0.0 - 10.0 (incremento: 0.001) | threshold (parámetro de entrada): Establece el umbral de confianza para la segmentación; las regiones por encima de este valor se conservan. Rango 0.0 - 10.0, incremento 0.001. |
binary_mask | BOOLEAN | Sí | True | - | binary_mask (parámetro de entrada): Controla si la máscara se binariza (blanco y negro). Si es falso, la salida es una máscara en escala de grises continua. |
combine_mask | BOOLEAN | Sí | False | - | combine_mask (parámetro de entrada): Controla si todas las máscaras generadas actualmente se combinan en una sola máscara. |
use_cuda | BOOLEAN | Sí | True | - | use_cuda (parámetro de entrada): Controla si se utiliza CUDA (GPU) para acelerar los cálculos y mejorar la velocidad de procesamiento. |
blur_sigma | FLOAT | No | 0.0 | 0.0 - 100.0 (incremento: 0.1) | - |
prev_mask | MASK | No | None | - | - |
image_bg_level | FLOAT | No | 0.5 | 0.0 - 1.0 (incremento: 0.01) | - |
invert | BOOLEAN | No | False | - | - |
Salidas (Output)
| Nombre del Parámetro | Tipo de Dato | Descripción |
|---|---|---|
| Mask | MASK | Mask (parámetro de salida): La máscara de salida, que puede utilizarse en nodos posteriores de procesamiento de imágenes. |
| Image | IMAGE | Image (parámetro de salida): La imagen de salida, generalmente igual a la imagen de entrada, utilizada para la conexión en el flujo de trabajo. |
Casos de Uso
En aplicaciones prácticas, este nodo se utiliza comúnmente en flujos de trabajo que requieren recorte automático basado en descripciones de objetos o escenas. Por ejemplo, al procesar por lotes imágenes de productos, se puede ingresar el texto "un zapato" para generar rápidamente máscaras precisas de los zapatos en todas las imágenes que los contengan, facilitando así el reemplazo de fondos o ajustes locales posteriores.
Consideraciones
La velocidad de procesamiento del nodo se ve afectada por el tamaño del modelo y el uso de aceleración por GPU. Para imágenes de alta resolución o lotes grandes, el tiempo de procesamiento puede ser prolongado. Además, la precisión de la segmentación depende en gran medida de la exactitud de la descripción de texto y de la cobertura de los datos de entrenamiento del modelo.
Enlace al Código Fuente del Nodo Batch CLIPSeg
El nodo Batch CLIPSeg proviene del paquete de nodos ComfyUI-KJNodes.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.