Batch CLIPSeg(BatchCLIPSeg)
Ce nœud utilise techniquement le modèle pré-entraîné CLIPSeg pour aligner les invites textuelles d'entrée avec les caractéristiques de l'image et calcule un score de pertinence entre chaque pixel et le texte.
Batch CLIP Seg
Le nœud Batch CLIPSeg utilise techniquement un modèle CLIPSeg pré-entraîné pour aligner les invites textuelles saisies avec les caractéristiques de l'image et calculer un score de pertinence entre chaque pixel et le texte.
Le nœud Batch CLIPSeg est un outil de segmentation d'image basé sur le modèle CLIP, capable de générer automatiquement des masques correspondants pour une image ou un lot d'images en fonction d'une description textuelle. Sa fonction principale est de transformer des instructions en langage naturel en sélections précises de régions visuelles, permettant ainsi la création de masques pilotés par la sémantique.
Fonctionnalités du nœud
Ce nœud utilise techniquement un modèle CLIPSeg pré-entraîné pour aligner les invites textuelles saisies avec les caractéristiques de l'image et calculer un score de pertinence entre chaque pixel et le texte. Il prend en charge le traitement d'entrées de type IMAGE, constituées d'une seule image ou de plusieurs images (lot). Il convertit la carte des scores de pertinence en masques binaires ou continus via un seuillage, et peut éventuellement appliquer un post-traitement tel qu'un flou gaussien sur les masques.
Description des paramètres du nœud - Batch CLIPSeg
Entrées (Inputs)
| Nom du paramètre | Type de données | Requis | Valeur par défaut | Plage/Valeurs possibles | Description |
|---|---|---|---|---|---|
images | IMAGE | Oui | - | - | images (paramètre d'entrée) : Image(s) ou lot d'images à segmenter. Prend en charge une seule ou plusieurs images. |
opt_model | CLIPSEGMODEL | Non | - | - | opt_model (paramètre d'entrée) : Modèle CLIPSeg externe optionnel en entrée, utilisé pour remplacer le modèle par défaut chargé en interne par le nœud. |
Paramètres de contrôle (Parameters)
| Nom du paramètre | Type de données | Requis | Valeur par défaut | Plage/Valeurs possibles | Description |
|---|---|---|---|---|---|
text | CHAÎNE | Oui | - | - | "ciel". |
threshold | FLOTTANT | Oui | 0.5 | 0.0 - 10.0 (pas: 0.001) | threshold (paramètre d'entrée) : Définit le seuil de confiance pour la segmentation. Les régions dont le score est supérieur à cette valeur sont conservées. Plage 0.0 - 10.0, pas 0.001. |
binary_mask | BOOLÉEN | Oui | vrai | - | binary_mask (paramètre d'entrée) : Contrôle si le masque doit être binarisé (noir ou blanc). Si défini sur faux, le masque de sortie est en niveaux de gris continu. |
combine_mask | BOOLÉEN | Oui | faux | - | combine_mask (paramètre d'entrée) : Contrôle si tous les masques générés doivent être fusionnés en un seul masque. |
use_cuda | BOOLÉEN | Oui | vrai | - | use_cuda (paramètre d'entrée) : Contrôle si CUDA (GPU) doit être utilisé pour accélérer les calculs et améliorer la vitesse de traitement. |
blur_sigma | FLOTTANT | Non | 0.0 | 0.0 - 100.0 (pas: 0.1) | - |
prev_mask | MASK | Non | Aucun | - | - |
image_bg_level | FLOTTANT | Non | 0.5 | 0.0 - 1.0 (pas: 0.01) | - |
invert | BOOLÉEN | Non | faux | - | - |
Sorties (Output)
| Nom du paramètre | Type de données | Description |
|---|---|---|
| Mask | MASK | Mask (paramètre de sortie) : Le masque de sortie, utilisable par les nœuds de traitement d'image ultérieurs. |
| Image | IMAGE | Image (paramètre de sortie) : L'image de sortie, généralement identique à l'image d'entrée, utilisée pour la continuité du flux de travail. |
Cas d'utilisation
Dans les applications pratiques, ce nœud est souvent utilisé dans des flux de travail nécessitant un détourage automatique basé sur la description d'objets ou de scènes. Par exemple, lors du traitement par lots d'images de produits, on peut saisir le texte "une chaussure" pour générer rapidement des masques précis des chaussures pour toutes les images contenant des chaussures, facilitant ainsi un remplacement d'arrière-plan ou des ajustements locaux ultérieurs.
Points d'attention
La vitesse de traitement du nœud est influencée par la taille du modèle et l'utilisation ou non de l'accélération GPU. Pour des images haute résolution ou des lots volumineux, le temps de traitement peut être long. De plus, la précision de la segmentation dépend largement de l'exactitude de la description textuelle et de la couverture des données d'entraînement du modèle.
Lien vers le code source du nœud Batch CLIPSeg
Le nœud Batch CLIPSeg provient du pack de nœuds ComfyUI-KJNodes.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.