SAM 2 : Segment Anything Model 2#
SAM 2, le successeur du Segment Anything Model (SAM) de Meta, est un outil de pointe conçu pour la segmentation complète d'objets dans les images et les vidéos. Il excelle dans le traitement de données visuelles complexes grâce à une architecture de modèle unifiée et pilotable par invites, qui prend en charge le traitement en temps réel et la généralisation zero-shot.
Les modèles SAM 2.1 alimentent la fonction d'annotation intelligente sur Ultralytics Platform, permettant une segmentation par clic pour accélérer l'étiquetage des jeux de données. Consulte le guide d'annotation pour plus de détails.

Fonctionnalités clés#
Watch: How to Run Inference with Meta's SAM2 using Ultralytics | Step-by-Step Guide 🎉
Architecture de modèle unifiée#
SAM 2 combine les capacités de segmentation d'images et de vidéos au sein d'un seul modèle. Cette unification simplifie le déploiement et permet d'obtenir des performances cohérentes sur différents types de médias. Il s'appuie sur une interface flexible basée sur des invites, qui permet de spécifier les objets d'intérêt au moyen de différents types d'invites, comme des points, des boîtes englobantes ou des masques.
Performances en temps réel#
Le modèle atteint des vitesses d'inférence en temps réel et traite environ 44 images par seconde. SAM 2 convient ainsi aux applications nécessitant un retour immédiat, comme le montage vidéo et la réalité augmentée.
Généralisation zero-shot#
SAM 2 peut segmenter des objets qu'il n'a jamais rencontrés auparavant, démontrant une forte généralisation zero-shot. Cette capacité est particulièrement utile dans les domaines visuels variés ou évolutifs où les catégories prédéfinies peuvent ne pas couvrir tous les objets possibles.
Affinement interactif#
Tu peux affiner les résultats de segmentation de manière itérative en fournissant des invites supplémentaires, ce qui permet un contrôle précis de la sortie. Cette interactivité est essentielle pour ajuster finement les résultats dans des applications comme l'annotation vidéo ou l'imagerie médicale.
Gestion avancée des défis visuels#
SAM 2 intègre des mécanismes pour gérer les difficultés courantes de la segmentation vidéo, comme l'occlusion et la réapparition des objets. Il utilise un mécanisme de mémoire sophistiqué pour suivre les objets d'une image à l'autre, assurant la continuité même lorsque les objets sont temporairement masqués ou quittent la scène avant d'y réapparaître.
Pour mieux comprendre l'architecture et les capacités de SAM 2, consulte l'article de recherche sur SAM 2.
Performances et détails techniques#
SAM 2 établit une nouvelle référence dans le domaine et surpasse les modèles précédents selon diverses métriques :
| Métrique | SAM 2 | SOTA précédent |
|---|---|---|
| Segmentation vidéo interactive | Meilleur | - |
| Interactions humaines requises | 3 fois moins | Référence |
| Précision de la segmentation d'images | Améliorée | SAM |
| Vitesse d'inférence | 6 fois plus rapide | SAM |
Architecture du modèle#
Composants principaux#
- Encodeur d'images et de vidéos : utilise une architecture basée sur un transformer pour extraire des caractéristiques de haut niveau à partir des images et des images vidéo. Ce composant est chargé de comprendre le contenu visuel à chaque instant.
- Encodeur d'invites : traite les invites fournies par l'utilisateur (points, boîtes, masques) pour guider la tâche de segmentation. Cela permet à SAM 2 de s'adapter aux entrées de l'utilisateur et de cibler des objets spécifiques dans une scène.
- Mécanisme de mémoire : comprend un encodeur de mémoire, une banque de mémoire et un module d'attention mémoire. Ces composants stockent et utilisent collectivement les informations des images précédentes, permettant au modèle de maintenir un suivi cohérent des objets au fil du temps.
- Décodeur de masques : génère les masques de segmentation finaux à partir des caractéristiques d'image et des invites encodées. En vidéo, il utilise également le contexte mémoire pour assurer un suivi précis d'une image à l'autre.

Mécanisme de mémoire et gestion des occlusions#
Le mécanisme de mémoire permet à SAM 2 de gérer les dépendances temporelles et les occlusions dans les données vidéo. Lorsque les objets se déplacent et interagissent, SAM 2 enregistre leurs caractéristiques dans une banque de mémoire. Lorsqu'un objet devient occlus, le modèle peut s'appuyer sur cette mémoire pour prédire sa position et son apparence lorsqu'il réapparaît. La tête d'occlusion gère spécifiquement les situations dans lesquelles les objets ne sont pas visibles, en prédisant la probabilité qu'un objet soit occlus.
Résolution de l'ambiguïté entre plusieurs masques#
Dans les situations ambiguës (par exemple, lorsque des objets se chevauchent), SAM 2 peut générer plusieurs prédictions de masques. Cette fonctionnalité est essentielle pour représenter précisément les scènes complexes lorsqu'un seul masque ne suffit pas à en décrire toutes les nuances.
Jeu de données SA-V#
Le jeu de données SA-V, développé pour l'entraînement de SAM 2, est l'un des jeux de données de segmentation vidéo les plus vastes et les plus diversifiés disponibles. Il comprend :
- Plus de 51 000 vidéos : capturées dans 47 pays, elles offrent un large éventail de scénarios du monde réel.
- Plus de 600 000 annotations de masques : des annotations détaillées de masques spatio-temporels, appelées « masklets », couvrant des objets entiers et des parties d'objets.
- Échelle du jeu de données : il contient 4,5 fois plus de vidéos et 53 fois plus d'annotations que les plus grands jeux de données précédents, offrant une diversité et une complexité sans précédent.
Benchmarks#
Segmentation d'objets vidéo#
SAM 2 a démontré des performances supérieures sur les principaux benchmarks de segmentation vidéo :
| Jeu de données | J&F | J | F |
|---|---|---|---|
| DAVIS 2017 | 82.5 | 79.8 | 85.2 |
| YouTube-VOS | 81.2 | 78.9 | 83.5 |
Segmentation interactive#
Dans les tâches de segmentation interactive, SAM 2 affiche une efficacité et une précision significatives :
| Jeu de données | NoC@90 | AUC |
|---|---|---|
| DAVIS Interactive | 1.54 | 0.872 |
Installation#
Pour installer SAM 2, utilise la commande suivante. Tous les modèles SAM 2 seront automatiquement téléchargés lors de leur première utilisation.
pip install ultralyticsComment utiliser SAM 2 : polyvalence en segmentation d'images et de vidéos#
Le tableau suivant présente les modèles SAM 2 disponibles, leurs poids préentraînés, les tâches prises en charge et leur compatibilité avec différents modes de fonctionnement comme l'inférence, la validation, l'entraînement et l'exportation.
| Type de modèle | Poids préentraînés | Tâches prises en charge | Entraînement | Validation | Inférence | Exportation |
|---|---|---|---|---|---|---|
| SAM 2 tiny | sam2_t.pt | Segmentation d'instances | ❌ | ❌ | ✅ | ❌ |
| SAM 2 small | sam2_s.pt | Segmentation d'instances | ❌ | ❌ | ✅ | ❌ |
| SAM 2 base | sam2_b.pt | Segmentation d'instances | ❌ | ❌ | ✅ | ❌ |
| SAM 2 large | sam2_l.pt | Segmentation d'instances | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 tiny | sam2.1_t.pt | Segmentation d'instances | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 small | sam2.1_s.pt | Segmentation d'instances | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 base | sam2.1_b.pt | Segmentation d'instances | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 large | sam2.1_l.pt | Segmentation d'instances | ❌ | ❌ | ✅ | ❌ |
Exemples de prédictions avec SAM 2#
SAM 2 peut être utilisé pour un large éventail de tâches, notamment le montage vidéo en temps réel, l'imagerie médicale et les systèmes autonomes. Sa capacité à segmenter des données visuelles statiques et dynamiques en fait un outil polyvalent pour les chercheurs et les développeurs.
Segmenter avec des invites#
Utilise des invites pour segmenter des objets spécifiques dans des images ou des vidéos.
from ultralytics import SAM
# Load a model
model = SAM("sam2.1_b.pt")
# Display model information (optional)
model.info()
# Run inference with bboxes prompt
results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])
# Run inference with single point
results = model(points=[900, 370], labels=[1])
# Run inference with multiple points
results = model(points=[[400, 370], [900, 370]], labels=[1, 1])
# Run inference with multiple points prompt per object
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 1]])
# Run inference with negative points prompt
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 0]])Tout segmenter#
Segmente l'intégralité du contenu d'une image ou d'une vidéo sans invites spécifiques.
from ultralytics import SAM
# Load a model
model = SAM("sam2.1_b.pt")
# Display model information (optional)
model.info()
# Run inference
model("path/to/video.mp4")Segmenter une vidéo et suivre les objets#
Segmente l'intégralité du contenu vidéo avec des invites spécifiques et suis les objets.
from ultralytics.models.sam import SAM2VideoPredictor
# Create SAM2VideoPredictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_b.pt"}
predictor = SAM2VideoPredictor(overrides=overrides)
# Run inference with single point
results = predictor(source="test.mp4", points=[920, 470], labels=[1])
# Run inference with multiple points
results = predictor(source="test.mp4", points=[[920, 470], [909, 138]], labels=[1, 1])
# Run inference with multiple points prompt per object
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 1]])
# Run inference with negative points prompt
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 0]])- Cet exemple montre comment utiliser SAM 2 pour segmenter l'intégralité du contenu d'une image ou d'une vidéo lorsqu'aucune invite (bboxes/points/masques) n'est fournie.
Segmentation et suivi interactifs dynamiques#
SAM2DynamicInteractivePredictor est une extension avancée sans entraînement de SAM 2 qui permet une interaction dynamique avec plusieurs images et des capacités d'apprentissage continu. Ce prédicteur prend en charge les mises à jour de requêtes en temps réel et la gestion de la mémoire pour améliorer les performances de suivi sur une séquence d'images. Par rapport au SAM 2 d'origine, SAM2DynamicInteractivePredictor reconstruit le flux d'inférence pour tirer le meilleur parti des modèles SAM 2 pré-entraînés sans nécessiter d'entraînement supplémentaire.

Fonctionnalités clés#
Il offre trois améliorations significatives :
- Interaction dynamique : ajoute de nouvelles invites pour fusionner de nouvelles instances ou suivre les instances non suivies dans les images suivantes, à tout moment pendant le traitement vidéo.
- Apprentissage continu : ajoute de nouvelles invites pour les instances existantes afin d'améliorer les performances du modèle au fil du temps.
- Prise en charge indépendante de plusieurs images : traite plusieurs images indépendantes (pas nécessairement issues d'une séquence vidéo) avec partage de mémoire et suivi des objets entre les images.
Fonctionnalités principales#
- Flexibilité des invites : accepte les boîtes englobantes, les points et les masques comme invites.
- Gestion de la banque de mémoire : maintient une banque de mémoire dynamique pour stocker l'état des objets d'une image à l'autre.
- Suivi de plusieurs objets : permet de suivre simultanément plusieurs objets avec des ID d'objet individuels.
- Mises à jour en temps réel : permet d'ajouter de nouveaux prompts pendant l'inférence sans retraiter les images précédentes
- Traitement indépendant des images : traite des images autonomes avec un contexte mémoire partagé pour garantir la cohérence des objets entre les images
from ultralytics.models.sam import SAM2DynamicInteractivePredictor
# Create SAM2DynamicInteractivePredictor
overrides = {"conf": 0.01, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_t.pt", "save": False}
predictor = SAM2DynamicInteractivePredictor(overrides=overrides, max_obj_num=10)
# Define a category by box prompt
predictor(source="image1.jpg", bboxes=[[100, 100, 200, 200]], obj_ids=[0], update_memory=True)
# Detect this particular object in a new image
results = predictor(source="image2.jpg")
# Add new category with a new object ID
results = predictor(
source="image4.jpg",
bboxes=[[300, 300, 400, 400]], # New object
obj_ids=[1], # New object ID
update_memory=True, # Add to memory
)
# Perform inference
results = predictor(source="image5.jpg")
# Add refinement prompts to the same category to boost performance
# This helps when object appearance changes significantly
results = predictor(
source="image6.jpg",
points=[[150, 150]], # Refinement point
labels=[1], # Positive point
obj_ids=[1], # Same object ID
update_memory=True, # Update memory with new information
)
# Perform inference on new image
results = predictor(source="image7.jpg")Le SAM2DynamicInteractivePredictor est conçu pour fonctionner avec les modèles SAM 2 et prend en charge l'ajout et l'affinage des catégories avec toutes les box, point, and mask prompts que SAM 2 prend en charge de manière native. Il est particulièrement utile pour les scénarios où des objets apparaissent ou changent au fil du temps, comme dans l'annotation vidéo ou les tâches d'édition interactive.
Arguments#
| Nom | Valeur par défaut | Type de données | Description |
|---|---|---|---|
max_obj_num | 3 | int | Nombre maximal prédéfini de catégories |
update_memory | False | bool | Indique s'il faut mettre à jour la mémoire avec de nouveaux prompts |
obj_ids | None | List[int] | Liste des ID d'objets correspondant aux prompts |
Cas d'utilisation#
SAM2DynamicInteractivePredictor est idéal pour :
- Flux de travail d'annotation vidéo où de nouveaux objets apparaissent au cours de la séquence
- Édition vidéo interactive nécessitant l'ajout et l'affinement d'objets en temps réel
- Applications de surveillance nécessitant le suivi dynamique des objets
- Imagerie médicale pour suivre des structures anatomiques au fil de séries temporelles
- Systèmes autonomes nécessitant une détection et un suivi adaptatifs des objets
- Jeux de données multi-images pour une segmentation cohérente des objets dans des images indépendantes
- Analyse de collections d'images lorsque les objets doivent être suivis dans différentes scènes
- Segmentation inter-domaines exploitant la mémoire issue de contextes d'image diversifiés
- Annotation semi-automatique pour créer efficacement des jeux de données avec un minimum d'intervention manuelle
Comparaison de SAM avec YOLO#
Nous comparons ici les modèles SAM 2 de Meta, notamment la variante SAM2-t la plus petite, avec les modèles de segmentation Ultralytics, dont YOLO26n-seg :
| Modèle | Taille (Mo) | Paramètres (M) | Vitesse (CPU) (ms/im) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 41703 |
| Meta SAM2-b | 162 | 80.8 | 28867 |
| Meta SAM2-t | 78.1 | 38.9 | 23430 |
| MobileSAM | 40.7 | 10.1 | 23802 |
| FastSAM-s avec le backbone de YOLOv8 | 23.9 | 11.8 | 58.0 |
| Ultralytics YOLOv8n-seg | 7,1 (11,0x plus petit) | 3,4 (11,4x de moins) | 24,8 (945x plus rapide) |
| Ultralytics YOLO11n-seg | 6.2 (12.6 fois plus petit) | 2,9 (13,4x de moins) | 24.3 (964 fois plus rapide) |
| Ultralytics YOLO26n-seg | 6,7 (11,7x plus petit) | 2.7 (14.4 fois moins) | 25,2 (930x plus rapide) |
Cette comparaison met en évidence les différences considérables de taille et de vitesse entre les variantes de SAM et les modèles de segmentation YOLO. Bien que SAM offre des capacités uniques de segmentation automatique, les modèles YOLO, notamment YOLOv8n-seg, YOLO11n-seg et YOLO26n-seg, sont nettement plus petits, plus rapides et plus efficaces sur le plan des calculs.
Les vitesses de SAM sont mesurées avec PyTorch, celles de YOLO avec ONNX Runtime. Les tests ont été effectués sur un Apple M4 Air de 2025 doté de 16 Go de RAM, à l'aide de torch==2.10.0, ultralytics==8.4.31 et onnxruntime==1.24.4. Pour reproduire ce test :
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# Profile SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# Profile YOLO models (ONNX)
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
onnx_path = model.export(format="onnx", dynamic=True, nms=False) # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11
model = YOLO(onnx_path)
model(ASSETS)Annotation automatique : création efficace de jeux de données#
L'annotation automatique est une fonctionnalité puissante de SAM 2 qui permet de générer rapidement et précisément des jeux de données de segmentation en exploitant des modèles préentraînés. Cette capacité est particulièrement utile pour créer des jeux de données volumineux et de haute qualité sans fournir un effort manuel important.
Comment effectuer une annotation automatique avec SAM 2#
Watch: Auto Annotation with Meta's Segment Anything 2 Model using Ultralytics | Data Labeling
Pour annoter automatiquement ton jeu de données avec SAM 2, suis cet exemple :
from ultralytics.data.annotator import auto_annotate
auto_annotate(data="path/to/images", det_model="yolo26x.pt", sam_model="sam2_b.pt")| Argument | Type | Valeur par défaut | Description |
|---|---|---|---|
data | str | requis | Chemin vers le répertoire contenant les images cibles à annoter ou à segmenter. |
det_model | str | 'yolo26x.pt' | Chemin du modèle de détection YOLO pour la détection initiale des objets. |
sam_model | str | 'sam_b.pt' | Chemin du modèle SAM pour la segmentation (prend en charge les poids SAM, SAM 2, MobileSAM et SAM 3). |
device | str | '' | Périphérique de calcul (par ex. « cuda:0 », « cpu » ou « » pour la détection automatique du périphérique). |
conf | float | 0.25 | Seuil de confiance de la détection YOLO pour filtrer les détections peu fiables. |
iou | float | 0.45 | Seuil IoU pour la suppression non maximale afin de filtrer les boîtes qui se chevauchent. |
imgsz | int | 640 | Taille d'entrée pour redimensionner les images (doit être un multiple de 32). |
max_det | int | 300 | Nombre maximal de détections par image pour optimiser l'utilisation de la mémoire. |
classes | list[int] | None | Liste des indices de classes à détecter (par ex. [0, 1] pour personne et vélo). |
output_dir | str | None | Répertoire d'enregistrement des annotations (par défaut : répertoire parent de <data>_auto_annotate_labels). |
Cette fonction facilite la création rapide de jeux de données de segmentation de haute qualité, idéale pour les chercheurs et les développeurs souhaitant accélérer leurs projets.
Limites#
Malgré ses atouts, SAM 2 présente certaines limites :
- Stabilité du suivi : SAM 2 peut perdre la trace des objets lors de séquences prolongées ou de changements importants de point de vue.
- Confusion entre les objets : le modèle peut parfois confondre des objets d'apparence similaire, notamment dans les scènes encombrées.
- Efficacité avec plusieurs objets : l'efficacité de la segmentation diminue lors du traitement simultané de plusieurs objets en raison de l'absence de communication entre les objets.
- Détail Précision : Des détails fins peuvent ne pas être détectés, notamment avec des objets se déplaçant rapidement. Des invites supplémentaires peuvent remédier partiellement à ce problème, mais la fluidité temporelle n'est pas garantie.
Citations et remerciements#
Si SAM 2 joue un rôle crucial dans tes travaux de recherche ou de développement, cite-le à l'aide de la référence suivante :
@article{ravi2024sam2,
title={SAM 2: Segment Anything in Images and Videos},
author={Ravi, Nikhila and Gabeur, Valentin and Hu, Yuan-Ting and Hu, Ronghang and Ryali, Chaitanya and Ma, Tengyu and Khedr, Haitham and R{\"a}dle, Roman and Rolland, Chloe and Gustafson, Laura and Mintun, Eric and Pan, Junting and Alwala, Kalyan Vasudev and Carion, Nicolas and Wu, Chao-Yuan and Girshick, Ross and Doll{\'a}r, Piotr and Feichtenhofer, Christoph},
journal={arXiv preprint},
year={2024}
}Nous remercions chaleureusement Meta AI pour ses contributions à la communauté de l'IA avec ce modèle et ce jeu de données révolutionnaires.
FAQ#
SAM 2, le successeur du modèle Segment Anything (SAM) de Meta, est un outil de pointe conçu pour la segmentation complète des objets dans les images et les vidéos. Il excelle dans le traitement de données visuelles complexes grâce à une architecture de modèle unifiée et guidée par des prompts, qui prend en charge le traitement en temps réel et la généralisation zero-shot. SAM 2 offre plusieurs améliorations par rapport au SAM d'origine, notamment :
- Architecture de modèle unifiée : combine les capacités de segmentation d'images et de vidéos au sein d'un seul modèle.
- Performances en temps réel : traite environ 44 images par seconde, ce qui le rend adapté aux applications nécessitant un retour immédiat.
- Généralisation zero-shot : segmente des objets qu'il n'a jamais rencontrés auparavant, ce qui est utile dans divers domaines visuels.
- Affinement interactif : permet d'affiner itérativement les résultats de segmentation en fournissant des prompts supplémentaires.
- Gestion avancée des difficultés visuelles : gère les difficultés courantes de la segmentation vidéo, comme l'occlusion et la réapparition des objets.
Pour plus de détails sur l'architecture et les capacités de SAM 2, consulte l'article de recherche sur SAM 2.
SAM 2 est entraîné sur le jeu de données SA-V, l'un des jeux de données de segmentation vidéo les plus vastes et les plus diversifiés disponibles. Le jeu de données SA-V comprend :
- Plus de 51 000 vidéos : capturées dans 47 pays, elles offrent un large éventail de scénarios du monde réel.
- Plus de 600 000 annotations de masques : des annotations détaillées de masques spatio-temporels, appelées « masklets », couvrant des objets entiers et des parties d'objets.
- Échelle du jeu de données : il contient 4,5 fois plus de vidéos et 53 fois plus d'annotations que les précédents jeux de données les plus vastes, offrant une diversité et une complexité sans précédent.
Ce vaste jeu de données permet à SAM 2 d'atteindre des performances supérieures sur les principaux benchmarks de segmentation vidéo et améliore ses capacités de généralisation zero-shot. Pour plus d'informations, consulte la section Jeu de données SA-V.
SAM 2 intègre un mécanisme mémoire sophistiqué pour gérer les dépendances temporelles et les occlusions dans les données vidéo. Ce mécanisme mémoire comprend :
- Encodeur mémoire et banque mémoire : stocke les caractéristiques des images précédentes.
- Module d'attention mémoire : utilise les informations stockées pour maintenir un suivi cohérent des objets au fil du temps.
- Tête d'occlusion : gère spécifiquement les scénarios dans lesquels les objets ne sont pas visibles et prédit la probabilité qu'un objet soit occulté.
Ce mécanisme garantit la continuité, même lorsque les objets sont temporairement masqués ou quittent la scène avant d'y réapparaître. Pour plus de détails, consulte la section Mécanisme mémoire et gestion des occlusions.
Les modèles SAM 2, tels que SAM2-t et SAM2-b de Meta, offrent de puissantes capacités de segmentation zero-shot, mais sont nettement plus volumineux et plus lents que les modèles YOLO. Par exemple, YOLO26n-seg est environ 24 fois plus petit et plus de 1145 fois plus rapide que SAM2-b sur CPU. SAM 2 excelle dans les scénarios de segmentation polyvalente, guidée par des prompts et zero-shot, tandis que YOLO26 est optimisé pour la vitesse, l'efficacité et les applications en temps réel grâce à une inférence de bout en bout sans NMS, ce qui le rend mieux adapté au déploiement dans des environnements aux ressources limitées.
SAM 2 peut être utilisé pour la segmentation vidéo en temps réel en tirant parti de son interface guidée par des prompts et de ses capacités d'inférence en temps réel. Voici un exemple de base :
Utilise des invites pour segmenter des objets spécifiques dans des images ou des vidéos.
Pour une utilisation plus complète, consulte la section Comment utiliser SAM 2.