SAM 2: Modello Segment Anything 2#
SAM 2, il successore del modello Segment Anything (SAM) di Meta, è uno strumento all'avanguardia progettato per la segmentazione completa degli oggetti sia nelle immagini sia nei video. È particolarmente efficace nella gestione di dati visivi complessi grazie a un'architettura unificata e basata su prompt, che supporta l'elaborazione in tempo reale e la generalizzazione zero-shot.
I modelli SAM 2.1 alimentano la funzionalità di annotazione intelligente sulla piattaforma Ultralytics, consentendo la segmentazione tramite clic per etichettare rapidamente i dataset. Consulta la guida all'annotazione per maggiori dettagli.

Funzionalità principali#
Watch: How to Run Inference with Meta's SAM2 using Ultralytics | Step-by-Step Guide 🎉
Architettura unificata del modello#
SAM 2 combina le funzionalità di segmentazione di immagini e video in un unico modello. Questa unificazione semplifica il deployment e consente prestazioni uniformi tra diversi tipi di media. Sfrutta un'interfaccia flessibile basata su prompt, che permette di specificare gli oggetti di interesse tramite vari tipi di prompt, come punti, bounding box o maschere.
Prestazioni in tempo reale#
Il modello raggiunge velocità di inferenza in tempo reale, elaborando circa 44 fotogrammi al secondo. Questo rende SAM 2 adatto alle applicazioni che richiedono un feedback immediato, come l'editing video e la realtà aumentata.
Generalizzazione zero-shot#
SAM 2 è in grado di segmentare oggetti mai incontrati prima, dimostrando una solida generalizzazione zero-shot. Questa capacità è particolarmente utile in domini visivi diversificati o in evoluzione, dove le categorie predefinite potrebbero non comprendere tutti gli oggetti possibili.
Raffinamento interattivo#
Puoi perfezionare iterativamente i risultati della segmentazione fornendo prompt aggiuntivi, ottenendo un controllo preciso sull'output. Questa interattività è essenziale per ottimizzare i risultati in applicazioni come l'annotazione video o l'imaging medico.
Gestione avanzata delle sfide visive#
SAM 2 include meccanismi per gestire le sfide comuni della segmentazione video, come l'occlusione e la ricomparsa degli oggetti. Utilizza un sofisticato meccanismo di memoria per tenere traccia degli oggetti tra i fotogrammi, garantendo la continuità anche quando gli oggetti sono temporaneamente nascosti oppure escono dalla scena e vi rientrano.
Per comprendere più a fondo l'architettura e le funzionalità di SAM 2, consulta il documento di ricerca su SAM 2.
Prestazioni e dettagli tecnici#
SAM 2 stabilisce un nuovo punto di riferimento nel settore, superando i modelli precedenti in diverse metriche:
| Metrica | SAM 2 | SOTA precedenti |
|---|---|---|
| Segmentazione video interattiva | Migliore | - |
| Interazioni umane richieste | 3 volte in meno | Baseline |
| Accuratezza della segmentazione delle immagini | Migliorata | SAM |
| Velocità di inferenza | 6 volte più veloce | SAM |
Architettura del modello#
Componenti principali#
- Encoder di immagini e video: utilizza un'architettura basata su transformer per estrarre caratteristiche di alto livello da immagini e fotogrammi video. Questo componente è responsabile della comprensione del contenuto visivo a ogni istante temporale.
- Encoder dei prompt: elabora i prompt forniti dall'utente (punti, box, maschere) per guidare l'attività di segmentazione. Ciò consente a SAM 2 di adattarsi all'input dell'utente e di identificare oggetti specifici all'interno di una scena.
- Meccanismo di memoria: include un encoder della memoria, una banca di memoria e un modulo di attenzione della memoria. Questi componenti memorizzano e utilizzano collettivamente le informazioni dei fotogrammi precedenti, consentendo al modello di mantenere un tracciamento degli oggetti coerente nel tempo.
- Decoder delle maschere: genera le maschere di segmentazione finali sulla base delle caratteristiche dell'immagine codificate e dei prompt. Nei video utilizza anche il contesto della memoria per garantire un tracciamento accurato tra i fotogrammi.

Meccanismo di memoria e gestione delle occlusioni#
Il meccanismo di memoria consente a SAM 2 di gestire le dipendenze temporali e le occlusioni nei dati video. Quando gli oggetti si muovono e interagiscono, SAM 2 registra le loro caratteristiche in una banca di memoria. Quando un oggetto viene occluso, il modello può fare affidamento su questa memoria per prevederne la posizione e l'aspetto quando ricompare. La testa di occlusione gestisce specificamente gli scenari in cui gli oggetti non sono visibili, prevedendo la probabilità che un oggetto sia occluso.
Risoluzione dell'ambiguità delle maschere multiple#
In situazioni ambigue, ad esempio con oggetti sovrapposti, SAM 2 può generare più previsioni di maschere. Questa funzionalità è fondamentale per rappresentare accuratamente scene complesse in cui una singola maschera potrebbe non descriverne adeguatamente le sfumature.
Dataset SA-V#
Il dataset SA-V, sviluppato per l'addestramento di SAM 2, è uno dei dataset di segmentazione video più grandi e diversificati disponibili. Include:
- Oltre 51.000 video: acquisiti in 47 Paesi, offrono un'ampia gamma di scenari del mondo reale.
- Oltre 600.000 annotazioni di maschere: annotazioni dettagliate di maschere spazio-temporali, denominate "masklet", che coprono oggetti interi e parti di oggetti.
- Dimensioni del dataset: include 4,5 volte più video e 53 volte più annotazioni rispetto ai precedenti dataset più grandi, offrendo una diversità e una complessità senza precedenti.
Benchmark#
Segmentazione degli oggetti nei video#
SAM 2 ha dimostrato prestazioni superiori nei principali benchmark di segmentazione video:
| Dataset | J&F | J | F |
|---|---|---|---|
| DAVIS 2017 | 82.5 | 79.8 | 85.2 |
| YouTube-VOS | 81.2 | 78.9 | 83.5 |
Segmentazione interattiva#
Nelle attività di segmentazione interattiva, SAM 2 mostra un'efficienza e un'accuratezza significative:
| Dataset | NoC@90 | AUC |
|---|---|---|
| DAVIS Interactive | 1.54 | 0.872 |
Installazione#
Per installare SAM 2, usa il comando seguente. Tutti i modelli SAM 2 verranno scaricati automaticamente al primo utilizzo.
pip install ultralyticsCome utilizzare SAM 2: versatilità nella segmentazione di immagini e video#
La tabella seguente illustra i modelli SAM 2 disponibili, i relativi pesi pretrained, le attività supportate e la compatibilità con diverse modalità operative, come Inferenza, Validazione, Addestramento ed Esportazione.
| Tipo di modello | Pesi preaddestrati | Attività supportate | Addestramento | Convalida | Inferenza | Esportazione |
|---|---|---|---|---|---|---|
| SAM 2 tiny | sam2_t.pt | Segmentazione delle istanze | ❌ | ❌ | ✅ | ❌ |
| SAM 2 small | sam2_s.pt | Segmentazione delle istanze | ❌ | ❌ | ✅ | ❌ |
| SAM 2 base | sam2_b.pt | Segmentazione delle istanze | ❌ | ❌ | ✅ | ❌ |
| SAM 2 large | sam2_l.pt | Segmentazione delle istanze | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 tiny | sam2.1_t.pt | Segmentazione delle istanze | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 small | sam2.1_s.pt | Segmentazione delle istanze | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 base | sam2.1_b.pt | Segmentazione delle istanze | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 large | sam2.1_l.pt | Segmentazione delle istanze | ❌ | ❌ | ✅ | ❌ |
Esempi di predizione con SAM 2#
SAM 2 può essere utilizzato in un'ampia gamma di attività, tra cui l'editing video in tempo reale, l'imaging medico e i sistemi autonomi. La sua capacità di segmentare dati visivi statici e dinamici lo rende uno strumento versatile per ricercatori e sviluppatori.
Segmentazione con prompt#
Usa i prompt per segmentare oggetti specifici nelle immagini o nei video.
from ultralytics import SAM
# Load a model
model = SAM("sam2.1_b.pt")
# Display model information (optional)
model.info()
# Run inference with bboxes prompt
results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])
# Run inference with single point
results = model(points=[900, 370], labels=[1])
# Run inference with multiple points
results = model(points=[[400, 370], [900, 370]], labels=[1, 1])
# Run inference with multiple points prompt per object
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 1]])
# Run inference with negative points prompt
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 0]])Segmentazione di tutto#
Segmenta l'intero contenuto dell'immagine o del video senza prompt specifici.
from ultralytics import SAM
# Load a model
model = SAM("sam2.1_b.pt")
# Display model information (optional)
model.info()
# Run inference
model("path/to/video.mp4")Segmentazione video e tracciamento degli oggetti#
Segmenta l'intero contenuto del video con prompt specifici e traccia gli oggetti.
from ultralytics.models.sam import SAM2VideoPredictor
# Create SAM2VideoPredictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_b.pt"}
predictor = SAM2VideoPredictor(overrides=overrides)
# Run inference with single point
results = predictor(source="test.mp4", points=[920, 470], labels=[1])
# Run inference with multiple points
results = predictor(source="test.mp4", points=[[920, 470], [909, 138]], labels=[1, 1])
# Run inference with multiple points prompt per object
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 1]])
# Run inference with negative points prompt
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 0]])- Questo esempio mostra come SAM 2 possa essere utilizzato per segmentare l'intero contenuto di un'immagine o di un video quando non vengono forniti prompt (bbox/punti/maschere).
Segmentazione e tracciamento interattivi dinamici#
SAM2DynamicInteractivePredictor è un'estensione avanzata di SAM 2 che non richiede addestramento e consente un'interazione dinamica con più fotogrammi e capacità di apprendimento continuo. Questo predittore supporta aggiornamenti dei prompt in tempo reale e la gestione della memoria per migliorare le prestazioni di tracciamento su una sequenza di immagini. Rispetto al SAM 2 originale, SAM2DynamicInteractivePredictor ricostruisce il flusso di inferenza per sfruttare al meglio i modelli SAM 2 preaddestrati senza richiedere addestramento aggiuntivo.

Funzionalità principali#
Offre tre miglioramenti significativi:
- Interazione dinamica: aggiungi nuovi prompt per unire o tracciare nuove istanze non tracciate nei fotogrammi successivi in qualsiasi momento durante l'elaborazione del video
- Apprendimento continuo: aggiungi nuovi prompt per le istanze esistenti per migliorare nel tempo le prestazioni del modello
- Supporto indipendente per più immagini: elabora più immagini indipendenti (non necessariamente provenienti da una sequenza video) con condivisione della memoria e tracciamento degli oggetti tra le immagini
Funzionalità principali#
- Flessibilità dei prompt: accetta bounding box, punti e maschere come prompt
- Gestione della banca di memoria: mantiene una banca di memoria dinamica per memorizzare gli stati degli oggetti tra i fotogrammi
- Tracciamento di più oggetti: supporta il tracciamento simultaneo di più oggetti con ID individuali
- Aggiornamenti in tempo reale: consente di aggiungere nuovi prompt durante l'inferenza senza rielaborare i fotogrammi precedenti
- Elaborazione indipendente delle immagini: elabora immagini indipendenti con un contesto di memoria condiviso per mantenere la coerenza degli oggetti tra le immagini
from ultralytics.models.sam import SAM2DynamicInteractivePredictor
# Create SAM2DynamicInteractivePredictor
overrides = {"conf": 0.01, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_t.pt", "save": False}
predictor = SAM2DynamicInteractivePredictor(overrides=overrides, max_obj_num=10)
# Define a category by box prompt
predictor(source="image1.jpg", bboxes=[[100, 100, 200, 200]], obj_ids=[0], update_memory=True)
# Detect this particular object in a new image
results = predictor(source="image2.jpg")
# Add new category with a new object ID
results = predictor(
source="image4.jpg",
bboxes=[[300, 300, 400, 400]], # New object
obj_ids=[1], # New object ID
update_memory=True, # Add to memory
)
# Perform inference
results = predictor(source="image5.jpg")
# Add refinement prompts to the same category to boost performance
# This helps when object appearance changes significantly
results = predictor(
source="image6.jpg",
points=[[150, 150]], # Refinement point
labels=[1], # Positive point
obj_ids=[1], # Same object ID
update_memory=True, # Update memory with new information
)
# Perform inference on new image
results = predictor(source="image7.jpg")Il SAM2DynamicInteractivePredictor è progettato per funzionare con i modelli SAM 2 e supporta l'aggiunta e il perfezionamento delle categorie con tutti i box, point, and mask prompts che SAM 2 supporta nativamente. È particolarmente utile per scenari in cui gli oggetti compaiono o cambiano nel tempo, come nell'annotazione video o in attività di modifica interattiva.
Argomenti#
| Nome | Valore predefinito | Tipo di dati | Descrizione |
|---|---|---|---|
max_obj_num | 3 | int | Numero massimo preimpostato di categorie |
update_memory | False | bool | Indica se aggiornare la memoria con nuovi prompt |
obj_ids | None | List[int] | Elenco degli ID degli oggetti corrispondenti ai prompt |
Casi d'uso#
SAM2DynamicInteractivePredictor è ideale per:
- Flussi di lavoro per l'annotazione di video in cui compaiono nuovi oggetti durante la sequenza
- Modifica interattiva di video che richiede l'aggiunta e il perfezionamento degli oggetti in tempo reale
- Applicazioni di videosorveglianza che richiedono il tracciamento dinamico degli oggetti
- Imaging medico per il tracciamento delle strutture anatomiche nel corso di serie temporali
- Sistemi autonomi che richiedono il rilevamento e il tracciamento adattivi degli oggetti
- Dataset multi-immagine per una segmentazione coerente degli oggetti tra immagini indipendenti
- Analisi di raccolte di immagini in cui gli oggetti devono essere tracciati in scene diverse
- Segmentazione tra domini che sfrutta la memoria di contesti di immagini diversi
- Annotazione semiautomatica per creare dataset in modo efficiente con un intervento manuale minimo
Confronto tra SAM e YOLO#
Qui confrontiamo i modelli SAM 2 di Meta, inclusa la variante SAM2-t più piccola, con i modelli di segmentazione Ultralytics, incluso YOLO26n-seg:
| Modello | Dimensioni (MB) | Parametri (M) | Velocità (CPU) (ms/im) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 41703 |
| Meta SAM2-b | 162 | 80.8 | 28867 |
| Meta SAM2-t | 78.1 | 38.9 | 23430 |
| MobileSAM | 40.7 | 10.1 | 23802 |
| FastSAM-s con backbone YOLOv8 | 23.9 | 11.8 | 58.0 |
| Ultralytics YOLOv8n-seg | 7,1 (11,0 volte più piccolo) | 3,4 (11,4 volte in meno) | 24,8 (945 volte più veloce) |
| Ultralytics YOLO11n-seg | 6.2 (12.6 volte più piccolo) | 2,9 (13,4 volte in meno) | 24.3 (964 volte più veloce) |
| Ultralytics YOLO26n-seg | 6,7 (11,7 volte più piccolo) | 2.7 (14.4 volte in meno) | 25,2 (930 volte più veloce) |
Questo confronto evidenzia le notevoli differenze nelle dimensioni e nelle velocità dei modelli tra le varianti di SAM e i modelli di segmentazione YOLO. Sebbene SAM offra capacità di segmentazione automatica uniche, i modelli YOLO, in particolare YOLOv8n-seg, YOLO11n-seg e YOLO26n-seg, sono significativamente più piccoli, veloci ed efficienti dal punto di vista computazionale.
Le velocità di SAM sono state misurate con PyTorch, mentre quelle di YOLO sono state misurate con ONNX Runtime. I test sono stati eseguiti su un Apple M4 Air del 2025 con 16 GB di RAM utilizzando torch==2.10.0, ultralytics==8.4.31 e onnxruntime==1.24.4. Per riprodurre questo test:
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# Profile SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# Profile YOLO models (ONNX)
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
onnx_path = model.export(format="onnx", dynamic=True, nms=False) # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11
model = YOLO(onnx_path)
model(ASSETS)Auto-annotazione: creazione efficiente di dataset#
L'auto-annotazione è una potente funzionalità di SAM 2 che consente di generare dataset di segmentazione in modo rapido e accurato sfruttando modelli preaddestrati. Questa funzionalità è particolarmente utile per creare dataset ampi e di alta qualità senza un notevole lavoro manuale.
Come eseguire l'auto-annotazione con SAM 2#
Watch: Auto Annotation with Meta's Segment Anything 2 Model using Ultralytics | Data Labeling
Per eseguire l'auto-annotazione del tuo dataset utilizzando SAM 2, segui questo esempio:
from ultralytics.data.annotator import auto_annotate
auto_annotate(data="path/to/images", det_model="yolo26x.pt", sam_model="sam2_b.pt")| Argomento | Tipo | Predefinito | Descrizione |
|---|---|---|---|
data | str | obbligatorio | Percorso della directory contenente le immagini di destinazione da annotare o segmentare. |
det_model | str | 'yolo26x.pt' | Percorso del modello di rilevamento YOLO per il rilevamento iniziale degli oggetti. |
sam_model | str | 'sam_b.pt' | Percorso del modello SAM per la segmentazione (supporta i pesi di SAM, SAM 2, MobileSAM e SAM 3). |
device | str | '' | Dispositivo di calcolo (ad esempio, 'cuda:0', 'cpu' o '' per il rilevamento automatico del dispositivo). |
conf | float | 0.25 | Soglia di confidenza del rilevamento YOLO per filtrare i rilevamenti deboli. |
iou | float | 0.45 | Soglia IoU per la soppressione dei non massimi, per filtrare i box sovrapposti. |
imgsz | int | 640 | Dimensione di input per il ridimensionamento delle immagini (deve essere un multiplo di 32). |
max_det | int | 300 | Numero massimo di rilevamenti per immagine per un uso efficiente della memoria. |
classes | list[int] | None | Elenco degli indici delle classi da rilevare (ad esempio, [0, 1] per persona e bicicletta). |
output_dir | str | None | Directory di salvataggio per le annotazioni (per impostazione predefinita: directory adiacente a <data>_auto_annotate_labels). |
Questa funzione facilita la rapida creazione di dataset di segmentazione di alta qualità, ideale per ricercatori e sviluppatori che desiderano accelerare i propri progetti.
Limitazioni#
Nonostante i suoi punti di forza, SAM 2 presenta alcune limitazioni:
- Stabilità del tracciamento: SAM 2 può perdere il tracciamento degli oggetti durante sequenze prolungate o in caso di significativi cambiamenti del punto di vista.
- Confusione tra oggetti: il modello può talvolta confondere oggetti dall'aspetto simile, soprattutto nelle scene affollate.
- Efficienza con più oggetti: l'efficienza della segmentazione diminuisce quando vengono elaborati più oggetti contemporaneamente, a causa della mancanza di comunicazione tra gli oggetti.
- Accuratezza dei dettagli: può non rilevare i dettagli più fini, soprattutto con oggetti in rapido movimento. Prompt aggiuntivi possono risolvere parzialmente questo problema, ma la fluidità temporale non è garantita.
Citazioni e ringraziamenti#
Se SAM 2 è una parte fondamentale del tuo lavoro di ricerca o sviluppo, citalo utilizzando il seguente riferimento:
@article{ravi2024sam2,
title={SAM 2: Segment Anything in Images and Videos},
author={Ravi, Nikhila and Gabeur, Valentin and Hu, Yuan-Ting and Hu, Ronghang and Ryali, Chaitanya and Ma, Tengyu and Khedr, Haitham and R{\"a}dle, Roman and Rolland, Chloe and Gustafson, Laura and Mintun, Eric and Pan, Junting and Alwala, Kalyan Vasudev and Carion, Nicolas and Wu, Chao-Yuan and Girshick, Ross and Doll{\'a}r, Piotr and Feichtenhofer, Christoph},
journal={arXiv preprint},
year={2024}
}Ringraziamo Meta AI per il contributo offerto alla comunità dell'IA con questo modello e dataset innovativi.
FAQ#
SAM 2, il successore del modello Segment Anything (SAM) di Meta, è uno strumento all'avanguardia progettato per la segmentazione completa degli oggetti sia nelle immagini sia nei video. Eccelle nella gestione di dati visivi complessi grazie a un'architettura unificata e programmabile tramite prompt, che supporta l'elaborazione in tempo reale e la generalizzazione zero-shot. SAM 2 offre diversi miglioramenti rispetto al SAM originale, tra cui:
- Architettura del modello unificata: combina le funzionalità di segmentazione delle immagini e dei video in un unico modello.
- Prestazioni in tempo reale: elabora circa 44 fotogrammi al secondo, risultando adatto alle applicazioni che richiedono un feedback immediato.
- Generalizzazione zero-shot: segmenta oggetti che non ha mai incontrato prima, risultando utile in diversi domini visivi.
- Perfezionamento interattivo: consente agli utenti di perfezionare iterativamente i risultati della segmentazione fornendo prompt aggiuntivi.
- Gestione avanzata delle sfide visive: gestisce le sfide comuni della segmentazione video, come l'occlusione e la ricomparsa degli oggetti.
Per maggiori dettagli sull'architettura e sulle funzionalità di SAM 2, consulta il paper di ricerca su SAM 2.
SAM 2 può essere utilizzato per la segmentazione video in tempo reale sfruttando la sua interfaccia programmabile tramite prompt e le sue funzionalità di inferenza in tempo reale. Ecco un esempio di base:
Segmentazione con promptUsa i prompt per segmentare oggetti specifici nelle immagini o nei video.
from ultralytics import SAM # Load a model model = SAM("sam2_b.pt") # Display model information (optional) model.info() # Segment with bounding box prompt results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200]) # Segment with point prompt results = model("path/to/image.jpg", points=[150, 150], labels=[1])Per un utilizzo più completo, consulta la sezione Come utilizzare SAM 2.
SAM 2 viene addestrato sul dataset SA-V, uno dei dataset di segmentazione video più grandi e diversificati disponibili. Il dataset SA-V include:
- Oltre 51.000 video: acquisiti in 47 Paesi, offrono un'ampia gamma di scenari del mondo reale.
- Oltre 600.000 annotazioni di maschere: annotazioni dettagliate di maschere spazio-temporali, denominate "masklet", che coprono oggetti interi e parti di oggetti.
- Dimensioni del dataset: include 4,5 volte più video e 53 volte più annotazioni rispetto ai precedenti dataset più grandi, offrendo una diversità e una complessità senza precedenti.
Questo ampio dataset consente a SAM 2 di ottenere prestazioni superiori sui principali benchmark di segmentazione video e ne migliora le capacità di generalizzazione zero-shot. Per ulteriori informazioni, consulta la sezione Dataset SA-V.
SAM 2 include un sofisticato meccanismo di memoria per gestire le dipendenze temporali e le occlusioni nei dati video. Il meccanismo di memoria è costituito da:
- Codificatore della memoria e banca della memoria: memorizza le caratteristiche dei fotogrammi precedenti.
- Modulo di attenzione della memoria: utilizza le informazioni memorizzate per mantenere un tracciamento coerente degli oggetti nel tempo.
- Testa per le occlusioni: gestisce specificamente gli scenari in cui gli oggetti non sono visibili, prevedendo la probabilità che un oggetto sia occluso.
Questo meccanismo garantisce la continuità anche quando gli oggetti sono temporaneamente nascosti o escono dalla scena per poi rientrarvi. Per maggiori dettagli, consulta la sezione Meccanismo di memoria e gestione delle occlusioni.
I modelli SAM 2, come SAM2-t e SAM2-b di Meta, offrono potenti capacità di segmentazione zero-shot, ma sono significativamente più grandi e lenti rispetto ai modelli YOLO. Ad esempio, YOLO26n-seg è circa 24 volte più piccolo e oltre 1145 volte più veloce di SAM2-b su CPU. Sebbene SAM 2 eccella negli scenari di segmentazione versatili, basati su prompt e zero-shot, YOLO26 è ottimizzato per velocità, efficienza e applicazioni in tempo reale con inferenza end-to-end senza NMS, risultando quindi più adatto alla distribuzione in ambienti con risorse limitate.