Ultralytics YOLO27:

SAM 2: Modello Segment Anything 2#

Evoluzione di SAM

SAM 2 si basa sul SAM originale SAM e aggiunge funzionalità di segmentazione video. Per la segmentazione di concetti tramite prompt testuali e immagini di esempio, consulta SAM 3.

Inference with Segment Anything 2 In Colab

SAM 2, il successore del modello Segment Anything (SAM) di Meta, è uno strumento all'avanguardia progettato per la segmentazione completa degli oggetti sia nelle immagini sia nei video. È particolarmente efficace nella gestione di dati visivi complessi grazie a un'architettura unificata e basata su prompt, che supporta l'elaborazione in tempo reale e la generalizzazione zero-shot.

SAM 2 sulla piattaforma Ultralytics

I modelli SAM 2.1 alimentano la funzionalità di annotazione intelligente sulla piattaforma Ultralytics, consentendo la segmentazione tramite clic per etichettare rapidamente i dataset. Consulta la guida all'annotazione per maggiori dettagli.

Esempi di risultati di SAM 2

Funzionalità principali#



Watch: How to Run Inference with Meta's SAM2 using Ultralytics | Step-by-Step Guide 🎉

Architettura unificata del modello#

SAM 2 combina le funzionalità di segmentazione di immagini e video in un unico modello. Questa unificazione semplifica il deployment e consente prestazioni uniformi tra diversi tipi di media. Sfrutta un'interfaccia flessibile basata su prompt, che permette di specificare gli oggetti di interesse tramite vari tipi di prompt, come punti, bounding box o maschere.

Prestazioni in tempo reale#

Il modello raggiunge velocità di inferenza in tempo reale, elaborando circa 44 fotogrammi al secondo. Questo rende SAM 2 adatto alle applicazioni che richiedono un feedback immediato, come l'editing video e la realtà aumentata.

Generalizzazione zero-shot#

SAM 2 è in grado di segmentare oggetti mai incontrati prima, dimostrando una solida generalizzazione zero-shot. Questa capacità è particolarmente utile in domini visivi diversificati o in evoluzione, dove le categorie predefinite potrebbero non comprendere tutti gli oggetti possibili.

Raffinamento interattivo#

Puoi perfezionare iterativamente i risultati della segmentazione fornendo prompt aggiuntivi, ottenendo un controllo preciso sull'output. Questa interattività è essenziale per ottimizzare i risultati in applicazioni come l'annotazione video o l'imaging medico.

Gestione avanzata delle sfide visive#

SAM 2 include meccanismi per gestire le sfide comuni della segmentazione video, come l'occlusione e la ricomparsa degli oggetti. Utilizza un sofisticato meccanismo di memoria per tenere traccia degli oggetti tra i fotogrammi, garantendo la continuità anche quando gli oggetti sono temporaneamente nascosti oppure escono dalla scena e vi rientrano.

Per comprendere più a fondo l'architettura e le funzionalità di SAM 2, consulta il documento di ricerca su SAM 2.

Prestazioni e dettagli tecnici#

SAM 2 stabilisce un nuovo punto di riferimento nel settore, superando i modelli precedenti in diverse metriche:

MetricaSAM 2SOTA precedenti
Segmentazione video interattivaMigliore-
Interazioni umane richieste3 volte in menoBaseline
Accuratezza della segmentazione delle immaginiMigliorataSAM
Velocità di inferenza6 volte più veloceSAM

Architettura del modello#

Componenti principali#

  • Encoder di immagini e video: utilizza un'architettura basata su transformer per estrarre caratteristiche di alto livello da immagini e fotogrammi video. Questo componente è responsabile della comprensione del contenuto visivo a ogni istante temporale.
  • Encoder dei prompt: elabora i prompt forniti dall'utente (punti, box, maschere) per guidare l'attività di segmentazione. Ciò consente a SAM 2 di adattarsi all'input dell'utente e di identificare oggetti specifici all'interno di una scena.
  • Meccanismo di memoria: include un encoder della memoria, una banca di memoria e un modulo di attenzione della memoria. Questi componenti memorizzano e utilizzano collettivamente le informazioni dei fotogrammi precedenti, consentendo al modello di mantenere un tracciamento degli oggetti coerente nel tempo.
  • Decoder delle maschere: genera le maschere di segmentazione finali sulla base delle caratteristiche dell'immagine codificate e dei prompt. Nei video utilizza anche il contesto della memoria per garantire un tracciamento accurato tra i fotogrammi.

Diagramma dell'architettura di SAM 2

Meccanismo di memoria e gestione delle occlusioni#

Il meccanismo di memoria consente a SAM 2 di gestire le dipendenze temporali e le occlusioni nei dati video. Quando gli oggetti si muovono e interagiscono, SAM 2 registra le loro caratteristiche in una banca di memoria. Quando un oggetto viene occluso, il modello può fare affidamento su questa memoria per prevederne la posizione e l'aspetto quando ricompare. La testa di occlusione gestisce specificamente gli scenari in cui gli oggetti non sono visibili, prevedendo la probabilità che un oggetto sia occluso.

Risoluzione dell'ambiguità delle maschere multiple#

In situazioni ambigue, ad esempio con oggetti sovrapposti, SAM 2 può generare più previsioni di maschere. Questa funzionalità è fondamentale per rappresentare accuratamente scene complesse in cui una singola maschera potrebbe non descriverne adeguatamente le sfumature.

Dataset SA-V#

Il dataset SA-V, sviluppato per l'addestramento di SAM 2, è uno dei dataset di segmentazione video più grandi e diversificati disponibili. Include:

  • Oltre 51.000 video: acquisiti in 47 Paesi, offrono un'ampia gamma di scenari del mondo reale.
  • Oltre 600.000 annotazioni di maschere: annotazioni dettagliate di maschere spazio-temporali, denominate "masklet", che coprono oggetti interi e parti di oggetti.
  • Dimensioni del dataset: include 4,5 volte più video e 53 volte più annotazioni rispetto ai precedenti dataset più grandi, offrendo una diversità e una complessità senza precedenti.

Benchmark#

Segmentazione degli oggetti nei video#

SAM 2 ha dimostrato prestazioni superiori nei principali benchmark di segmentazione video:

DatasetJ&FJF
DAVIS 201782.579.885.2
YouTube-VOS81.278.983.5

Segmentazione interattiva#

Nelle attività di segmentazione interattiva, SAM 2 mostra un'efficienza e un'accuratezza significative:

DatasetNoC@90AUC
DAVIS Interactive1.540.872

Installazione#

Per installare SAM 2, usa il comando seguente. Tutti i modelli SAM 2 verranno scaricati automaticamente al primo utilizzo.

pip install ultralytics

Come utilizzare SAM 2: versatilità nella segmentazione di immagini e video#

La tabella seguente illustra i modelli SAM 2 disponibili, i relativi pesi pretrained, le attività supportate e la compatibilità con diverse modalità operative, come Inferenza, Validazione, Addestramento ed Esportazione.

Tipo di modelloPesi preaddestratiAttività supportateAddestramentoConvalidaInferenzaEsportazione
SAM 2 tinysam2_t.ptSegmentazione delle istanze
SAM 2 smallsam2_s.ptSegmentazione delle istanze
SAM 2 basesam2_b.ptSegmentazione delle istanze
SAM 2 largesam2_l.ptSegmentazione delle istanze
SAM 2.1 tinysam2.1_t.ptSegmentazione delle istanze
SAM 2.1 smallsam2.1_s.ptSegmentazione delle istanze
SAM 2.1 basesam2.1_b.ptSegmentazione delle istanze
SAM 2.1 largesam2.1_l.ptSegmentazione delle istanze

Esempi di predizione con SAM 2#

SAM 2 può essere utilizzato in un'ampia gamma di attività, tra cui l'editing video in tempo reale, l'imaging medico e i sistemi autonomi. La sua capacità di segmentare dati visivi statici e dinamici lo rende uno strumento versatile per ricercatori e sviluppatori.

Segmentazione con prompt#

Segmentazione con prompt

Usa i prompt per segmentare oggetti specifici nelle immagini o nei video.

from ultralytics import SAM

# Load a model
model = SAM("sam2.1_b.pt")

# Display model information (optional)
model.info()

# Run inference with bboxes prompt
results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])

# Run inference with single point
results = model(points=[900, 370], labels=[1])

# Run inference with multiple points
results = model(points=[[400, 370], [900, 370]], labels=[1, 1])

# Run inference with multiple points prompt per object
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 1]])

# Run inference with negative points prompt
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 0]])

Segmentazione di tutto#

Segmentazione di tutto

Segmenta l'intero contenuto dell'immagine o del video senza prompt specifici.

from ultralytics import SAM

# Load a model
model = SAM("sam2.1_b.pt")

# Display model information (optional)
model.info()

# Run inference
model("path/to/video.mp4")

Segmentazione video e tracciamento degli oggetti#

Segmentazione video

Segmenta l'intero contenuto del video con prompt specifici e traccia gli oggetti.

from ultralytics.models.sam import SAM2VideoPredictor

# Create SAM2VideoPredictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_b.pt"}
predictor = SAM2VideoPredictor(overrides=overrides)

# Run inference with single point
results = predictor(source="test.mp4", points=[920, 470], labels=[1])

# Run inference with multiple points
results = predictor(source="test.mp4", points=[[920, 470], [909, 138]], labels=[1, 1])

# Run inference with multiple points prompt per object
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 1]])

# Run inference with negative points prompt
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 0]])
  • Questo esempio mostra come SAM 2 possa essere utilizzato per segmentare l'intero contenuto di un'immagine o di un video quando non vengono forniti prompt (bbox/punti/maschere).

Segmentazione e tracciamento interattivi dinamici#

SAM2DynamicInteractivePredictor è un'estensione avanzata di SAM 2 che non richiede addestramento e consente un'interazione dinamica con più fotogrammi e capacità di apprendimento continuo. Questo predittore supporta aggiornamenti dei prompt in tempo reale e la gestione della memoria per migliorare le prestazioni di tracciamento su una sequenza di immagini. Rispetto al SAM 2 originale, SAM2DynamicInteractivePredictor ricostruisce il flusso di inferenza per sfruttare al meglio i modelli SAM 2 preaddestrati senza richiedere addestramento aggiuntivo.

Esempi di risultati di SAM 2

Funzionalità principali#

Offre tre miglioramenti significativi:

  1. Interazione dinamica: aggiungi nuovi prompt per unire o tracciare nuove istanze non tracciate nei fotogrammi successivi in qualsiasi momento durante l'elaborazione del video
  2. Apprendimento continuo: aggiungi nuovi prompt per le istanze esistenti per migliorare nel tempo le prestazioni del modello
  3. Supporto indipendente per più immagini: elabora più immagini indipendenti (non necessariamente provenienti da una sequenza video) con condivisione della memoria e tracciamento degli oggetti tra le immagini

Funzionalità principali#

  • Flessibilità dei prompt: accetta bounding box, punti e maschere come prompt
  • Gestione della banca di memoria: mantiene una banca di memoria dinamica per memorizzare gli stati degli oggetti tra i fotogrammi
  • Tracciamento di più oggetti: supporta il tracciamento simultaneo di più oggetti con ID individuali
  • Aggiornamenti in tempo reale: consente di aggiungere nuovi prompt durante l'inferenza senza rielaborare i fotogrammi precedenti
  • Elaborazione indipendente delle immagini: elabora immagini indipendenti con un contesto di memoria condiviso per mantenere la coerenza degli oggetti tra le immagini
Aggiunta dinamica degli oggetti
from ultralytics.models.sam import SAM2DynamicInteractivePredictor

# Create SAM2DynamicInteractivePredictor
overrides = {"conf": 0.01, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_t.pt", "save": False}
predictor = SAM2DynamicInteractivePredictor(overrides=overrides, max_obj_num=10)

# Define a category by box prompt
predictor(source="image1.jpg", bboxes=[[100, 100, 200, 200]], obj_ids=[0], update_memory=True)

# Detect this particular object in a new image
results = predictor(source="image2.jpg")

# Add new category with a new object ID
results = predictor(
    source="image4.jpg",
    bboxes=[[300, 300, 400, 400]],  # New object
    obj_ids=[1],  # New object ID
    update_memory=True,  # Add to memory
)
# Perform inference
results = predictor(source="image5.jpg")

# Add refinement prompts to the same category to boost performance
# This helps when object appearance changes significantly
results = predictor(
    source="image6.jpg",
    points=[[150, 150]],  # Refinement point
    labels=[1],  # Positive point
    obj_ids=[1],  # Same object ID
    update_memory=True,  # Update memory with new information
)
# Perform inference on new image
results = predictor(source="image7.jpg")
Nota

Il SAM2DynamicInteractivePredictor è progettato per funzionare con i modelli SAM 2 e supporta l'aggiunta e il perfezionamento delle categorie con tutti i box, point, and mask prompts che SAM 2 supporta nativamente. È particolarmente utile per scenari in cui gli oggetti compaiono o cambiano nel tempo, come nell'annotazione video o in attività di modifica interattiva.

Argomenti#

NomeValore predefinitoTipo di datiDescrizione
max_obj_num3intNumero massimo preimpostato di categorie
update_memoryFalseboolIndica se aggiornare la memoria con nuovi prompt
obj_idsNoneList[int]Elenco degli ID degli oggetti corrispondenti ai prompt

Casi d'uso#

SAM2DynamicInteractivePredictor è ideale per:

  • Flussi di lavoro per l'annotazione di video in cui compaiono nuovi oggetti durante la sequenza
  • Modifica interattiva di video che richiede l'aggiunta e il perfezionamento degli oggetti in tempo reale
  • Applicazioni di videosorveglianza che richiedono il tracciamento dinamico degli oggetti
  • Imaging medico per il tracciamento delle strutture anatomiche nel corso di serie temporali
  • Sistemi autonomi che richiedono il rilevamento e il tracciamento adattivi degli oggetti
  • Dataset multi-immagine per una segmentazione coerente degli oggetti tra immagini indipendenti
  • Analisi di raccolte di immagini in cui gli oggetti devono essere tracciati in scene diverse
  • Segmentazione tra domini che sfrutta la memoria di contesti di immagini diversi
  • Annotazione semiautomatica per creare dataset in modo efficiente con un intervento manuale minimo

Confronto tra SAM e YOLO#

Qui confrontiamo i modelli SAM 2 di Meta, inclusa la variante SAM2-t più piccola, con i modelli di segmentazione Ultralytics, incluso YOLO26n-seg:

ModelloDimensioni
(MB)
Parametri
(M)
Velocità (CPU)
(ms/im)
Meta SAM-b37593.741703
Meta SAM2-b16280.828867
Meta SAM2-t78.138.923430
MobileSAM40.710.123802
FastSAM-s con backbone YOLOv823.911.858.0
Ultralytics YOLOv8n-seg7,1 (11,0 volte più piccolo)3,4 (11,4 volte in meno)24,8 (945 volte più veloce)
Ultralytics YOLO11n-seg6.2 (12.6 volte più piccolo)2,9 (13,4 volte in meno)24.3 (964 volte più veloce)
Ultralytics YOLO26n-seg6,7 (11,7 volte più piccolo)2.7 (14.4 volte in meno)25,2 (930 volte più veloce)

Questo confronto evidenzia le notevoli differenze nelle dimensioni e nelle velocità dei modelli tra le varianti di SAM e i modelli di segmentazione YOLO. Sebbene SAM offra capacità di segmentazione automatica uniche, i modelli YOLO, in particolare YOLOv8n-seg, YOLO11n-seg e YOLO26n-seg, sono significativamente più piccoli, veloci ed efficienti dal punto di vista computazionale.

Le velocità di SAM sono state misurate con PyTorch, mentre quelle di YOLO sono state misurate con ONNX Runtime. I test sono stati eseguiti su un Apple M4 Air del 2025 con 16 GB di RAM utilizzando torch==2.10.0, ultralytics==8.4.31 e onnxruntime==1.24.4. Per riprodurre questo test:

Esempio
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# Profile SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# Profile YOLO models (ONNX)
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    onnx_path = model.export(format="onnx", dynamic=True, nms=False)  # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11
    model = YOLO(onnx_path)
    model(ASSETS)

Auto-annotazione: creazione efficiente di dataset#

L'auto-annotazione è una potente funzionalità di SAM 2 che consente di generare dataset di segmentazione in modo rapido e accurato sfruttando modelli preaddestrati. Questa funzionalità è particolarmente utile per creare dataset ampi e di alta qualità senza un notevole lavoro manuale.

Come eseguire l'auto-annotazione con SAM 2#



Watch: Auto Annotation with Meta's Segment Anything 2 Model using Ultralytics | Data Labeling

Per eseguire l'auto-annotazione del tuo dataset utilizzando SAM 2, segui questo esempio:

Esempio di auto-annotazione
from ultralytics.data.annotator import auto_annotate

auto_annotate(data="path/to/images", det_model="yolo26x.pt", sam_model="sam2_b.pt")
ArgomentoTipoPredefinitoDescrizione
datastrobbligatorioPercorso della directory contenente le immagini di destinazione da annotare o segmentare.
det_modelstr'yolo26x.pt'Percorso del modello di rilevamento YOLO per il rilevamento iniziale degli oggetti.
sam_modelstr'sam_b.pt'Percorso del modello SAM per la segmentazione (supporta i pesi di SAM, SAM 2, MobileSAM e SAM 3).
devicestr''Dispositivo di calcolo (ad esempio, 'cuda:0', 'cpu' o '' per il rilevamento automatico del dispositivo).
conffloat0.25Soglia di confidenza del rilevamento YOLO per filtrare i rilevamenti deboli.
ioufloat0.45Soglia IoU per la soppressione dei non massimi, per filtrare i box sovrapposti.
imgszint640Dimensione di input per il ridimensionamento delle immagini (deve essere un multiplo di 32).
max_detint300Numero massimo di rilevamenti per immagine per un uso efficiente della memoria.
classeslist[int]NoneElenco degli indici delle classi da rilevare (ad esempio, [0, 1] per persona e bicicletta).
output_dirstrNoneDirectory di salvataggio per le annotazioni (per impostazione predefinita: directory adiacente a <data>_auto_annotate_labels).

Questa funzione facilita la rapida creazione di dataset di segmentazione di alta qualità, ideale per ricercatori e sviluppatori che desiderano accelerare i propri progetti.

Limitazioni#

Nonostante i suoi punti di forza, SAM 2 presenta alcune limitazioni:

  • Stabilità del tracciamento: SAM 2 può perdere il tracciamento degli oggetti durante sequenze prolungate o in caso di significativi cambiamenti del punto di vista.
  • Confusione tra oggetti: il modello può talvolta confondere oggetti dall'aspetto simile, soprattutto nelle scene affollate.
  • Efficienza con più oggetti: l'efficienza della segmentazione diminuisce quando vengono elaborati più oggetti contemporaneamente, a causa della mancanza di comunicazione tra gli oggetti.
  • Accuratezza dei dettagli: può non rilevare i dettagli più fini, soprattutto con oggetti in rapido movimento. Prompt aggiuntivi possono risolvere parzialmente questo problema, ma la fluidità temporale non è garantita.

Citazioni e ringraziamenti#

Se SAM 2 è una parte fondamentale del tuo lavoro di ricerca o sviluppo, citalo utilizzando il seguente riferimento:

Citazione
@article{ravi2024sam2,
  title={SAM 2: Segment Anything in Images and Videos},
  author={Ravi, Nikhila and Gabeur, Valentin and Hu, Yuan-Ting and Hu, Ronghang and Ryali, Chaitanya and Ma, Tengyu and Khedr, Haitham and R{\"a}dle, Roman and Rolland, Chloe and Gustafson, Laura and Mintun, Eric and Pan, Junting and Alwala, Kalyan Vasudev and Carion, Nicolas and Wu, Chao-Yuan and Girshick, Ross and Doll{\'a}r, Piotr and Feichtenhofer, Christoph},
  journal={arXiv preprint},
  year={2024}
}

Ringraziamo Meta AI per il contributo offerto alla comunità dell'IA con questo modello e dataset innovativi.

FAQ#

  • SAM 2, il successore del modello Segment Anything (SAM) di Meta, è uno strumento all'avanguardia progettato per la segmentazione completa degli oggetti sia nelle immagini sia nei video. Eccelle nella gestione di dati visivi complessi grazie a un'architettura unificata e programmabile tramite prompt, che supporta l'elaborazione in tempo reale e la generalizzazione zero-shot. SAM 2 offre diversi miglioramenti rispetto al SAM originale, tra cui:

    • Architettura del modello unificata: combina le funzionalità di segmentazione delle immagini e dei video in un unico modello.
    • Prestazioni in tempo reale: elabora circa 44 fotogrammi al secondo, risultando adatto alle applicazioni che richiedono un feedback immediato.
    • Generalizzazione zero-shot: segmenta oggetti che non ha mai incontrato prima, risultando utile in diversi domini visivi.
    • Perfezionamento interattivo: consente agli utenti di perfezionare iterativamente i risultati della segmentazione fornendo prompt aggiuntivi.
    • Gestione avanzata delle sfide visive: gestisce le sfide comuni della segmentazione video, come l'occlusione e la ricomparsa degli oggetti.

    Per maggiori dettagli sull'architettura e sulle funzionalità di SAM 2, consulta il paper di ricerca su SAM 2.

  • SAM 2 può essere utilizzato per la segmentazione video in tempo reale sfruttando la sua interfaccia programmabile tramite prompt e le sue funzionalità di inferenza in tempo reale. Ecco un esempio di base:

    Segmentazione con prompt

    Usa i prompt per segmentare oggetti specifici nelle immagini o nei video.

    from ultralytics import SAM
    
    # Load a model
    model = SAM("sam2_b.pt")
    
    # Display model information (optional)
    model.info()
    
    # Segment with bounding box prompt
    results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])
    
    # Segment with point prompt
    results = model("path/to/image.jpg", points=[150, 150], labels=[1])

    Per un utilizzo più completo, consulta la sezione Come utilizzare SAM 2.

  • SAM 2 viene addestrato sul dataset SA-V, uno dei dataset di segmentazione video più grandi e diversificati disponibili. Il dataset SA-V include:

    • Oltre 51.000 video: acquisiti in 47 Paesi, offrono un'ampia gamma di scenari del mondo reale.
    • Oltre 600.000 annotazioni di maschere: annotazioni dettagliate di maschere spazio-temporali, denominate "masklet", che coprono oggetti interi e parti di oggetti.
    • Dimensioni del dataset: include 4,5 volte più video e 53 volte più annotazioni rispetto ai precedenti dataset più grandi, offrendo una diversità e una complessità senza precedenti.

    Questo ampio dataset consente a SAM 2 di ottenere prestazioni superiori sui principali benchmark di segmentazione video e ne migliora le capacità di generalizzazione zero-shot. Per ulteriori informazioni, consulta la sezione Dataset SA-V.

  • SAM 2 include un sofisticato meccanismo di memoria per gestire le dipendenze temporali e le occlusioni nei dati video. Il meccanismo di memoria è costituito da:

    • Codificatore della memoria e banca della memoria: memorizza le caratteristiche dei fotogrammi precedenti.
    • Modulo di attenzione della memoria: utilizza le informazioni memorizzate per mantenere un tracciamento coerente degli oggetti nel tempo.
    • Testa per le occlusioni: gestisce specificamente gli scenari in cui gli oggetti non sono visibili, prevedendo la probabilità che un oggetto sia occluso.

    Questo meccanismo garantisce la continuità anche quando gli oggetti sono temporaneamente nascosti o escono dalla scena per poi rientrarvi. Per maggiori dettagli, consulta la sezione Meccanismo di memoria e gestione delle occlusioni.

  • I modelli SAM 2, come SAM2-t e SAM2-b di Meta, offrono potenti capacità di segmentazione zero-shot, ma sono significativamente più grandi e lenti rispetto ai modelli YOLO. Ad esempio, YOLO26n-seg è circa 24 volte più piccolo e oltre 1145 volte più veloce di SAM2-b su CPU. Sebbene SAM 2 eccella negli scenari di segmentazione versatili, basati su prompt e zero-shot, YOLO26 è ottimizzato per velocità, efficienza e applicazioni in tempo reale con inferenza end-to-end senza NMS, risultando quindi più adatto alla distribuzione in ambienti con risorse limitate.

Commenti