Ultralytics YOLO27:

SAM 3: Kavramlarla Her Şeyi Segmentleme#

SAM 3 istemlenebilir kavram segmentasyonuna genel bakış

SAM 3 (Her Şeyi Segmentleme Modeli 3), Meta'nın İstemlenebilir Kavram Segmentasyonu (PCS) için yayımladığı temel modeldir. SAM 2 üzerine inşa edilen SAM 3, temelde yeni bir yetenek sunar: metin istemleri, görüntü örnekleri veya her ikisiyle belirtilen bir görsel kavramın tüm örneklerini algılama, segmentlere ayırma ve takip etme. Tek bir istemle tek nesneyi segmentlere ayıran önceki SAM sürümlerinden farklı olarak SAM 3, görüntülerde veya videolarda herhangi bir yerde görünen bir kavramın her örneğini bulup segmentlere ayırabilir; bu da modern örnek segmentasyonu alanındaki açık kelime dağarcığı hedefleriyle uyumludur.



Watch: How to Use Meta Segment Anything 3 with Ultralytics | Text-Prompt Segmentation on Images & Videos

SAM 3, metin ipuçları, görsel örnek ipuçları ve video takibi ile kavram bölütleme için yerel destek sağlayarak ultralytics paketine tamamen entegre edilmiştir. Daha yeni olan SAM 3.1 kontrol noktası, görsel tahmini için desteklenmektedir.

Genel Bakış#

SAM 3, İstemlenebilir Kavram Segmentasyonu alanında mevcut sistemlere kıyasla 2 kat performans artışı sağlarken SAM 2'nin etkileşimli görsel segmentasyon yeteneklerini korur ve geliştirir. Model, kullanıcıların basit isim öbekleri (ör. "sarı okul otobüsü", "çizgili kedi") kullanarak veya hedef nesnenin örnek görüntülerini sağlayarak kavramları belirtmesine olanak tanıyan açık kelime dağarcıklı segmentasyonda başarılıdır. Bu yetenekler, kolaylaştırılmış predict ve track iş akışlarına dayanan üretime hazır işlem hatlarını tamamlar.

SAM 3 metin istemi segmentasyonu örnekleri

İstemlenebilir Kavram Segmentasyonu (PCS) nedir?#

PCS görevi, girdi olarak bir kavram istemi alır ve eşleşen tüm nesne örnekleri için benzersiz kimliklere sahip segmentasyon maskeleri döndürür. Kavram istemleri şunlar olabilir:

  • Metin: Sıfır örnekli öğrenmeye benzer şekilde "kırmızı elma" veya "şapka takan kişi" gibi basit isim öbekleri
  • Görüntü örnekleri: Hızlı genelleme için örnek nesnelerin etrafındaki (pozitif veya negatif) sınırlayıcı kutular
  • Birleşik: Hassas kontrol için hem metin hem de görüntü örnekleri birlikte

Bu yaklaşım, özgün SAM ailesi ile yaygınlaşan ve yalnızca tek bir belirli nesne örneğini segmentlere ayıran geleneksel görsel istemlerden (noktalar, kutular, maskeler) farklıdır.

Temel Performans Ölçütleri#

ÖlçütSAM 3 Başarımı
LVIS Sıfır Örnekli Maske AP'si47,0 (önceki en iyi değer 38,5'e kıyasla, %22 iyileşme)
SA-Co KarşılaştırmasıMevcut sistemlerden 2 kat daha iyi
Çıkarım Hızı (H200 GPU)100'den fazla algılanan nesneyle görüntü başına 30 ms
Video Performansı~5 eş zamanlı nesne için gerçeğe yakın zamanlı
MOSEv2 VOS Karşılaştırması60,1 J&F (SAM 2.1'e kıyasla +%25,5, önceki SOTA'ya kıyasla +%17)
Etkileşimli İyileştirme3 örnek isteminden sonra +18,6 CGF1 iyileşme
İnsan Performansı FarkıSA-Co/Gold üzerinde tahmini alt sınırın %88'ine ulaşır

Üretimde model ölçütleri ve ödünleşimleri hakkında bilgi için model değerlendirme içgörülerine ve YOLO performans ölçütlerine bak.

SAM 3.1#

Meta tarafından 27 Mart 2026'da yayınlanan SAM 3.1, çok nesneli video takibi için paylaşımlı belleğe dayalı bir yaklaşım olan Nesne Çoklaması özelliğini ekleyen yeni bir SAM 3 kontrol noktasıdır. SAM 3.1, takibi yapılan her nesneyi bağımsız olarak işlemek yerine nesneleri sabit kapasiteli gruplarda toplar ve bunları ortaklaşa işler; Meta, bunun tek bir H100 GPU üzerinde 128 nesnede ~7 kat hızlanma sağladığını bildirmektedir. Görsel dedektörü ve etkileşimli nokta ipucu başlığı, SAM 3 mimarisini korur.

KıyaslamaÖlçütSAM 3SAM 3.1
SA-Co/VEval SA-V (test)cgF130.330.5
SA-Co/VEval YT-Temporal-1B (test)cgF150.852.9
SA-Co/VEval SmartGlasses (test)cgF136.436.3
MOSEv1 (val)J&F78.479.6
DAVIS17 (val)J&F92.292.7
SA-V (test)J&F84.485.1
YTVOS19 (val)G89.789.3
MOSEv2 (val)J&Ḟ60.362.3

Ultralytics, SAM 3.1 kontrol noktasını (sam3.1_multiplex.pt) SAM 3 görsel tahminleyicilerine yükler: nokta ve kutu ipuçları için SAM("sam3.1_multiplex.pt"), metin ve örnek ipuçları için SAM3SemanticPredictor. Nesne Çoklaması video takibi henüz desteklenmemektedir, bu nedenle sam3.pt öğesini SAM3VideoPredictor ve SAM3VideoSemanticPredictor ile birlikte kullanmaya devam et.

Mimari#

SAM 3, Perception Encoder (PE) görsel omurgasını paylaşan bir algılayıcı ve izleyiciden oluşur. Bu ayrıştırılmış tasarım, görev çatışmalarını önlerken hem görüntü düzeyinde algılamayı hem de video düzeyinde takibi mümkün kılar ve Ultralytics Python kullanımı ile CLI kullanımı ile uyumlu bir arayüz sunar.

Temel Bileşenler#

  • Algılayıcı: Görüntü düzeyinde kavram algılama için DETR tabanlı mimari

    • İsim öbeği istemleri için metin kodlayıcı
    • Görüntü tabanlı istemler için örnek kodlayıcı
    • Görüntü özelliklerini istemlere göre koşullandıran füzyon kodlayıcı
    • Tanımayı ("ne") yerelleştirmeden ("nerede") ayıran yeni presence head
    • Örnek segmentasyon maskeleri oluşturmak için maske başlığı
  • İzleyici: SAM 2'den devralınan bellek tabanlı video segmentasyonu

    • İstem kodlayıcı, maske kod çözücü, bellek kodlayıcı
    • Kareler arasında nesne görünümünü depolamak için bellek bankası
    • Çok nesneli ortamlarda Kalman filtresi gibi tekniklerle desteklenen zamansal ayrıştırma
  • Presence Token: Hedef kavramın görüntüde/karede bulunup bulunmadığını tahmin eden, tanımayı yerelleştirmeden ayırarak algılamayı iyileştiren öğrenilmiş küresel belirteç.

SAM 3 model mimarisi diyagramı

Temel Yenilikler#

  1. Ayrıştırılmış Tanıma ve Yerelleştirme: Presence head kavramın varlığını genel düzeyde tahmin ederken öneri sorguları yalnızca yerelleştirmeye odaklanır ve çakışan hedefleri önler.
  2. Birleşik Kavram ve Görsel İstemler: Hem PCS'yi (kavram istemleri) hem de PVS'yi (SAM 2'nin tıklamaları/kutuları gibi görsel istemler) tek bir modelde destekler.
  3. Etkileşimli Örnek İyileştirme: Kullanıcılar sonuçları yinelemeli olarak iyileştirmek için pozitif veya negatif görüntü örnekleri ekleyebilir; model yalnızca tek tek örnekleri düzeltmek yerine benzer nesnelere genelleme yapar.
  4. Zamansal Ayrıştırma: Videoda örtülmeleri, kalabalık sahneleri ve takip hatalarını ele almak için maske parçası algılama skorlarını ve düzenli olarak yeniden istem göndermeyi kullanır; bu yaklaşım örnek segmentasyonu ve takibi için en iyi uygulamalarla uyumludur.

SA-Co Veri Kümesi#

SAM 3, Meta'nın bugüne kadarki en büyük ve en çeşitli segmentasyon veri kümesi olan Kavramlarla Her Şeyi Segmentleme (SA-Co) üzerinde eğitilmiştir ve COCO ile LVIS gibi yaygın karşılaştırma ölçütlerinin ötesine geçer.

Eğitim Verileri#

Veri Kümesi BileşeniAçıklamaÖlçek
SA-Co/HQ4 aşamalı veri motorundan elde edilen, insanlar tarafından yüksek kaliteli şekilde açıklanmış görüntü verileri5,2 milyon görüntü, 4 milyon benzersiz isim öbeği
SA-Co/SYNİnsan müdahalesi olmadan yapay zekâ tarafından etiketlenen sentetik veri kümesi38 milyon isim öbeği, 1,4 milyar maske
SA-Co/EXTZor negatiflerle zenginleştirilmiş 15 harici veri kümesiKaynağa göre değişir
SA-Co/VIDEOZamansal takibe sahip video açıklamaları52,5 bin video, 24,8 bin benzersiz isim öbeği

Karşılaştırma Verileri#

SA-Co değerlendirme karşılaştırması, 126 bin görüntü ve videoda 214 bin benzersiz ifade içerir ve mevcut karşılaştırma ölçütlerinden 50 kattan fazla kavram sunar. Şunları içerir:

  • SA-Co/Gold: İnsan performansı sınırlarını ölçmek için üçlü açıklanmış 7 alan
  • SA-Co/Silver: Tek insan açıklamasına sahip 10 alan
  • SA-Co/Bronze ve SA-Co/Bio: Kavram segmentasyonuna uyarlanmış 9 mevcut veri kümesi
  • SA-Co/VEval: 3 alana sahip video karşılaştırması (SA-V, YT-Temporal-1B, SmartGlasses)

Veri Motoru Yenilikleri#

SAM 3'ün insanı ve modeli döngüye dahil eden ölçeklenebilir veri motoru, şu yollarla 2 kat açıklama verimliliği sağlar:

  1. Yapay Zekâ Açıklayıcıları: Llama tabanlı modeller, zor negatifler dahil olmak üzere çeşitli isim öbekleri önerir
  2. Yapay Zekâ Doğrulayıcıları: İnce ayarlı çok modlu LLM'ler, maske kalitesini ve eksiksizliğini insana yakın performansla doğrular
  3. Aktif Madencilik: İnsan emeğini, yapay zekânın zorlandığı zorlu hata örneklerine odaklar
  4. Ontoloji Odaklı: Kavram kapsamı için Wikidata temelli geniş bir ontolojiden yararlanır

Kurulum#

ultralytics paketini yükle veya yükselt:

pip install -U ultralytics
SAM 3 Model Ağırlıkları Gerekli

Diğer Ultralytics modellerinden farklı olarak SAM 3 ağırlıkları (sam3.pt) otomatik olarak indirilmez. Önce Hugging Face üzerindeki SAM 3 model sayfasından model ağırlıklarına erişim istemen, ardından onaylandıktan sonra sam3.pt dosyasını bu sayfadan indirmen gerekir. İndirilen sam3.pt dosyasını çalışma dizinine yerleştir veya modeli yüklerken tam yolu belirt.

SAM 3.1 ağırlıkları (sam3.1_multiplex.pt), SAM 3.1 model sayfasında aynı şekilde kısıtlanmıştır. Aşağıdaki görsel örneklerinin sam3.pt kullandığı herhangi bir yere sam3.1_multiplex.pt ekle.

`TypeError: 'SimpleTokenizer' object is not callable`

Tahmin sırasında yukarıdaki hatayı alırsan yanlış clip paketi yüklü demektir. Aşağıdaki komutu çalıştırarak doğru clip paketini yükle:

pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.git

SAM 3 Nasıl Kullanılır: Kavram Segmentasyonunda Çok Yönlülük#

SAM 3, farklı tahminci arayüzleri aracılığıyla hem İstemlenebilir Kavram Segmentasyonu (PCS) hem de İstemlenebilir Görsel Segmentasyon (PVS) görevlerini destekler:

Desteklenen Görevler ve Modeller#

Görev Türüİstem TürleriÇıktı
Kavram Segmentasyonu (PCS)Metin (isim öbekleri), görüntü örnekleriKavramla eşleşen tüm örnekler
Görsel Segmentasyon (PVS)Noktalar, kutular, maskelerTek nesne örneği (SAM 2 tarzı)
Etkileşimli İyileştirmeÖrnekleri veya tıklamaları yinelemeli olarak ekle/kaldırİyileştirilmiş doğrulukla rafine edilmiş segmentasyon

Kavram Segmentasyonu Örnekleri#

Metin İstemleriyle Segmentasyon#

Metin Tabanlı Kavram Segmentasyonu

Metin açıklaması kullanarak bir kavramın tüm örneklerini bul ve segmentlere ayır. Metin istemleri SAM3SemanticPredictor arayüzünü gerektirir.

from ultralytics.models.sam import SAM3SemanticPredictor

# Initialize predictor with configuration
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "model": "sam3.pt",
    "quantize": 16,  # Use FP16 for faster inference
    "save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Set image once for multiple queries
predictor.set_image("path/to/image.jpg")

# Query with multiple text prompts
results = predictor(text=["person", "bus", "glasses"])

# Works with descriptive phrases
results = predictor(text=["person with red cloth", "person with blue cloth"])

# Query with a single concept
results = predictor(text=["a person"])

Görüntü Örnekleriyle Segmentasyon#

Görüntü Örneği Tabanlı Segmentasyon

Tüm benzer örnekleri bulmak için sınırlayıcı kutuları görsel istemler olarak kullan. Bu işlem kavram tabanlı eşleştirme için ayrıca SAM3SemanticPredictor gerektirir.

from ultralytics.models.sam import SAM3SemanticPredictor

# Initialize predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Set image
predictor.set_image("path/to/image.jpg")

# Provide bounding box examples to segment similar objects
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])

# Multiple bounding boxes as exemplars of the same visual concept
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])

Verimlilik için Özellik Tabanlı Çıkarım#

Birden Çok Sorgu için Görüntü Özelliklerini Yeniden Kullanma

Verimliliği artırmak için görüntü özelliklerini bir kez çıkar ve birden çok segmentasyon sorgusunda yeniden kullan.

import cv2

from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors

# Initialize predictors
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)

# Extract features from the first predictor
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]

# Setup second predictor and reuse features
predictor2.setup_model()

# Perform inference using shared features with text prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])

# Perform inference using shared features with bounding box prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])

# Visualize results
if masks is not None:
    masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
    im = cv2.imread(source)
    annotator = Annotator(im, pil=False)
    annotator.masks(masks, [colors(x, True) for x in range(len(masks))])

    cv2.imshow("result", annotator.result())
    cv2.waitKey(0)

Video Kavram Segmentasyonu#

Sınırlayıcı Kutularla Video Boyunca Kavramları İzleme#

Görsel İstemlerle Video Takibi

Sınırlayıcı kutu istemlerini kullanarak video kareleri boyunca nesne örneklerini algıla ve takip et.

from ultralytics.models.sam import SAM3VideoPredictor

# Create video predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)

# Track objects using bounding box prompts
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)

# Process and display results
for r in results:
    r.show()  # Display frame with segmentation masks

Metin İstemleriyle Kavramları İzleme#

Anlamsal Sorgularla Video Takibi

Metinle belirtilen kavramların tüm örneklerini video kareleri boyunca takip et.

from ultralytics.models.sam import SAM3VideoSemanticPredictor

# Initialize semantic video predictor
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "imgsz": 640,
    "model": "sam3.pt",
    "quantize": 16,
    "save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)

# Track concepts using text prompts
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)

# Process results
for r in results:
    r.show()  # Display frame with tracked objects

# Alternative: Track with bounding box prompts
results = predictor(
    source="path/to/video.mp4",
    bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
    labels=[1, 1],  # Positive labels
    stream=True,
)

Görsel İstemler (SAM 2 Uyumluluğu)#

SAM 3, tek nesne segmentasyonu için SAM 2'nin görsel istemleriyle tam geriye dönük uyumluluğu korur:

SAM 2 Tarzı Görsel İstemler

Temel SAM arayüzü, SAM 2 ile tam olarak aynı şekilde çalışır ve yalnızca görsel istemlerin (noktalar, kutular veya maskeler) belirttiği belirli alanı segmente eder.

from ultralytics import SAM

model = SAM("sam3.pt")

# Single point prompt - segments object at specific location
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()

# Multiple points - segments single object with multiple point hints
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])

# Box prompt - segments object within bounding box
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()
Görsel İstemler ve Kavram Segmentasyonu Karşılaştırması

Görsel istemlerle (noktalar/kutular/maskeler) SAM("sam3.pt") kullanıldığında, tıpkı SAM 2'de olduğu gibi o konumdaki yalnızca belirli nesne segmente edilir. Bir kavramın tüm örneklerini segmentlere ayırmak için yukarıda gösterildiği gibi metin veya örnek istemleriyle SAM3SemanticPredictor kullan.

Performans Karşılaştırmaları#

Görüntü Segmentasyonu#

SAM 3, LVIS ve segmentasyon için COCO gibi gerçek dünya veri kümeleri de dahil olmak üzere birden çok karşılaştırma testinde son teknoloji sonuçlara ulaşır:

KıyaslamaÖlçütSAM 3Önceki En İyiİyileştirme
LVIS (sıfır örnekli)Maske AP'si47.038.5+22.1%
SA-Co/GoldCGF165.034.3 (OWLv2)+89.5%
COCO (sıfır örnekli)Kutu AP'si53.552.2 (T-Rex2)+2.5%
ADE-847 (anlamsal seg)mIoU14.79.2 (APE-D)+59.8%
PascalConcept-59mIoU59.458.5 (APE-D)+1.5%
Cityscapes (anlamsal seg)mIoU65.144.2 (APE-D)+47.3%

Hızlı denemeler için veri kümesi seçeneklerini Ultralytics veri kümeleri sayfasında keşfet.

Video Segmentasyonu Performansı#

SAM 3, DAVIS 2017 ve YouTube-VOS gibi video karşılaştırma testlerinde SAM 2'ye ve önceki son teknoloji yöntemlere kıyasla önemli iyileştirmeler gösterir:

KıyaslamaÖlçütSAM 3SAM 2.1 Lİyileştirme
MOSEv2J&F60.147.9+25.5%
DAVIS 2017J&F92.090.7+1.4%
LVOSv2J&F88.279.6+10.8%
SA-VJ&F84.678.4+7.9%
YTVOS19J&F89.689.3+0.3%

Az Örnekli Uyarlama#

SAM 3, veri merkezli yapay zeka iş akışlarıyla ilgili olarak, yeni alanlara çok az örnekle uyarlanmada başarılıdır:

Kıyaslama0 örnekli AP10 örnekli APÖnceki En İyi (10 örnekli)
ODinW1359.971.667.9 (gDino1.5-Pro)
RF100-VL14.335.733.7 (gDino-T)

Etkileşimli İyileştirmenin Etkinliği#

SAM 3'ün örneklerle kavram tabanlı istem kullanımı, görsel istem kullanımına kıyasla çok daha hızlı yakınsar:

Eklenen İstemlerCGF1 SkoruYalnızca Metne Göre KazançPVS Taban Çizgisine Göre Kazanç
Yalnızca metin46.4taban çizgisitaban çizgisi
+1 örnek57.6+11.2+6.7
+2 örnek62.2+15.8+9.7
+3 örnek65.0+18.6+11.2
+4 örnek65.7+19.3+11.5 (plato)

Nesne Sayma Doğruluğu#

SAM 3, nesne sayma için yaygın bir gereksinim olan tüm örnekleri segmente ederek doğru sayım sağlar:

KıyaslamaDoğrulukMAEEn İyi MLLM'ye Göre
CountBench95.6%0.11%92.4 (Gemini 2.5)
PixMo-Count87.3%0.22%88.8 (Molmo-72B)

SAM 3 ve SAM 2 ile YOLO Karşılaştırması#

Burada SAM 3'ün yeteneklerini SAM 2 ve YOLO26 modelleriyle karşılaştırıyoruz. Aynı tür istemlerden gerçek zamanlı, açık kelime dağarcıklı algılama ve segmentasyon için YOLOE sayfasına bak:

YetenekSAM 3SAM 2YOLO26n-seg
Kavram Segmentasyonu✅ Metin/örneklerden tüm örnekler❌ Desteklenmiyor❌ Desteklenmiyor
Görsel Segmentasyon✅ Tek örnek (SAM 2 uyumlu)✅ Tek örnek✅ Tüm örnekler
Sıfır Örnekli Yetenek✅ Açık kelime dağarcığı✅ Geometrik istemler❌ Kapalı küme
Etkileşimli İyileştirme✅ Örnekler + tıklamalar✅ Yalnızca tıklamalar❌ Desteklenmiyor
Video Takibi✅ Kimliklerle çoklu nesne✅ Çoklu nesne✅ Çoklu nesne
LVIS Maske AP (sıfır atışlı)47.0N/AN/A
MOSEv2 J&F60.147.9N/A
Hız (GPU, ms/im)29218578.4
Model Boyutu3.45 GB162 MB (temel)6.4 MB

Hız, torch==2.9.1 ve ultralytics==8.4.19 kullanılarak NVIDIA RTX PRO 6000 üzerinde kıyaslanmıştır.

Önemli Çıkarımlar:

  • SAM 3: Açık kelime dağarcıklı kavram segmentasyonu ve metin ya da örnek istemleriyle bir kavramın tüm örneklerini bulmak için en iyisi
  • SAM 2: Görüntülerde ve videolarda geometrik istemlerle etkileşimli tek nesne segmentasyonu için en iyisi
  • YOLO26: GPU'lar, CPU'lar ve uç cihazlarda dağıtım için birçok biçime aktarılabilir isteğe bağlı NMS'siz uçtan uca çıkarımla gerçek zamanlı, yüksek hızlı bölütleme için en iyisi

SAM ile YOLO Karşılaştırması#

SAM 3, SAM 2, SAM, MobileSAM ve FastSAM ile Ultralytics YOLO segmentasyon modellerinin (YOLOv8, YOLO11, YOLO26) boyut, parametre ve GPU çıkarım hızı açısından karşılaştırması:

ModelBoyut
(MB)
Parametreler
(M)
Hız (GPU)
(ms/im)
Meta SAM-b37593.71306
Meta SAM2-b16280.8857
Meta SAM2-t78.138.9668
Meta SAM33450473.62921
MobileSAM40.710.1605
YOLOv8 omurgası ile FastSAM-s23.711.855.9
Ultralytics YOLOv8n-seg6.7 (515 kat daha küçük)3.4 (139.1 kat daha az)17.4 (167 kat daha hızlı)
Ultralytics YOLO11n-seg5.9 (585 kat daha küçük)2.9 (163.1 kat daha az)12.6 (231 kat daha hızlı)
Ultralytics YOLO26n-seg6.4 (539 kat daha küçük)2.7 (175.2 kat daha az)8.4 (347 kat daha hızlı)

Bu karşılaştırma, SAM varyantları ile YOLO segmentasyon modelleri arasındaki model boyutları ve hızlardaki önemli farkları ortaya koyar. SAM benzersiz otomatik segmentasyon yetenekleri sunarken, özellikle YOLOv8n-seg, YOLO11n-seg ve YOLO26n-seg olmak üzere YOLO modelleri önemli ölçüde daha küçük, daha hızlı ve hesaplama açısından daha verimlidir.

Testler, torch==2.9.1 ve ultralytics==8.4.19 kullanılarak 96 GB VRAM'e sahip NVIDIA RTX PRO 6000 üzerinde gerçekleştirilmiştir. Bu testi yeniden oluşturmak için:

Örnek
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# Profile SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# Profile YOLO models
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    model(ASSETS, nms=False)  # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11

Değerlendirme Metrikleri#

SAM 3, tanıdık F1 skoru, kesinlik ve duyarlılık ölçülerini tamamlayan, PCS görevi için tasarlanmış yeni metrikler sunar.

Sınıflandırma Geçişli F1 (CGF1)#

Konumlandırma ve sınıflandırmayı birleştiren birincil metrik:

CGF1 = 100 × pmF1 × IL_MCC

Burada:

  • pmF1 (Pozitif Makro F1): Pozitif örneklerdeki konumlandırma kalitesini ölçer
  • IL_MCC (Görüntü Düzeyi Matthews Korelasyon Katsayısı): İkili sınıflandırma doğruluğunu ölçer ("kavram mevcut mu?")

Bu Metrikler Neden Kullanılıyor?#

Geleneksel AP metrikleri kalibrasyonu hesaba katmaz ve bu durum modellerin pratikte kullanılmasını zorlaştırır. SAM 3'ün metrikleri yalnızca 0.5'in üzerindeki güven değerine sahip tahminleri değerlendirerek iyi kalibrasyonu zorunlu kılar ve etkileşimli predict ve track döngülerindeki gerçek dünya kullanım modellerini taklit eder.

Temel Ablasyonlar ve İçgörüler#

Varlık Başlığının Etkisi#

Varlık başlığı, tanımayı konumlandırmadan ayırarak önemli iyileştirmeler sağlar:

YapılandırmaCGF1IL_MCCpmF1
Varlık başlığı olmadan57.60.7774.7
Varlık başlığıyla63.30.8277.1

Varlık başlığı, temel olarak tanıma yeteneğini iyileştirerek +5.7 CGF1 artışı (+%9.9) sağlar (IL_MCC +%6.5).

Zor Negatiflerin Etkisi#

Zor Negatifler/GörüntüCGF1IL_MCCpmF1
031.80.4470.2
544.80.6271.9
3049.20.6872.3

Zor negatifler, açık kelime dağarcıklı tanıma için kritik öneme sahiptir ve IL_MCC'yi %54.5 oranında artırır (0.44 → 0.68).

Eğitim Verilerinin Ölçeklendirilmesi#

Veri KaynaklarıCGF1IL_MCCpmF1
Yalnızca harici30.90.4666.3
Harici + Sentetik39.70.5770.6
Harici + Yüksek kaliteli51.80.7173.2
Üçünün tamamı54.30.7473.5

Yüksek kaliteli insan açıklamaları, yalnızca sentetik veya harici verilere kıyasla büyük kazanımlar sağlar. Veri kalitesi uygulamaları hakkında arka plan bilgisi için veri toplama ve açıklama sayfasına bak.

Uygulamalar#

SAM 3'ün kavram segmentasyonu yeteneği yeni kullanım alanlarını mümkün kılar:

  • İçerik Moderasyonu: Medya kitaplıkları genelinde belirli içerik türlerinin tüm örneklerini bulma
  • E-ticaret: Katalog görüntülerindeki belirli bir türe ait tüm ürünleri segmentlere ayırma ve otomatik açıklamayı destekleme
  • Tıbbi Görüntüleme: Belirli doku türlerinin veya anormalliklerin tüm oluşumlarını belirleme
  • Otonom Sistemler: Trafik işaretlerinin, yayaların veya araçların tüm örneklerini kategoriye göre takip etme
  • Video Analitiği: Belirli kıyafetleri giyen veya belirli eylemleri gerçekleştiren tüm insanları sayma ve takip etme
  • Veri Kümesi Açıklama: Nadir nesne kategorilerinin tüm örneklerini hızla açıklama
  • Bilimsel Araştırma: Belirli ölçütleri karşılayan tüm örnekleri nicel olarak değerlendirme ve analiz etme

SAM 3 Agent: Genişletilmiş Dil Akıl Yürütme#

SAM 3, OWLv2 ve T-Rex gibi açık kelime dağarcıklı sistemlere benzer şekilde, akıl yürütme gerektiren karmaşık sorguları işlemek için Çok Modlu Büyük Dil Modelleri (MLLMs) ile birleştirilebilir.

Akıl Yürütme Görevlerindeki Performans#

KıyaslamaÖlçütSAM 3 Agent (Gemini 2.5 Pro)Önceki En İyi
ReasonSeg (doğrulama)gIoU76.065.0 (SoTA)
ReasonSeg (test)gIoU73.861.3 (SoTA)
OmniLabel (doğrulama)AP46.736.5 (REAL)
RefCOCO+Acc91.289.3 (LISA)

Karmaşık Sorgu Örnekleri#

SAM 3 Agent, akıl yürütme gerektiren sorguları işleyebilir:

  • "Oturmuş ancak ellerinde hediye kutusu tutmayan insanlar"
  • "Kameraya en yakın olan ve tasma takmayan köpek"
  • "Kişinin elinden daha büyük kırmızı nesneler"

MLLM, SAM 3'e basit isim öbeği sorguları önerir, döndürülen maskeleri analiz eder ve memnun kalana kadar yinelemeye devam eder.

Sınırlamalar#

SAM 3 önemli bir ilerlemeyi temsil etse de bazı sınırlamaları vardır:

  • İfade Karmaşıklığı: Basit isim öbekleri için en uygunudur; uzun gönderimsel ifadeler veya karmaşık akıl yürütme MLLM entegrasyonu gerektirebilir
  • Belirsizlik İşleme: Bazı kavramlar doğası gereği belirsiz kalır (ör. "küçük pencere", "kullanışlı oda")
  • Hesaplama Gereksinimleri: YOLO gibi özelleştirilmiş algılama modellerinden daha büyük ve daha yavaştır
  • Kelime Dağarcığı Kapsamı: Atomik görsel kavramlara odaklanır; MLLM desteği olmadan bileşimsel akıl yürütme sınırlıdır
  • Nadir Kavramlar: Eğitim verilerinde yeterince temsil edilmeyen son derece nadir veya ince ayrıntılı kavramlarda performans düşebilir

Atıf#

Alıntı
@misc{carion2025sam3,
  title         = {SAM 3: Segment Anything with Concepts},
  author        = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
  year          = {2025},
  eprint        = {2511.16719},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2511.16719}
}

SSS#

  • SAM 3, Meta tarafından 19 Kasım 2025 tarihinde yayınlanmış olup predict mode ve track mode desteğiyle ultralytics paketine tamamen entegre edilmiştir.

  • Evet! SAM 3, kavram segmentasyonu, SAM 2 tarzı görsel yönlendirmeler ve çoklu nesne video takibi dahil olmak üzere Ultralytics Python paketine tamamen entegre edilmiştir. SAM 3 ve SAM 3.1 ayrıca Ultralytics Platform üzerindeki akıllı etiketleme özelliğine de güç verir; burada SAM 3.1 varsayılan modeldir ve görselleri yalnızca birkaç tıklamayla etiketleyebilirsin.

  • Evet, görsel tahmini için. Bu sayfadaki görsel örneklerinin sam3.pt kullandığı her yerde sam3.1_multiplex.pt yükle; nokta ve kutu yönlendirmeleri için SAM("sam3.1_multiplex.pt"), metin ve örnek yönlendirmeleri için ise SAM3SemanticPredictor kullan. Nesne Çoğullama video takibi henüz desteklenmiyor, bu nedenle video tahmin edicileriyle sam3.pt kullanmaya devam et. Meta'nın kıyaslamaları için SAM 3.1 sayfasına göz at.

  • PCS, SAM 3'te tanıtılan ve bir görüntü veya videodaki görsel bir kavramın tüm örneklerini segmente eden yeni bir görevdir. Belirli bir nesne örneğini hedefleyen geleneksel segmentasyonun aksine PCS, bir kategorinin her oluşumunu bulur. Örneğin:

    • Metin istemi: "sarı okul otobüsü" → sahnedeki tüm sarı okul otobüslerini segmente eder
    • Görüntü örneği: Bir köpeğin çevresine çizilen kutu → görüntüdeki tüm köpekleri segmente eder
    • Birleşik: "çizgili kedi" + örnek kutusu → örnekle eşleşen tüm çizgili kedileri segmente eder

    Nesne algılama ve örnek segmentasyonu hakkında ilgili arka plan bilgilerine göz at.

  • ÖzellikSAM 2SAM 3
    Görevİstem başına tek nesneBir kavramın tüm örnekleri
    İstem TürleriNoktalar, kutular, maskeler+ Metin ifadeleri, görüntü örnekleri
    Algılama YeteneğiHarici algılayıcı gerektirirYerleşik açık kelime dağarcıklı algılayıcı
    TanımaYalnızca geometri tabanlıMetin ve görsel tanıma
    MimariYalnızca izleyiciVarlık başlığına sahip algılayıcı + izleyici
    Sıfır Örnekli PerformansUygulanamaz (görsel istemler gerektirir)LVIS'te 47.0 AP, SA-Co'da 2 kat daha iyi
    Etkileşimli İyileştirmeYalnızca tıklamalarTıklamalar + örnek genellemesi

    SAM 3, kavram tabanlı yetenekler eklerken SAM 2 görsel istemleriyle geriye dönük uyumluluğu korur.

  • SAM 3, Kavramlarla Her Şeyi Segment Et (SA-Co) veri kümesiyle eğitilir:

    Eğitim Verileri:

    • 5,2 milyon görüntü ve 4 milyon benzersiz isim öbeği (SA-Co/HQ) - yüksek kaliteli insan açıklamaları
    • 52,5 bin video ve 24,8 bin benzersiz isim öbeği (SA-Co/VIDEO)
    • 38 milyon isim öbeğinde toplam 1,4 milyar sentetik maske (SA-Co/SYN)
    • Zor negatiflerle zenginleştirilmiş 15 harici veri kümesi (SA-Co/EXT)

    Karşılaştırma Verileri:

    • 126 bin görüntü/video genelinde 214 bin benzersiz kavram
    • Mevcut karşılaştırma ölçütlerinden 50 kat daha fazla kavram (ör. LVIS'te ~4 bin kavram bulunur)
    • İnsan performansı sınırlarını ölçmek için SA-Co/Gold üzerinde üçlü açıklama

    Bu muazzam ölçek ve çeşitlilik, SAM 3'ün açık kelime dağarcığındaki kavramlar arasında üstün sıfır örnekli genelleme yapabilmesini sağlar.

  • SAM 3 ve YOLO26 farklı kullanım alanlarına hizmet eder:

    SAM 3'ün Avantajları:

    • Açık kelime dağarcığı: Eğitim gerektirmeden metin istemleri aracılığıyla herhangi bir kavramı segmente eder
    • Sıfır örnekli: Yeni kategoriler üzerinde hemen çalışır
    • Etkileşimli: Örnek tabanlı iyileştirme benzer nesnelere genellenir
    • Kavram tabanlı: Bir kategorinin tüm örneklerini otomatik olarak bulur
    • Doğruluk: LVIS sıfır örnekli örnek segmentasyonunda 47.0 AP

    YOLO26'nın Avantajları:

    • Hız: İsteğe bağlı NMS'siz uçtan uca başlık ile kat kat daha hızlı çıkarım
    • Verimlilik: 539 kat daha küçük modeller (6,4 MB ve 3,45 GB'ye kıyasla)
    • Kaynak dostu: Uç cihazlarda ve mobil cihazlarda çalışır
    • Gerçek zamanlı: Üretim dağıtımları için optimize edilmiştir

    Öneri:

    • Metin veya örneklerle açıklanan kavramların tüm örneklerini bulman gereken esnek, açık kelime dağarcıklı segmentasyon için SAM 3 kullan
    • Kategorilerin önceden bilindiği yüksek hızlı üretim dağıtımları için YOLO26 kullan
    • Geometrik istemlerle etkileşimli tek nesne segmentasyonu için SAM 2 kullan
  • SAM 3, basit isim öbekleri (ör. "kırmızı elma", "şapka takan kişi") için tasarlanmıştır. Akıl yürütme gerektiren karmaşık sorgular için SAM 3'ü SAM 3 Agent olarak bir MLLM ile birleştir:

    Basit sorgular (yerel SAM 3):

    • "sarı okul otobüsü"
    • "çizgili kedi"
    • "kırmızı şapka takan kişi"

    Karmaşık sorgular (MLLM içeren SAM 3 Agent):

    • "Oturup hediye kutusu tutmayan kişiler"
    • "Tasması olmayan ve kameraya en yakın köpek"
    • "Kişinin elinden daha büyük kırmızı nesneler"

    SAM 3 Agent, SAM 3'ün segmentasyonunu MLLM akıl yürütme yetenekleriyle birleştirerek ReasonSeg doğrulamasında 76.0 gIoU elde eder (önceki en iyi değer 65.0, iyileşme +%16,9).

  • Üçlü insan açıklamasına sahip SA-Co/Gold karşılaştırmasında:

    • İnsan alt sınırı: 74.2 CGF1 (en tutucu açıklayıcı)
    • SAM 3 performansı: 65.0 CGF1
    • Başarı: Tahmini insan alt sınırının %88'i
    • İnsan üst sınırı: 81.4 CGF1 (en hoşgörülü açıklayıcı)

    SAM 3, açık kelime dağarcıklı kavram segmentasyonunda insan düzeyindeki doğruluğa yaklaşan güçlü bir performans elde eder; aradaki fark temel olarak belirsiz veya öznel kavramlarda görülür (ör. "küçük pencere", "kullanışlı oda").

Yorumlar