Ultralytics YOLO27:
Get Started

SAM 3: Her Şeyi Kavramlarla Bölütle#

SAM 3 istemle yönlendirilebilir kavram bölütleme genel bakışı

SAM 3 (Her Şeyi Bölütleme Modeli 3), Meta tarafından yayımlanan, İstemle Yönlendirilebilir Kavram Bölütleme (PCS) için temel modeldir. SAM 2 üzerine inşa edilen SAM 3, temel bir yenilik sunar: metin istemleri, örnek görüntüler veya her ikisiyle belirtilen bir görsel kavramın tüm örneklerini algılama, bölütleme ve izleme. İstem başına tek bir nesneyi bölütleyen önceki SAM sürümlerinden farklı olarak SAM 3, modern örnek bölütleme yaklaşımlarının açık söz dağarcığı hedefleriyle uyumlu biçimde, görüntülerin veya videoların herhangi bir yerinde görünen bir kavramın her örneğini bulup bölütleyebilir.



İzle: Ultralytics ile Meta Segment Anything 3 Nasıl Kullanılır | Görüntü ve Videolarda Metin İstemli Segmentasyon

SAM 3, ultralytics paketine bütünüyle entegre edilmiştir ve metin istemleriyle, örnek görüntü istemleriyle kavram bölütleme ve video izleme için yerel destek sunar. Daha yeni SAM 3.1 kontrol noktası, görüntü tahmini için desteklenir.

Genel Bakış#

SAM 3, İstemle Yönlendirilebilir Kavram Bölütleme alanında mevcut sistemlere kıyasla 2× performans artışı sağlarken, etkileşimli görsel bölütleme için SAM 2'nin yeteneklerini korur ve geliştirir. Model, açık söz dağarcıklı bölütlemede öne çıkar; kullanıcıların basit isim öbekleri (ör. "yellow school bus", "striped cat") kullanarak kavram belirtmesine veya hedef nesnenin örnek görüntülerini sağlamasına olanak tanır. Bu yetenekler, kolaylaştırılmış tahmin ve izleme iş akışlarına dayanan üretime hazır işlem hatalarını tamamlar.

SAM 3 metin istemiyle bölütleme örnekleri

İstemle Yönlendirilebilir Kavram Bölütleme (PCS) nedir?#

PCS görevi, girdi olarak bir kavram istemi alır ve eşleşen tüm nesne örnekleri için benzersiz kimliklere sahip bölütleme maskeleri döndürür. Kavram istemleri şunlar olabilir:

  • Metin: Sıfır örnekli öğrenmeye benzer şekilde, "red apple" veya "person wearing a hat" gibi basit isim öbekleri
  • Örnek görüntüler: Hızlı genelleme için örnek nesnelerin çevresine çizilen sınırlayıcı kutular (olumlu veya olumsuz)
  • Birleşik: Hassas denetim için hem metin hem de örnek görüntüler

Bu yaklaşım, özgün SAM ailesinin yaygınlaştırdığı ve yalnızca tek bir belirli nesne örneğini bölütleyen geleneksel görsel istemlerden (noktalar, kutular, maskeler) farklıdır.

Temel Performans Ölçütleri#

ÖlçütSAM 3 Başarımı
LVIS Sıfır Örnekli Maske AP47.0 (önceki en iyi 38.5'e kıyasla, %22 iyileşme)
SA-Co KıyaslamasıMevcut sistemlerden 2× daha iyi
Çıkarım Hızı (H200 GPU)100'den fazla algılanan nesneyle görüntü başına 30 ms
Video Performansı~5 eşzamanlı nesne için gerçek zamana yakın
MOSEv2 VOS Kıyaslaması60.1 J&F (SAM 2.1'e kıyasla +%25.5, önceki SOTA'ya kıyasla +%17)
Etkileşimli İyileştirme3 örnek isteminden sonra +18.6 CGF1 iyileşme
İnsan Performans FarkıSA-Co/Gold için tahmin edilen alt sınırın %88'ine ulaşır

Üretimdeki model ölçütleri ve ödünleşimler hakkında bağlam için model değerlendirme içgörülerine ve YOLO performans ölçütlerine bak.

SAM 3.1#

Meta'nın 27 Mart 2026'da yayımladığı SAM 3.1, çok nesneli video izleme için paylaşımlı bellek yaklaşımı olan Object Multiplex özelliğini ekleyen yeni bir SAM 3 kontrol noktasıdır. İzlenen her nesneyi ayrı ayrı işlemek yerine SAM 3.1, nesneleri sabit kapasiteli gruplara ayırıp birlikte işler. Meta, tek bir H100 GPU'da 128 nesne için ~7× hızlanma sağlandığını bildiriyor. Görüntü algılayıcısı ve etkileşimli nokta istemi başlığı SAM 3 mimarisini korur.

KıyaslamaÖlçütSAM 3SAM 3.1
SA-Co/VEval SA-V (test)cgF130.330.5
SA-Co/VEval YT-Temporal-1B (test)cgF150.852.9
SA-Co/VEval SmartGlasses (test)cgF136.436.3
MOSEv1 (doğrulama)J&F78.479.6
DAVIS17 (doğrulama)J&F92.292.7
SA-V (test)J&F84.485.1
YTVOS19 (doğrulama)G89.789.3
MOSEv2 (doğrulama)J&Ḟ60.362.3

Ultralytics, SAM 3.1 kontrol noktasını (sam3.1_multiplex.pt) SAM 3 görüntü tahmincilerine yükler: nokta ve kutu istemleri için SAM("sam3.1_multiplex.pt"), metin ve örnek istemleri için SAM3SemanticPredictor. Object Multiplex video izleme henüz desteklenmediğinden sam3.pt ile SAM3VideoPredictor ve SAM3VideoSemanticPredictor kullanmaya devam et.

Mimari#

SAM 3, algılayıcı ve izleyici tarafından paylaşılan bir Perception Encoder (PE) görsel omurgasından oluşur. Bu ayrıştırılmış tasarım, görev çatışmalarını önlerken hem görüntü düzeyinde algılamaya hem de video düzeyinde izlemeye olanak tanır ve Ultralytics Python kullanımına ve CLI kullanımına uygun bir arayüz sunar.

Temel Bileşenler#

  • Algılayıcı: Görüntü düzeyinde kavram algılama için DETR tabanlı mimari

    • İsim öbeği istemleri için metin kodlayıcı
    • Görüntü tabanlı istemler için örnek kodlayıcı
    • Görüntü özelliklerini istemlere göre koşullandıran birleştirme kodlayıcısı
    • Tanımayı ("ne") konum belirlemeden ("nerede") ayıran yeni varlık başlığı
    • Örnek bölütleme maskeleri oluşturan maske başlığı
  • İzleyici: SAM 2'den devralınan bellek tabanlı video bölütleme

    • İstem kodlayıcı, maske çözücü, bellek kodlayıcı
    • Nesnelerin görünümünü kareler boyunca depolayan bellek bankası
    • Çok nesneli senaryolarda Kalman filtresi gibi tekniklerin yardımıyla zamansal belirsizlik giderme
  • Varlık Belirteci: Hedef kavramın görüntüde/karede bulunup bulunmadığını tahmin eden ve tanımayı konum belirlemeden ayırarak algılamayı iyileştiren, öğrenilmiş genel bir belirteç.

SAM 3 model mimarisi şeması

Temel Yenilikler#

  1. Ayrıştırılmış Tanıma ve Konum Belirleme: Varlık başlığı, kavramın varlığını genel düzeyde tahmin ederken öneri sorguları yalnızca konum belirlemeye odaklanır ve çelişen hedefleri önler.
  2. Birleşik Kavram ve Görsel İstemler: Tek bir modelde hem PCS'yi (kavram istemleri) hem de PVS'yi (SAM 2'nin tıklama ve kutu gibi görsel istemleri) destekler.
  3. Etkileşimli Örnek İyileştirme: Kullanıcılar sonuçları yinelemeli olarak iyileştirmek için pozitif veya negatif görüntü örnekleri ekleyebilir; model, yalnızca tek tek örnekleri düzeltmek yerine benzer nesnelere genelleme yapar.
  4. Zamansal Belirsizliği Giderme: Videodaki örtülmeleri, yoğun sahneleri ve izleme hatalarını ele almak için maskelet algılama puanlarından ve belirli aralıklarla istemleri yeniden vermekten yararlanır; örnek segmentasyonu ve izleme en iyi uygulamalarıyla uyumludur.

SA-Co Veri Kümesi#

SAM 3, bugüne kadarki en büyük ve en çeşitli segmentasyon veri kümesi olan Meta'nın Kavramlarla Her Şeyi Segmentle (SA-Co) veri kümesiyle eğitilmiştir; COCO ve LVIS gibi yaygın kıyaslama veri kümelerinin kapsamını genişletir.

Eğitim Verileri#

Veri Kümesi BileşeniAçıklamaÖlçek
SA-Co/HQ4 aşamalı veri motoruyla oluşturulmuş, insanlar tarafından yüksek kalitede etiketlenmiş görüntü verileri5,2 milyon görüntü, 4 milyon benzersiz isim öbeği
SA-Co/SYNİnsan müdahalesi olmadan yapay zekâ tarafından etiketlenmiş sentetik veri kümesi38 milyon isim öbeği, 1,4 milyar maske
SA-Co/EXTZor negatiflerle zenginleştirilmiş 15 harici veri kümesiKaynağa göre değişir
SA-Co/VIDEOZamansal izleme içeren video etiketleri52,5 bin video, 24,8 bin benzersiz isim öbeği

Kıyaslama Verileri#

SA-Co değerlendirme kıyaslama veri kümesi, 126 bin görüntü ve videoda yer alan 214 bin benzersiz öbek içerir ve mevcut kıyaslama veri kümelerinden 50 kattan fazla kavram sunar. Şunları içerir:

  • SA-Co/Gold: İnsan performansının sınırlarını ölçmek için üç kez etiketlenmiş 7 alan
  • SA-Co/Silver: İnsanlar tarafından bir kez etiketlenmiş 10 alan
  • SA-Co/Bronze ve SA-Co/Bio: Kavram segmentasyonuna uyarlanmış 9 mevcut veri kümesi
  • SA-Co/VEval: 3 alan içeren video kıyaslama veri kümesi (SA-V, YT-Temporal-1B, SmartGlasses)

Veri Motoru Yenilikleri#

SAM 3'ün ölçeklenebilir, insan ve model döngüde veri motoru şu yöntemlerle 2 kat daha yüksek etiketleme verimliliği sağlar:

  1. Yapay Zekâ Etiketleyicileri: Llama tabanlı modeller, zor negatifler de dahil olmak üzere çeşitli isim öbekleri önerir.
  2. Yapay Zekâ Doğrulayıcıları: İnce ayarlı çok modlu LLM'ler, maske kalitesini ve kapsamlılığını insan performansına yakın düzeyde doğrular.
  3. Aktif Madencilik: İnsan emeğini, yapay zekânın zorlandığı güç hata örneklerine yönlendirir.
  4. Ontoloji Odaklı: Kavram kapsamı için Wikidata temelli geniş bir ontolojiden yararlanır.

Kurulum#

ultralytics paketini yükle veya yükselt:

pip install -U ultralytics
SAM 3 Model Ağırlıkları Gerekli

Diğer Ultralytics modellerinin aksine SAM 3 ağırlıkları (sam3.pt) otomatik olarak indirilmez. Önce Hugging Face'teki SAM 3 model sayfasından model ağırlıklarına erişim isteğinde bulunmalı ve isteğin onaylandıktan sonra sam3.pt dosyasını bu sayfadan indirmelisin. İndirilen sam3.pt dosyasını çalışma dizinine yerleştir veya modeli yüklerken tam yolu belirt.

SAM 3.1 ağırlıklarına (sam3.1_multiplex.pt) SAM 3.1 model sayfasında aynı şekilde erişim kısıtlaması uygulanır. Aşağıdaki görüntü örneklerinde sam3.pt kullanılan her yerde sam3.1_multiplex.pt değerini kullan.

`TypeError: 'SimpleTokenizer' object is not callable`

Tahmin sırasında yukarıdaki hatayı alırsan yanlış clip paketinin yüklü olduğu anlamına gelir. Aşağıdaki komutu çalıştırarak doğru clip paketini yükle:

pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.git

SAM 3 Nasıl Kullanılır: Kavram Segmentasyonunda Çok Yönlülük#

SAM 3, farklı tahminci arayüzleriyle hem İstemlenebilir Kavram Segmentasyonu (PCS) hem de İstemlenebilir Görsel Segmentasyon (PVS) görevlerini destekler:

Desteklenen Görevler ve Modeller#

Görev Türüİstem TürleriÇıktı
Kavram Segmentasyonu (PCS)Metin (isim öbekleri), görüntü örnekleriKavramla eşleşen tüm örnekler
Görsel Segmentasyon (PVS)Noktalar, kutular, maskelerTek bir nesne örneği (SAM 2 tarzı)
Etkileşimli İyileştirmeÖrnekleri veya tıklamaları yinelemeli olarak ekle/kaldırDaha yüksek doğrulukla iyileştirilmiş segmentasyon

Kavram Segmentasyonu Örnekleri#

Metin İstemleriyle Segmentasyon#

Metin Tabanlı Kavram Segmentasyonu

Bir metin açıklaması kullanarak kavramın tüm örneklerini bul ve segmentlere ayır. Metin istemleri için SAM3SemanticPredictor arayüzü gerekir.

from ultralytics.models.sam import SAM3SemanticPredictor

# Yapılandırmayla tahminciyi başlat
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "model": "sam3.pt",
    "quantize": 16,  # Daha hızlı çıkarım için FP16 kullan
    "save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Birden fazla sorgu için görüntüyü bir kez ayarla
predictor.set_image("path/to/image.jpg")

# Birden fazla metin istemiyle sorgula
results = predictor(text=["person", "bus", "glasses"])

# Betimleyici öbeklerle çalışır
results = predictor(text=["person with red cloth", "person with blue cloth"])

# Tek bir kavramla sorgula
results = predictor(text=["a person"])

Görüntü Örnekleriyle Segmentasyon#

Görüntü Örneği Tabanlı Segmentasyon

Benzer tüm örnekleri bulmak için görsel istem olarak sınırlayıcı kutuları kullan. Kavram tabanlı eşleştirme için de SAM3SemanticPredictor gerekir.

from ultralytics.models.sam import SAM3SemanticPredictor

# Tahminciyi başlat
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Görüntüyü ayarla
predictor.set_image("path/to/image.jpg")

# Benzer nesneleri segmentlere ayırmak için sınırlayıcı kutu örnekleri ver
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])

# Aynı görsel kavramın örnekleri olarak birden fazla sınırlayıcı kutu kullan
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])

Verimlilik için Özellik Tabanlı Çıkarım#

Birden Fazla Sorguda Görüntü Özelliklerini Yeniden Kullanma

Verimliliği artırmak için görüntü özelliklerini bir kez çıkar ve birden fazla segmentasyon sorgusunda yeniden kullan.

import cv2

from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors

# Tahmincileri başlat
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)

# İlk tahminciden özellikleri çıkar
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]

# İkinci tahminciyi ayarla ve özellikleri yeniden kullan
predictor2.setup_model()

# Metin istemiyle paylaşılan özellikleri kullanarak çıkarım yap
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])

# Sınırlayıcı kutu istemiyle paylaşılan özellikleri kullanarak çıkarım yap
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])

# Sonuçları görselleştir
if masks is not None:
    masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
    im = cv2.imread(source)
    annotator = Annotator(im, pil=False)
    annotator.masks(masks, [colors(x, True) for x in range(len(masks))])

    cv2.imshow("result", annotator.result())
    cv2.waitKey(0)

Video Kavram Segmentasyonu#

Sınırlayıcı Kutularla Video Boyunca Kavramları İzleme#

Görsel İstemlerle Video İzleme

Sınırlayıcı kutu istemleriyle nesne örneklerini video kareleri boyunca algıla ve izle.

from ultralytics.models.sam import SAM3VideoPredictor

# Video tahmincisini oluştur
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)

# Nesneleri sınırlayıcı kutu istemleriyle izle
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)

# Sonuçları işle ve görüntüle
for r in results:
    r.show()  # Segmentasyon maskesiyle kareyi görüntüle

Metin İstemleriyle Kavramları İzleme#

Anlamsal Sorgularla Video İzleme

Metinde belirtilen kavramların tüm örneklerini video kareleri boyunca izle.

from ultralytics.models.sam import SAM3VideoSemanticPredictor

# Anlamsal video tahmincisini başlat
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "imgsz": 640,
    "model": "sam3.pt",
    "quantize": 16,
    "save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)

# Kavramları metin istemleriyle izle
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)

# Sonuçları işle
for r in results:
    r.show()  # İzlenen nesnelerle kareyi görüntüle

# Alternatif: Sınırlayıcı kutu istemleriyle izle
results = predictor(
    source="path/to/video.mp4",
    bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
    labels=[1, 1],  # Pozitif etiketler
    stream=True,
)

Görsel İstemler (SAM 2 Uyumluluğu)#

SAM 3, tek nesne segmentasyonu için SAM 2'nin görsel istem özellikleriyle tam geriye dönük uyumluluğu korur:

SAM 2 Tarzı Görsel İstemler

Temel SAM arayüzü, SAM 2 ile tam olarak aynı şekilde çalışır ve yalnızca görsel istemlerle (noktalar, kutular veya maskeler) belirtilen belirli alanı segmente ayırır.

from ultralytics import SAM

model = SAM("sam3.pt")

# Tek nokta istemi - nesneyi belirli bir konumda segmentlere ayırır
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()

# Birden çok nokta - tek bir nesneyi birden çok nokta ipucuyla segmentlere ayırır
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])

# Kutu istemi - sınırlayıcı kutunun içindeki nesneyi segmentlere ayırır
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()
Görsel İstemler ve Kavram Segmentasyonu

Görsel istemlerle (noktalar/kutular/maskeler) SAM("sam3.pt") kullanıldığında, tıpkı SAM 2'de olduğu gibi yalnızca o konumdaki belirli nesne segmentlere ayrılır. Bir kavramın tüm örneklerini segmentlere ayırmak için yukarıda gösterildiği gibi metin veya örnek istemleriyle SAM3SemanticPredictor kullan.

Performans Karşılaştırmaları#

Görüntü Segmentasyonu#

SAM 3, LVIS ve segmentasyon için COCO gibi gerçek dünya veri kümeleri de dahil olmak üzere birçok kıyaslamada son teknoloji sonuçlar elde ediyor:

KıyaslamaÖlçütSAM 3Önceki En İyiİyileşme
LVIS (sıfır atışlı)Maske AP47.038.5+22.1%
SA-Co/GoldCGF165.034.3 (OWLv2)+89.5%
COCO (sıfır atışlı)Kutu AP53.552.2 (T-Rex2)+2.5%
ADE-847 (semantik segmentasyon)mIoU14.79.2 (APE-D)+59.8%
PascalConcept-59mIoU59.458.5 (APE-D)+1.5%
Cityscapes (semantik segmentasyon)mIoU65.144.2 (APE-D)+47.3%

Hızlı denemeler için veri kümesi seçeneklerini Ultralytics veri kümelerinde keşfet.

Video Segmentasyonu Performansı#

SAM 3, DAVIS 2017 ve YouTube-VOS gibi video kıyaslamalarında SAM 2'ye ve önceki son teknoloji modellere kıyasla önemli iyileşmeler gösteriyor:

KıyaslamaÖlçütSAM 3SAM 2.1 Lİyileşme
MOSEv2J&F60.147.9+25.5%
DAVIS 2017J&F92.090.7+1.4%
LVOSv2J&F88.279.6+10.8%
SA-VJ&F84.678.4+7.9%
YTVOS19J&F89.689.3+0.3%

Az Örnekli Uyarlama#

SAM 3, veri odaklı yapay zekâ iş akışları açısından önemli olan yeni alanlara az sayıda örnekle uyum sağlama konusunda başarılıdır:

Kıyaslama0 atışlı AP10 atışlı APÖnceki En İyi (10 atışlı)
ODinW1359.971.667.9 (gDino1.5-Pro)
RF100-VL14.335.733.7 (gDino-T)

Etkileşimli İyileştirmenin Etkinliği#

SAM 3'ün örneklerle kavram tabanlı istemleri, görsel istemlerden çok daha hızlı yakınsar:

Eklenen İstemlerCGF1 PuanıYalnızca Metne Göre KazançPVS Temel Değerine Göre Kazanç
Yalnızca metin46.4temel değertemel değer
+1 örnek57.6+11.2+6.7
+2 örnek62.2+15.8+9.7
+3 örnek65.0+18.6+11.2
+4 örnek65.7+19.3+11.5 (doygunluk)

Nesne Sayma Doğruluğu#

SAM 3, nesne sayma iş akışlarında sıkça gerektiği gibi tüm örnekleri segmentlere ayırarak doğru sayım sağlar:

KıyaslamaDoğrulukMAEEn İyi MLLM'ye Göre
CountBench95.6%0.1192.4% (Gemini 2.5)
PixMo-Count87.3%0.2288.8% (Molmo-72B)

SAM 3 ve SAM 2 ile YOLO Karşılaştırması#

Burada SAM 3'ün yeteneklerini SAM 2 ve YOLO26 modelleriyle karşılaştırıyoruz. Aynı tür istemlerle gerçek zamanlı, açık kelime dağarcıklı tespit ve segmentasyon için YOLOE sayfasına göz at:

YetenekSAM 3SAM 2YOLO26n-seg
Kavram Segmentasyonu✅ Metin/örneklerden tüm örnekler❌ Desteklenmiyor❌ Desteklenmiyor
Görsel Segmentasyon✅ Tek örnek (SAM 2 ile uyumlu)✅ Tek örnek✅ Tüm örnekler
Sıfır Atış Yeteneği✅ Açık kelime dağarcığı✅ Geometrik istemler❌ Kapalı küme
Etkileşimli İyileştirme✅ Örnekler + tıklamalar✅ Yalnızca tıklamalar❌ Desteklenmiyor
Video Takibi✅ Kimliklerle çoklu nesne✅ Çoklu nesne✅ Çoklu nesne
LVIS Maske AP (sıfır atışlı)47.0UygulanamazUygulanamaz
MOSEv2 J&F60.147.9Uygulanamaz
Hız (GPU, ms/görüntü)29218578.4
Model Boyutu3.45 GB162 MB (temel)6.4 MB

Hız kıyaslaması NVIDIA RTX PRO 6000 üzerinde torch==2.9.1 ve ultralytics==8.4.19 ile yapıldı.

Önemli Çıkarımlar:

  • SAM 3: Metin veya örnek istemleriyle bir kavramın tüm örneklerini bulmaya yönelik açık kelime dağarcıklı kavram segmentasyonu için en iyisi
  • SAM 2: Geometrik istemlerle görüntü ve videolarda tek nesnenin etkileşimli segmentasyonu için en iyisi
  • YOLO26: İsteğe bağlı NMS içermeyen uçtan uca çıkarımla gerçek zamanlı, yüksek hızlı segmentasyon için en iyisi; GPU'lara, CPU'lara ve uç cihazlara dağıtım için birçok biçime aktarılabilir

SAM ve YOLO Karşılaştırması#

Boyut, parametre sayısı ve GPU çıkarım hızı açısından SAM 3, SAM 2, SAM, MobileSAM ve FastSAM modellerini Ultralytics YOLO segmentasyon modelleriyle (YOLOv8, YOLO11, YOLO26) karşılaştırma:

ModelBoyut
(MB)
Parametreler
(M)
Hız (GPU)
(ms/im)
Meta SAM-b37593.71306
Meta SAM2-b16280.8857
Meta SAM2-t78.138.9668
Meta SAM33450473.62921
MobileSAM40.710.1605
FastSAM-s ve YOLOv8 omurgası23.711.855.9
Ultralytics YOLOv8n-seg6.7 (515 kat daha küçük)3.4 (139.1 kat daha az)17.4 (167 kat daha hızlı)
Ultralytics YOLO11n-seg5.9 (585 kat daha küçük)2.9 (163.1 kat daha az)12.6 (231 kat daha hızlı)
Ultralytics YOLO26n-seg6.4 (539 kat daha küçük)2.7 (175.2 kat daha az)8.4 (347 kat daha hızlı)

Bu karşılaştırma, SAM varyantları ile YOLO segmentasyon modelleri arasındaki model boyutu ve hız farklarının ne kadar büyük olduğunu gösteriyor. SAM, kendine özgü otomatik segmentasyon yetenekleri sunarken YOLO modelleri, özellikle YOLOv8n-seg, YOLO11n-seg ve YOLO26n-seg, önemli ölçüde daha küçük, daha hızlı ve hesaplama açısından daha verimlidir.

Testler, torch==2.9.1 ve ultralytics==8.4.19 kullanılarak 96 GB VRAM'e sahip NVIDIA RTX PRO 6000 üzerinde çalıştırıldı. Bu testi yeniden oluşturmak için:

Örnek
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM profili oluştur
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# FastSAM-s profili oluştur
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# YOLO modellerinin profilini oluştur
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    model(ASSETS, nms=False)  # YOLO26 NMS içermeyen başlık; YOLOv8/YOLO11 için işlem yapmaz

Değerlendirme Metrikleri#

SAM 3, PCS görevi için tasarlanmış yeni metrikler sunarak F1 puanı, kesinlik ve duyarlılık gibi bilinen ölçütleri tamamlıyor.

Sınıflandırma Kontrollü F1 (CGF1)#

Yerelleştirme ile sınıflandırmayı birleştiren temel metrik:

CGF1 = 100 × pmF1 × IL_MCC

Burada:

  • pmF1 (Pozitif Makro F1): Pozitif örneklerdeki yerelleştirme kalitesini ölçer
  • IL_MCC (Görüntü Düzeyinde Matthews Korelasyon Katsayısı): İkili sınıflandırma doğruluğunu ("kavram mevcut mu?") ölçer

Bu Metrikler Neden Kullanılıyor?#

Geleneksel AP metrikleri kalibrasyonu hesaba katmadığından modellerin pratikte kullanımı zorlaşır. SAM 3'ün metrikleri, yalnızca güven puanı 0.5'in üzerinde olan tahminleri değerlendirerek iyi kalibrasyonu zorunlu kılar ve etkileşimli tahmin ve izleme döngülerindeki gerçek dünya kullanım örüntülerini taklit eder.

Temel Ablasyonlar ve İçgörüler#

Varlık Başlığının Etkisi#

Varlık başlığı, tanımayı yerelleştirmeden ayırarak önemli iyileştirmeler sağlar:

YapılandırmaCGF1IL_MCCpmF1
Varlık başlığı olmadan57.60.7774.7
Varlık başlığıyla63.30.8277.1

Varlık başlığı, başlıca tanıma becerisini iyileştirerek +5.7 CGF1 artışı (+%9.9) sağlar (IL_MCC +%6.5).

Zor Negatiflerin Etkisi#

Görüntü Başına Zor Negatif SayısıCGF1IL_MCCpmF1
031.80.4470.2
544.80.6271.9
3049.20.6872.3

Zor negatifler açık kelime dağarcıklı tanıma için kritik önem taşır ve IL_MCC'yi %54.5 (0.44 → 0.68) artırır.

Eğitim Verisinin Ölçeklendirilmesi#

Veri KaynaklarıCGF1IL_MCCpmF1
Yalnızca harici30.90.4666.3
Harici + Sentetik39.70.5770.6
Harici + Yüksek Kaliteli51.80.7173.2
Üçü Birden54.30.7473.5

Yüksek kaliteli insan açıklamaları, yalnızca sentetik veya harici veriye kıyasla büyük kazanımlar sağlar. Veri kalitesi uygulamalarının arka planı için veri toplama ve açıklama ekleme sayfasına bak.

Uygulamalar#

SAM 3'ün kavram segmentasyonu yeteneği yeni kullanım alanları sağlar:

  • İçerik Moderasyonu: Medya arşivlerindeki belirli içerik türlerinin tüm örneklerini bul
  • E-ticaret: Katalog görüntülerindeki belirli türdeki tüm ürünleri segmentlere ayırarak otomatik açıklama eklemeyi destekle
  • Tıbbi Görüntüleme: Belirli doku türlerinin veya anormalliklerin tüm örneklerini belirle
  • Otonom Sistemler: Trafik işaretleri, yayalar veya araçların tüm örneklerini kategorilerine göre izle
  • Video Analitiği: Belirli kıyafetleri giyen veya belirli eylemleri gerçekleştiren tüm kişileri say ve izle
  • Veri Kümesi Açıklaması: Nadir nesne kategorilerinin tüm örneklerine hızla açıklama ekle
  • Bilimsel Araştırma: Belirli ölçütlere uyan tüm örnekleri ölç ve analiz et

SAM 3 Agent: Genişletilmiş Dilsel Akıl Yürütme#

SAM 3, akıl yürütme gerektiren karmaşık sorguları işlemek için, OWLv2 ve T-Rex gibi açık kelime dağarcıklı sistemlere benzer şekilde Çok Modlu Büyük Dil Modelleri (MLLMs) ile birleştirilebilir.

Akıl Yürütme Görevlerindeki Performans#

KıyaslamaÖlçütSAM 3 Agent (Gemini 2.5 Pro)Önceki En İyi
ReasonSeg (doğrulama)gIoU76.065.0 (son teknoloji)
ReasonSeg (test)gIoU73.861.3 (son teknoloji)
OmniLabel (doğrulama)AP46.736.5 (REAL)
RefCOCO+Doğruluk91.289.3 (LISA)

Karmaşık Sorgu Örnekleri#

SAM 3 Agent, akıl yürütme gerektiren sorguları işleyebilir:

  • "Oturmuş ancak ellerinde hediye kutusu tutmayan kişiler"
  • "Kameraya en yakın, tasma takmayan köpek"
  • "Kişinin elinden daha büyük kırmızı nesneler"

MLLM, SAM 3'e basit isim tamlaması sorguları önerir, döndürülen maskeleri analiz eder ve sonuçtan memnun kalana kadar yineler.

Sınırlamalar#

SAM 3 büyük bir ilerlemeyi temsil etse de bazı sınırlamaları vardır:

  • İfade Karmaşıklığı: Basit isim tamlamaları için en uygunudur; uzun gönderim ifadeleri veya karmaşık akıl yürütme MLLM entegrasyonu gerektirebilir
  • Belirsizlikleri Ele Alma: Bazı kavramlar doğası gereği belirsiz kalır (ör. "küçük pencere", "rahat oda")
  • Hesaplama Gereksinimleri: YOLO gibi özel algılama modellerinden daha büyük ve daha yavaştır
  • Kelime Dağarcığı Kapsamı: Atomik görsel kavramlara odaklanır; MLLM desteği olmadan bileşimsel akıl yürütme sınırlıdır
  • Nadir Kavramlar: Eğitim verisinde iyi temsil edilmeyen son derece nadir veya ince ayrıntılı kavramlarda performans düşebilir

Atıf#

Alıntı
@misc{carion2025sam3,
  title         = {SAM 3: Segment Anything with Concepts},
  author        = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
  year          = {2025},
  eprint        = {2511.16719},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2511.16719}
}

Sık Sorulan Sorular#

  • SAM 3, Meta tarafından 19 Kasım 2025 tarihinde yayımlandı ve ultralytics paketine tamamen entegre edildi; tahmin modu ve izleme modu desteği de sunuyor.

  • Evet! SAM 3; kavram segmentasyonu, SAM 2 tarzı görsel istemler ve çok nesneli video izleme özellikleriyle Ultralytics Python paketine tamamen entegre edildi. SAM 3 ve SAM 3.1, Ultralytics Platform üzerindeki akıllı açıklama ekleme özelliğine de güç veriyor; burada varsayılan model SAM 3.1 ve görüntülere yalnızca birkaç tıklamayla açıklama ekleyebilirsin.

  • Evet, görüntü tahmini için destekliyor. Bu sayfadaki görüntü örneklerinde sam3.pt kullanılan her yerde sam3.1_multiplex.pt yükle: nokta ve kutu istemleri için SAM("sam3.1_multiplex.pt"), metin ve örnek istemleri için SAM3SemanticPredictor. Nesne Çoklama video izleme henüz desteklenmiyor; bu nedenle video tahmincileriyle sam3.pt kullanmaya devam et. Meta'nın kıyaslamaları için SAM 3.1 sayfasına bak.

  • PCS, SAM 3'te sunulan ve bir görüntü veya videodaki görsel bir kavramın tüm örneklerini segmentlere ayıran yeni bir görevdir. Belirli bir nesne örneğini hedefleyen geleneksel segmentasyonun aksine PCS, bir kategorinin her örneğini bulur. Örneğin:

    • Metin istemi: "sarı okul otobüsü" → sahnedeki tüm sarı okul otobüslerini segmentlere ayırır
    • Görsel örneği: Bir köpeğin etrafına kutu çiz → görseldeki tüm köpekleri segmentlere ayırır
    • Birleşik: "çizgili kedi" + örnek kutusu → örneğe uyan tüm çizgili kedileri segmentlere ayırır

    İlgili arka plan bilgileri için nesne algılama ve örnek segmentasyonu konularına bak.

  • ÖzellikSAM 2SAM 3
    Görevİstem başına tek nesneBir kavramın tüm örnekleri
    İstem TürleriNoktalar, kutular, maskeler+ Metin ifadeleri, görsel örnekleri
    Algılama YeteneğiHarici algılayıcı gerektirirYerleşik açık kelime dağarcıklı algılayıcı
    TanımaYalnızca geometriye dayalıMetin ve görsel tanıma
    MimariYalnızca izleyiciVarlık başlığına sahip algılayıcı + izleyici
    Sıfır Örnekli PerformansUygulanamaz (görsel istemler gerektirir)LVIS'te 47.0 AP, SA-Co'da 2× daha iyi
    Etkileşimli İyileştirmeYalnızca tıklamalarTıklamalar + örnek genellemesi

    SAM 3, kavram tabanlı yetenekler eklerken SAM 2 görsel istemleriyle geriye dönük uyumluluğu korur.

  • SAM 3, Segment Anything with Concepts (SA-Co) veri kümesiyle eğitilir:

    Eğitim Verileri:

    • 5.2M görsel ve 4M benzersiz isim öbeği (SA-Co/HQ) - yüksek kaliteli insan anotasyonları
    • 52.5K video ve 24.8K benzersiz isim öbeği (SA-Co/VIDEO)
    • 38M isim öbeği genelinde 1.4B sentetik maske (SA-Co/SYN)
    • Zor negatif örneklerle zenginleştirilmiş 15 harici veri kümesi (SA-Co/EXT)

    Kıyaslama Verileri:

    • 126K görsel/video genelinde 214K benzersiz kavram
    • Mevcut kıyaslamalardan 50× daha fazla kavram (ör. LVIS'te ~4K kavram var)
    • İnsan performansının sınırlarını ölçmek için SA-Co/Gold üzerinde üçlü anotasyon

    Bu muazzam ölçek ve çeşitlilik, SAM 3'ün açık kelime dağarcıklı kavramlarda üstün sıfır örnekli genelleme yapmasını sağlar.

  • SAM 3 ve YOLO26 farklı kullanım alanlarına hitap eder:

    SAM 3'ün Avantajları:

    • Açık kelime dağarcıklı: Eğitim gerektirmeden metin istemleriyle her kavramı segmentlere ayırır
    • Sıfır örnekli: Yeni kategorilerde hemen çalışır
    • Etkileşimli: Örnek tabanlı iyileştirme, benzer nesnelere genellenir
    • Kavram tabanlı: Bir kategorinin tüm örneklerini otomatik olarak bulur
    • Doğruluk: LVIS sıfır örnekli örnek segmentasyonunda 47.0 AP

    YOLO26'nın Avantajları:

    • Hız: İsteğe bağlı, NMS gerektirmeyen uçtan uca bir başlıkla çıkarım çok daha hızlıdır
    • Verimlilik: 539× daha küçük modeller (6.4MB'ye karşı 3.45GB)
    • Kaynak dostu: Uç cihazlarda ve mobil cihazlarda çalışır
    • Gerçek zamanlı: Üretim ortamlarında kullanıma göre optimize edilmiştir

    Öneri:

    • Metinle veya örneklerle tanımlanan kavramların tüm örneklerini bulman gereken esnek, açık kelime dağarcıklı segmentasyon için SAM 3'ü kullan
    • Kategorilerin önceden bilindiği yüksek hızlı üretim ortamları için YOLO26'yı kullan
    • Geometrik istemlerle etkileşimli, tek nesne segmentasyonu için SAM 2'yi kullan
  • SAM 3, basit isim öbekleri için tasarlanmıştır (ör. "kırmızı elma", "şapka takan kişi"). Akıl yürütme gerektiren karmaşık sorgular için SAM 3'ü bir MLLM ile SAM 3 Agent olarak birlikte kullan:

    Basit sorgular (yerel SAM 3):

    • "sarı okul otobüsü"
    • "çizgili kedi"
    • "kırmızı şapka takan kişi"

    Karmaşık sorgular (MLLM ile SAM 3 Agent):

    • "Hediye kutusu tutmayan, oturmuş kişiler"
    • "Tasması olmayan, kameraya en yakın köpek"
    • "Kişinin elinden daha büyük kırmızı nesneler"

    SAM 3 Agent, SAM 3'ün segmentasyonunu MLLM akıl yürütme yetenekleriyle birleştirerek ReasonSeg doğrulama kümesinde 76.0 gIoU elde eder (önceki en iyi 65.0 değerine kıyasla %16.9 iyileşme).

  • Üçlü insan anotasyonuna sahip SA-Co/Gold kıyaslamasında:

    • İnsan performansının alt sınırı: 74.2 CGF1 (en ihtiyatlı anotatör)
    • SAM 3 performansı: 65.0 CGF1
    • Başarı: Tahmini insan performansı alt sınırının %88'i
    • İnsan performansının üst sınırı: 81.4 CGF1 (en hoşgörülü anotatör)

    SAM 3, açık kelime dağarcıklı kavram segmentasyonunda insan düzeyindeki doğruluğa yaklaşan güçlü bir performans sergiler; aradaki fark esas olarak belirsiz veya öznel kavramlarda (ör. "küçük pencere", "rahat oda") görülür.

Yorumlar