SAM 3: Her Şeyi Kavramlarla Bölütle#

SAM 3 (Her Şeyi Bölütleme Modeli 3), Meta tarafından yayımlanan, İstemle Yönlendirilebilir Kavram Bölütleme (PCS) için temel modeldir. SAM 2 üzerine inşa edilen SAM 3, temel bir yenilik sunar: metin istemleri, örnek görüntüler veya her ikisiyle belirtilen bir görsel kavramın tüm örneklerini algılama, bölütleme ve izleme. İstem başına tek bir nesneyi bölütleyen önceki SAM sürümlerinden farklı olarak SAM 3, modern örnek bölütleme yaklaşımlarının açık söz dağarcığı hedefleriyle uyumlu biçimde, görüntülerin veya videoların herhangi bir yerinde görünen bir kavramın her örneğini bulup bölütleyebilir.
İzle: Ultralytics ile Meta Segment Anything 3 Nasıl Kullanılır | Görüntü ve Videolarda Metin İstemli Segmentasyon
SAM 3, ultralytics paketine bütünüyle entegre edilmiştir ve metin istemleriyle, örnek görüntü istemleriyle kavram bölütleme ve video izleme için yerel destek sunar. Daha yeni SAM 3.1 kontrol noktası, görüntü tahmini için desteklenir.
Genel Bakış#
SAM 3, İstemle Yönlendirilebilir Kavram Bölütleme alanında mevcut sistemlere kıyasla 2× performans artışı sağlarken, etkileşimli görsel bölütleme için SAM 2'nin yeteneklerini korur ve geliştirir. Model, açık söz dağarcıklı bölütlemede öne çıkar; kullanıcıların basit isim öbekleri (ör. "yellow school bus", "striped cat") kullanarak kavram belirtmesine veya hedef nesnenin örnek görüntülerini sağlamasına olanak tanır. Bu yetenekler, kolaylaştırılmış tahmin ve izleme iş akışlarına dayanan üretime hazır işlem hatalarını tamamlar.

İstemle Yönlendirilebilir Kavram Bölütleme (PCS) nedir?#
PCS görevi, girdi olarak bir kavram istemi alır ve eşleşen tüm nesne örnekleri için benzersiz kimliklere sahip bölütleme maskeleri döndürür. Kavram istemleri şunlar olabilir:
- Metin: Sıfır örnekli öğrenmeye benzer şekilde, "red apple" veya "person wearing a hat" gibi basit isim öbekleri
- Örnek görüntüler: Hızlı genelleme için örnek nesnelerin çevresine çizilen sınırlayıcı kutular (olumlu veya olumsuz)
- Birleşik: Hassas denetim için hem metin hem de örnek görüntüler
Bu yaklaşım, özgün SAM ailesinin yaygınlaştırdığı ve yalnızca tek bir belirli nesne örneğini bölütleyen geleneksel görsel istemlerden (noktalar, kutular, maskeler) farklıdır.
Temel Performans Ölçütleri#
| Ölçüt | SAM 3 Başarımı |
|---|---|
| LVIS Sıfır Örnekli Maske AP | 47.0 (önceki en iyi 38.5'e kıyasla, %22 iyileşme) |
| SA-Co Kıyaslaması | Mevcut sistemlerden 2× daha iyi |
| Çıkarım Hızı (H200 GPU) | 100'den fazla algılanan nesneyle görüntü başına 30 ms |
| Video Performansı | ~5 eşzamanlı nesne için gerçek zamana yakın |
| MOSEv2 VOS Kıyaslaması | 60.1 J&F (SAM 2.1'e kıyasla +%25.5, önceki SOTA'ya kıyasla +%17) |
| Etkileşimli İyileştirme | 3 örnek isteminden sonra +18.6 CGF1 iyileşme |
| İnsan Performans Farkı | SA-Co/Gold için tahmin edilen alt sınırın %88'ine ulaşır |
Üretimdeki model ölçütleri ve ödünleşimler hakkında bağlam için model değerlendirme içgörülerine ve YOLO performans ölçütlerine bak.
SAM 3.1#
Meta'nın 27 Mart 2026'da yayımladığı SAM 3.1, çok nesneli video izleme için paylaşımlı bellek yaklaşımı olan Object Multiplex özelliğini ekleyen yeni bir SAM 3 kontrol noktasıdır. İzlenen her nesneyi ayrı ayrı işlemek yerine SAM 3.1, nesneleri sabit kapasiteli gruplara ayırıp birlikte işler. Meta, tek bir H100 GPU'da 128 nesne için ~7× hızlanma sağlandığını bildiriyor. Görüntü algılayıcısı ve etkileşimli nokta istemi başlığı SAM 3 mimarisini korur.
| Kıyaslama | Ölçüt | SAM 3 | SAM 3.1 |
|---|---|---|---|
| SA-Co/VEval SA-V (test) | cgF1 | 30.3 | 30.5 |
| SA-Co/VEval YT-Temporal-1B (test) | cgF1 | 50.8 | 52.9 |
| SA-Co/VEval SmartGlasses (test) | cgF1 | 36.4 | 36.3 |
| MOSEv1 (doğrulama) | J&F | 78.4 | 79.6 |
| DAVIS17 (doğrulama) | J&F | 92.2 | 92.7 |
| SA-V (test) | J&F | 84.4 | 85.1 |
| YTVOS19 (doğrulama) | G | 89.7 | 89.3 |
| MOSEv2 (doğrulama) | J&Ḟ | 60.3 | 62.3 |
Ultralytics, SAM 3.1 kontrol noktasını (sam3.1_multiplex.pt) SAM 3 görüntü tahmincilerine yükler: nokta ve kutu istemleri için SAM("sam3.1_multiplex.pt"), metin ve örnek istemleri için SAM3SemanticPredictor. Object Multiplex video izleme henüz desteklenmediğinden sam3.pt ile SAM3VideoPredictor ve SAM3VideoSemanticPredictor kullanmaya devam et.
Mimari#
SAM 3, algılayıcı ve izleyici tarafından paylaşılan bir Perception Encoder (PE) görsel omurgasından oluşur. Bu ayrıştırılmış tasarım, görev çatışmalarını önlerken hem görüntü düzeyinde algılamaya hem de video düzeyinde izlemeye olanak tanır ve Ultralytics Python kullanımına ve CLI kullanımına uygun bir arayüz sunar.
Temel Bileşenler#
-
Algılayıcı: Görüntü düzeyinde kavram algılama için DETR tabanlı mimari
- İsim öbeği istemleri için metin kodlayıcı
- Görüntü tabanlı istemler için örnek kodlayıcı
- Görüntü özelliklerini istemlere göre koşullandıran birleştirme kodlayıcısı
- Tanımayı ("ne") konum belirlemeden ("nerede") ayıran yeni varlık başlığı
- Örnek bölütleme maskeleri oluşturan maske başlığı
-
İzleyici: SAM 2'den devralınan bellek tabanlı video bölütleme
- İstem kodlayıcı, maske çözücü, bellek kodlayıcı
- Nesnelerin görünümünü kareler boyunca depolayan bellek bankası
- Çok nesneli senaryolarda Kalman filtresi gibi tekniklerin yardımıyla zamansal belirsizlik giderme
-
Varlık Belirteci: Hedef kavramın görüntüde/karede bulunup bulunmadığını tahmin eden ve tanımayı konum belirlemeden ayırarak algılamayı iyileştiren, öğrenilmiş genel bir belirteç.

Temel Yenilikler#
- Ayrıştırılmış Tanıma ve Konum Belirleme: Varlık başlığı, kavramın varlığını genel düzeyde tahmin ederken öneri sorguları yalnızca konum belirlemeye odaklanır ve çelişen hedefleri önler.
- Birleşik Kavram ve Görsel İstemler: Tek bir modelde hem PCS'yi (kavram istemleri) hem de PVS'yi (SAM 2'nin tıklama ve kutu gibi görsel istemleri) destekler.
- Etkileşimli Örnek İyileştirme: Kullanıcılar sonuçları yinelemeli olarak iyileştirmek için pozitif veya negatif görüntü örnekleri ekleyebilir; model, yalnızca tek tek örnekleri düzeltmek yerine benzer nesnelere genelleme yapar.
- Zamansal Belirsizliği Giderme: Videodaki örtülmeleri, yoğun sahneleri ve izleme hatalarını ele almak için maskelet algılama puanlarından ve belirli aralıklarla istemleri yeniden vermekten yararlanır; örnek segmentasyonu ve izleme en iyi uygulamalarıyla uyumludur.
SA-Co Veri Kümesi#
SAM 3, bugüne kadarki en büyük ve en çeşitli segmentasyon veri kümesi olan Meta'nın Kavramlarla Her Şeyi Segmentle (SA-Co) veri kümesiyle eğitilmiştir; COCO ve LVIS gibi yaygın kıyaslama veri kümelerinin kapsamını genişletir.
Eğitim Verileri#
| Veri Kümesi Bileşeni | Açıklama | Ölçek |
|---|---|---|
| SA-Co/HQ | 4 aşamalı veri motoruyla oluşturulmuş, insanlar tarafından yüksek kalitede etiketlenmiş görüntü verileri | 5,2 milyon görüntü, 4 milyon benzersiz isim öbeği |
| SA-Co/SYN | İnsan müdahalesi olmadan yapay zekâ tarafından etiketlenmiş sentetik veri kümesi | 38 milyon isim öbeği, 1,4 milyar maske |
| SA-Co/EXT | Zor negatiflerle zenginleştirilmiş 15 harici veri kümesi | Kaynağa göre değişir |
| SA-Co/VIDEO | Zamansal izleme içeren video etiketleri | 52,5 bin video, 24,8 bin benzersiz isim öbeği |
Kıyaslama Verileri#
SA-Co değerlendirme kıyaslama veri kümesi, 126 bin görüntü ve videoda yer alan 214 bin benzersiz öbek içerir ve mevcut kıyaslama veri kümelerinden 50 kattan fazla kavram sunar. Şunları içerir:
- SA-Co/Gold: İnsan performansının sınırlarını ölçmek için üç kez etiketlenmiş 7 alan
- SA-Co/Silver: İnsanlar tarafından bir kez etiketlenmiş 10 alan
- SA-Co/Bronze ve SA-Co/Bio: Kavram segmentasyonuna uyarlanmış 9 mevcut veri kümesi
- SA-Co/VEval: 3 alan içeren video kıyaslama veri kümesi (SA-V, YT-Temporal-1B, SmartGlasses)
Veri Motoru Yenilikleri#
SAM 3'ün ölçeklenebilir, insan ve model döngüde veri motoru şu yöntemlerle 2 kat daha yüksek etiketleme verimliliği sağlar:
- Yapay Zekâ Etiketleyicileri: Llama tabanlı modeller, zor negatifler de dahil olmak üzere çeşitli isim öbekleri önerir.
- Yapay Zekâ Doğrulayıcıları: İnce ayarlı çok modlu LLM'ler, maske kalitesini ve kapsamlılığını insan performansına yakın düzeyde doğrular.
- Aktif Madencilik: İnsan emeğini, yapay zekânın zorlandığı güç hata örneklerine yönlendirir.
- Ontoloji Odaklı: Kavram kapsamı için Wikidata temelli geniş bir ontolojiden yararlanır.
Kurulum#
ultralytics paketini yükle veya yükselt:
pip install -U ultralyticsDiğer Ultralytics modellerinin aksine SAM 3 ağırlıkları (sam3.pt) otomatik olarak indirilmez. Önce Hugging Face'teki SAM 3 model sayfasından model ağırlıklarına erişim isteğinde bulunmalı ve isteğin onaylandıktan sonra sam3.pt dosyasını bu sayfadan indirmelisin. İndirilen sam3.pt dosyasını çalışma dizinine yerleştir veya modeli yüklerken tam yolu belirt.
SAM 3.1 ağırlıklarına (sam3.1_multiplex.pt) SAM 3.1 model sayfasında aynı şekilde erişim kısıtlaması uygulanır. Aşağıdaki görüntü örneklerinde sam3.pt kullanılan her yerde sam3.1_multiplex.pt değerini kullan.
Tahmin sırasında yukarıdaki hatayı alırsan yanlış clip paketinin yüklü olduğu anlamına gelir. Aşağıdaki komutu çalıştırarak doğru clip paketini yükle:
pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.gitSAM 3 Nasıl Kullanılır: Kavram Segmentasyonunda Çok Yönlülük#
SAM 3, farklı tahminci arayüzleriyle hem İstemlenebilir Kavram Segmentasyonu (PCS) hem de İstemlenebilir Görsel Segmentasyon (PVS) görevlerini destekler:
Desteklenen Görevler ve Modeller#
| Görev Türü | İstem Türleri | Çıktı |
|---|---|---|
| Kavram Segmentasyonu (PCS) | Metin (isim öbekleri), görüntü örnekleri | Kavramla eşleşen tüm örnekler |
| Görsel Segmentasyon (PVS) | Noktalar, kutular, maskeler | Tek bir nesne örneği (SAM 2 tarzı) |
| Etkileşimli İyileştirme | Örnekleri veya tıklamaları yinelemeli olarak ekle/kaldır | Daha yüksek doğrulukla iyileştirilmiş segmentasyon |
Kavram Segmentasyonu Örnekleri#
Metin İstemleriyle Segmentasyon#
Bir metin açıklaması kullanarak kavramın tüm örneklerini bul ve segmentlere ayır. Metin istemleri için SAM3SemanticPredictor arayüzü gerekir.
from ultralytics.models.sam import SAM3SemanticPredictor
# Yapılandırmayla tahminciyi başlat
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"model": "sam3.pt",
"quantize": 16, # Daha hızlı çıkarım için FP16 kullan
"save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Birden fazla sorgu için görüntüyü bir kez ayarla
predictor.set_image("path/to/image.jpg")
# Birden fazla metin istemiyle sorgula
results = predictor(text=["person", "bus", "glasses"])
# Betimleyici öbeklerle çalışır
results = predictor(text=["person with red cloth", "person with blue cloth"])
# Tek bir kavramla sorgula
results = predictor(text=["a person"])Görüntü Örnekleriyle Segmentasyon#
Benzer tüm örnekleri bulmak için görsel istem olarak sınırlayıcı kutuları kullan. Kavram tabanlı eşleştirme için de SAM3SemanticPredictor gerekir.
from ultralytics.models.sam import SAM3SemanticPredictor
# Tahminciyi başlat
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Görüntüyü ayarla
predictor.set_image("path/to/image.jpg")
# Benzer nesneleri segmentlere ayırmak için sınırlayıcı kutu örnekleri ver
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])
# Aynı görsel kavramın örnekleri olarak birden fazla sınırlayıcı kutu kullan
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])Verimlilik için Özellik Tabanlı Çıkarım#
Verimliliği artırmak için görüntü özelliklerini bir kez çıkar ve birden fazla segmentasyon sorgusunda yeniden kullan.
import cv2
from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors
# Tahmincileri başlat
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)
# İlk tahminciden özellikleri çıkar
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]
# İkinci tahminciyi ayarla ve özellikleri yeniden kullan
predictor2.setup_model()
# Metin istemiyle paylaşılan özellikleri kullanarak çıkarım yap
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])
# Sınırlayıcı kutu istemiyle paylaşılan özellikleri kullanarak çıkarım yap
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])
# Sonuçları görselleştir
if masks is not None:
masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
im = cv2.imread(source)
annotator = Annotator(im, pil=False)
annotator.masks(masks, [colors(x, True) for x in range(len(masks))])
cv2.imshow("result", annotator.result())
cv2.waitKey(0)Video Kavram Segmentasyonu#
Sınırlayıcı Kutularla Video Boyunca Kavramları İzleme#
Sınırlayıcı kutu istemleriyle nesne örneklerini video kareleri boyunca algıla ve izle.
from ultralytics.models.sam import SAM3VideoPredictor
# Video tahmincisini oluştur
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)
# Nesneleri sınırlayıcı kutu istemleriyle izle
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)
# Sonuçları işle ve görüntüle
for r in results:
r.show() # Segmentasyon maskesiyle kareyi görüntüleMetin İstemleriyle Kavramları İzleme#
Metinde belirtilen kavramların tüm örneklerini video kareleri boyunca izle.
from ultralytics.models.sam import SAM3VideoSemanticPredictor
# Anlamsal video tahmincisini başlat
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"imgsz": 640,
"model": "sam3.pt",
"quantize": 16,
"save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)
# Kavramları metin istemleriyle izle
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)
# Sonuçları işle
for r in results:
r.show() # İzlenen nesnelerle kareyi görüntüle
# Alternatif: Sınırlayıcı kutu istemleriyle izle
results = predictor(
source="path/to/video.mp4",
bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
labels=[1, 1], # Pozitif etiketler
stream=True,
)Görsel İstemler (SAM 2 Uyumluluğu)#
SAM 3, tek nesne segmentasyonu için SAM 2'nin görsel istem özellikleriyle tam geriye dönük uyumluluğu korur:
Temel SAM arayüzü, SAM 2 ile tam olarak aynı şekilde çalışır ve yalnızca görsel istemlerle (noktalar, kutular veya maskeler) belirtilen belirli alanı segmente ayırır.
from ultralytics import SAM
model = SAM("sam3.pt")
# Tek nokta istemi - nesneyi belirli bir konumda segmentlere ayırır
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()
# Birden çok nokta - tek bir nesneyi birden çok nokta ipucuyla segmentlere ayırır
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])
# Kutu istemi - sınırlayıcı kutunun içindeki nesneyi segmentlere ayırır
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()Görsel istemlerle (noktalar/kutular/maskeler) SAM("sam3.pt") kullanıldığında, tıpkı SAM 2'de olduğu gibi yalnızca o konumdaki belirli nesne segmentlere ayrılır. Bir kavramın tüm örneklerini segmentlere ayırmak için yukarıda gösterildiği gibi metin veya örnek istemleriyle SAM3SemanticPredictor kullan.
Performans Karşılaştırmaları#
Görüntü Segmentasyonu#
SAM 3, LVIS ve segmentasyon için COCO gibi gerçek dünya veri kümeleri de dahil olmak üzere birçok kıyaslamada son teknoloji sonuçlar elde ediyor:
| Kıyaslama | Ölçüt | SAM 3 | Önceki En İyi | İyileşme |
|---|---|---|---|---|
| LVIS (sıfır atışlı) | Maske AP | 47.0 | 38.5 | +22.1% |
| SA-Co/Gold | CGF1 | 65.0 | 34.3 (OWLv2) | +89.5% |
| COCO (sıfır atışlı) | Kutu AP | 53.5 | 52.2 (T-Rex2) | +2.5% |
| ADE-847 (semantik segmentasyon) | mIoU | 14.7 | 9.2 (APE-D) | +59.8% |
| PascalConcept-59 | mIoU | 59.4 | 58.5 (APE-D) | +1.5% |
| Cityscapes (semantik segmentasyon) | mIoU | 65.1 | 44.2 (APE-D) | +47.3% |
Hızlı denemeler için veri kümesi seçeneklerini Ultralytics veri kümelerinde keşfet.
Video Segmentasyonu Performansı#
SAM 3, DAVIS 2017 ve YouTube-VOS gibi video kıyaslamalarında SAM 2'ye ve önceki son teknoloji modellere kıyasla önemli iyileşmeler gösteriyor:
| Kıyaslama | Ölçüt | SAM 3 | SAM 2.1 L | İyileşme |
|---|---|---|---|---|
| MOSEv2 | J&F | 60.1 | 47.9 | +25.5% |
| DAVIS 2017 | J&F | 92.0 | 90.7 | +1.4% |
| LVOSv2 | J&F | 88.2 | 79.6 | +10.8% |
| SA-V | J&F | 84.6 | 78.4 | +7.9% |
| YTVOS19 | J&F | 89.6 | 89.3 | +0.3% |
Az Örnekli Uyarlama#
SAM 3, veri odaklı yapay zekâ iş akışları açısından önemli olan yeni alanlara az sayıda örnekle uyum sağlama konusunda başarılıdır:
| Kıyaslama | 0 atışlı AP | 10 atışlı AP | Önceki En İyi (10 atışlı) |
|---|---|---|---|
| ODinW13 | 59.9 | 71.6 | 67.9 (gDino1.5-Pro) |
| RF100-VL | 14.3 | 35.7 | 33.7 (gDino-T) |
Etkileşimli İyileştirmenin Etkinliği#
SAM 3'ün örneklerle kavram tabanlı istemleri, görsel istemlerden çok daha hızlı yakınsar:
| Eklenen İstemler | CGF1 Puanı | Yalnızca Metne Göre Kazanç | PVS Temel Değerine Göre Kazanç |
|---|---|---|---|
| Yalnızca metin | 46.4 | temel değer | temel değer |
| +1 örnek | 57.6 | +11.2 | +6.7 |
| +2 örnek | 62.2 | +15.8 | +9.7 |
| +3 örnek | 65.0 | +18.6 | +11.2 |
| +4 örnek | 65.7 | +19.3 | +11.5 (doygunluk) |
Nesne Sayma Doğruluğu#
SAM 3, nesne sayma iş akışlarında sıkça gerektiği gibi tüm örnekleri segmentlere ayırarak doğru sayım sağlar:
| Kıyaslama | Doğruluk | MAE | En İyi MLLM'ye Göre |
|---|---|---|---|
| CountBench | 95.6% | 0.11 | 92.4% (Gemini 2.5) |
| PixMo-Count | 87.3% | 0.22 | 88.8% (Molmo-72B) |
SAM 3 ve SAM 2 ile YOLO Karşılaştırması#
Burada SAM 3'ün yeteneklerini SAM 2 ve YOLO26 modelleriyle karşılaştırıyoruz. Aynı tür istemlerle gerçek zamanlı, açık kelime dağarcıklı tespit ve segmentasyon için YOLOE sayfasına göz at:
| Yetenek | SAM 3 | SAM 2 | YOLO26n-seg |
|---|---|---|---|
| Kavram Segmentasyonu | ✅ Metin/örneklerden tüm örnekler | ❌ Desteklenmiyor | ❌ Desteklenmiyor |
| Görsel Segmentasyon | ✅ Tek örnek (SAM 2 ile uyumlu) | ✅ Tek örnek | ✅ Tüm örnekler |
| Sıfır Atış Yeteneği | ✅ Açık kelime dağarcığı | ✅ Geometrik istemler | ❌ Kapalı küme |
| Etkileşimli İyileştirme | ✅ Örnekler + tıklamalar | ✅ Yalnızca tıklamalar | ❌ Desteklenmiyor |
| Video Takibi | ✅ Kimliklerle çoklu nesne | ✅ Çoklu nesne | ✅ Çoklu nesne |
| LVIS Maske AP (sıfır atışlı) | 47.0 | Uygulanamaz | Uygulanamaz |
| MOSEv2 J&F | 60.1 | 47.9 | Uygulanamaz |
| Hız (GPU, ms/görüntü) | 2921 | 857 | 8.4 |
| Model Boyutu | 3.45 GB | 162 MB (temel) | 6.4 MB |
Hız kıyaslaması NVIDIA RTX PRO 6000 üzerinde torch==2.9.1 ve ultralytics==8.4.19 ile yapıldı.
Önemli Çıkarımlar:
- SAM 3: Metin veya örnek istemleriyle bir kavramın tüm örneklerini bulmaya yönelik açık kelime dağarcıklı kavram segmentasyonu için en iyisi
- SAM 2: Geometrik istemlerle görüntü ve videolarda tek nesnenin etkileşimli segmentasyonu için en iyisi
- YOLO26: İsteğe bağlı NMS içermeyen uçtan uca çıkarımla gerçek zamanlı, yüksek hızlı segmentasyon için en iyisi; GPU'lara, CPU'lara ve uç cihazlara dağıtım için birçok biçime aktarılabilir
SAM ve YOLO Karşılaştırması#
Boyut, parametre sayısı ve GPU çıkarım hızı açısından SAM 3, SAM 2, SAM, MobileSAM ve FastSAM modellerini Ultralytics YOLO segmentasyon modelleriyle (YOLOv8, YOLO11, YOLO26) karşılaştırma:
| Model | Boyut (MB) | Parametreler (M) | Hız (GPU) (ms/im) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 1306 |
| Meta SAM2-b | 162 | 80.8 | 857 |
| Meta SAM2-t | 78.1 | 38.9 | 668 |
| Meta SAM3 | 3450 | 473.6 | 2921 |
| MobileSAM | 40.7 | 10.1 | 605 |
| FastSAM-s ve YOLOv8 omurgası | 23.7 | 11.8 | 55.9 |
| Ultralytics YOLOv8n-seg | 6.7 (515 kat daha küçük) | 3.4 (139.1 kat daha az) | 17.4 (167 kat daha hızlı) |
| Ultralytics YOLO11n-seg | 5.9 (585 kat daha küçük) | 2.9 (163.1 kat daha az) | 12.6 (231 kat daha hızlı) |
| Ultralytics YOLO26n-seg | 6.4 (539 kat daha küçük) | 2.7 (175.2 kat daha az) | 8.4 (347 kat daha hızlı) |
Bu karşılaştırma, SAM varyantları ile YOLO segmentasyon modelleri arasındaki model boyutu ve hız farklarının ne kadar büyük olduğunu gösteriyor. SAM, kendine özgü otomatik segmentasyon yetenekleri sunarken YOLO modelleri, özellikle YOLOv8n-seg, YOLO11n-seg ve YOLO26n-seg, önemli ölçüde daha küçük, daha hızlı ve hesaplama açısından daha verimlidir.
Testler, torch==2.9.1 ve ultralytics==8.4.19 kullanılarak 96 GB VRAM'e sahip NVIDIA RTX PRO 6000 üzerinde çalıştırıldı. Bu testi yeniden oluşturmak için:
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM profili oluştur
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# FastSAM-s profili oluştur
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# YOLO modellerinin profilini oluştur
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
model(ASSETS, nms=False) # YOLO26 NMS içermeyen başlık; YOLOv8/YOLO11 için işlem yapmazDeğerlendirme Metrikleri#
SAM 3, PCS görevi için tasarlanmış yeni metrikler sunarak F1 puanı, kesinlik ve duyarlılık gibi bilinen ölçütleri tamamlıyor.
Sınıflandırma Kontrollü F1 (CGF1)#
Yerelleştirme ile sınıflandırmayı birleştiren temel metrik:
CGF1 = 100 × pmF1 × IL_MCC
Burada:
- pmF1 (Pozitif Makro F1): Pozitif örneklerdeki yerelleştirme kalitesini ölçer
- IL_MCC (Görüntü Düzeyinde Matthews Korelasyon Katsayısı): İkili sınıflandırma doğruluğunu ("kavram mevcut mu?") ölçer
Bu Metrikler Neden Kullanılıyor?#
Geleneksel AP metrikleri kalibrasyonu hesaba katmadığından modellerin pratikte kullanımı zorlaşır. SAM 3'ün metrikleri, yalnızca güven puanı 0.5'in üzerinde olan tahminleri değerlendirerek iyi kalibrasyonu zorunlu kılar ve etkileşimli tahmin ve izleme döngülerindeki gerçek dünya kullanım örüntülerini taklit eder.
Temel Ablasyonlar ve İçgörüler#
Varlık Başlığının Etkisi#
Varlık başlığı, tanımayı yerelleştirmeden ayırarak önemli iyileştirmeler sağlar:
| Yapılandırma | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| Varlık başlığı olmadan | 57.6 | 0.77 | 74.7 |
| Varlık başlığıyla | 63.3 | 0.82 | 77.1 |
Varlık başlığı, başlıca tanıma becerisini iyileştirerek +5.7 CGF1 artışı (+%9.9) sağlar (IL_MCC +%6.5).
Zor Negatiflerin Etkisi#
| Görüntü Başına Zor Negatif Sayısı | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| 0 | 31.8 | 0.44 | 70.2 |
| 5 | 44.8 | 0.62 | 71.9 |
| 30 | 49.2 | 0.68 | 72.3 |
Zor negatifler açık kelime dağarcıklı tanıma için kritik önem taşır ve IL_MCC'yi %54.5 (0.44 → 0.68) artırır.
Eğitim Verisinin Ölçeklendirilmesi#
| Veri Kaynakları | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| Yalnızca harici | 30.9 | 0.46 | 66.3 |
| Harici + Sentetik | 39.7 | 0.57 | 70.6 |
| Harici + Yüksek Kaliteli | 51.8 | 0.71 | 73.2 |
| Üçü Birden | 54.3 | 0.74 | 73.5 |
Yüksek kaliteli insan açıklamaları, yalnızca sentetik veya harici veriye kıyasla büyük kazanımlar sağlar. Veri kalitesi uygulamalarının arka planı için veri toplama ve açıklama ekleme sayfasına bak.
Uygulamalar#
SAM 3'ün kavram segmentasyonu yeteneği yeni kullanım alanları sağlar:
- İçerik Moderasyonu: Medya arşivlerindeki belirli içerik türlerinin tüm örneklerini bul
- E-ticaret: Katalog görüntülerindeki belirli türdeki tüm ürünleri segmentlere ayırarak otomatik açıklama eklemeyi destekle
- Tıbbi Görüntüleme: Belirli doku türlerinin veya anormalliklerin tüm örneklerini belirle
- Otonom Sistemler: Trafik işaretleri, yayalar veya araçların tüm örneklerini kategorilerine göre izle
- Video Analitiği: Belirli kıyafetleri giyen veya belirli eylemleri gerçekleştiren tüm kişileri say ve izle
- Veri Kümesi Açıklaması: Nadir nesne kategorilerinin tüm örneklerine hızla açıklama ekle
- Bilimsel Araştırma: Belirli ölçütlere uyan tüm örnekleri ölç ve analiz et
SAM 3 Agent: Genişletilmiş Dilsel Akıl Yürütme#
SAM 3, akıl yürütme gerektiren karmaşık sorguları işlemek için, OWLv2 ve T-Rex gibi açık kelime dağarcıklı sistemlere benzer şekilde Çok Modlu Büyük Dil Modelleri (MLLMs) ile birleştirilebilir.
Akıl Yürütme Görevlerindeki Performans#
| Kıyaslama | Ölçüt | SAM 3 Agent (Gemini 2.5 Pro) | Önceki En İyi |
|---|---|---|---|
| ReasonSeg (doğrulama) | gIoU | 76.0 | 65.0 (son teknoloji) |
| ReasonSeg (test) | gIoU | 73.8 | 61.3 (son teknoloji) |
| OmniLabel (doğrulama) | AP | 46.7 | 36.5 (REAL) |
| RefCOCO+ | Doğruluk | 91.2 | 89.3 (LISA) |
Karmaşık Sorgu Örnekleri#
SAM 3 Agent, akıl yürütme gerektiren sorguları işleyebilir:
- "Oturmuş ancak ellerinde hediye kutusu tutmayan kişiler"
- "Kameraya en yakın, tasma takmayan köpek"
- "Kişinin elinden daha büyük kırmızı nesneler"
MLLM, SAM 3'e basit isim tamlaması sorguları önerir, döndürülen maskeleri analiz eder ve sonuçtan memnun kalana kadar yineler.
Sınırlamalar#
SAM 3 büyük bir ilerlemeyi temsil etse de bazı sınırlamaları vardır:
- İfade Karmaşıklığı: Basit isim tamlamaları için en uygunudur; uzun gönderim ifadeleri veya karmaşık akıl yürütme MLLM entegrasyonu gerektirebilir
- Belirsizlikleri Ele Alma: Bazı kavramlar doğası gereği belirsiz kalır (ör. "küçük pencere", "rahat oda")
- Hesaplama Gereksinimleri: YOLO gibi özel algılama modellerinden daha büyük ve daha yavaştır
- Kelime Dağarcığı Kapsamı: Atomik görsel kavramlara odaklanır; MLLM desteği olmadan bileşimsel akıl yürütme sınırlıdır
- Nadir Kavramlar: Eğitim verisinde iyi temsil edilmeyen son derece nadir veya ince ayrıntılı kavramlarda performans düşebilir
Atıf#
@misc{carion2025sam3,
title = {SAM 3: Segment Anything with Concepts},
author = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
year = {2025},
eprint = {2511.16719},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2511.16719}
}Sık Sorulan Sorular#
SAM 3, Meta tarafından 19 Kasım 2025 tarihinde yayımlandı ve
ultralyticspaketine tamamen entegre edildi; tahmin modu ve izleme modu desteği de sunuyor.Evet! SAM 3; kavram segmentasyonu, SAM 2 tarzı görsel istemler ve çok nesneli video izleme özellikleriyle Ultralytics Python paketine tamamen entegre edildi. SAM 3 ve SAM 3.1, Ultralytics Platform üzerindeki akıllı açıklama ekleme özelliğine de güç veriyor; burada varsayılan model SAM 3.1 ve görüntülere yalnızca birkaç tıklamayla açıklama ekleyebilirsin.
Evet, görüntü tahmini için destekliyor. Bu sayfadaki görüntü örneklerinde
sam3.ptkullanılan her yerdesam3.1_multiplex.ptyükle: nokta ve kutu istemleri içinSAM("sam3.1_multiplex.pt"), metin ve örnek istemleri içinSAM3SemanticPredictor. Nesne Çoklama video izleme henüz desteklenmiyor; bu nedenle video tahmincileriylesam3.ptkullanmaya devam et. Meta'nın kıyaslamaları için SAM 3.1 sayfasına bak.PCS, SAM 3'te sunulan ve bir görüntü veya videodaki görsel bir kavramın tüm örneklerini segmentlere ayıran yeni bir görevdir. Belirli bir nesne örneğini hedefleyen geleneksel segmentasyonun aksine PCS, bir kategorinin her örneğini bulur. Örneğin:
- Metin istemi: "sarı okul otobüsü" → sahnedeki tüm sarı okul otobüslerini segmentlere ayırır
- Görsel örneği: Bir köpeğin etrafına kutu çiz → görseldeki tüm köpekleri segmentlere ayırır
- Birleşik: "çizgili kedi" + örnek kutusu → örneğe uyan tüm çizgili kedileri segmentlere ayırır
İlgili arka plan bilgileri için nesne algılama ve örnek segmentasyonu konularına bak.
Özellik SAM 2 SAM 3 Görev İstem başına tek nesne Bir kavramın tüm örnekleri İstem Türleri Noktalar, kutular, maskeler + Metin ifadeleri, görsel örnekleri Algılama Yeteneği Harici algılayıcı gerektirir Yerleşik açık kelime dağarcıklı algılayıcı Tanıma Yalnızca geometriye dayalı Metin ve görsel tanıma Mimari Yalnızca izleyici Varlık başlığına sahip algılayıcı + izleyici Sıfır Örnekli Performans Uygulanamaz (görsel istemler gerektirir) LVIS'te 47.0 AP, SA-Co'da 2× daha iyi Etkileşimli İyileştirme Yalnızca tıklamalar Tıklamalar + örnek genellemesi SAM 3, kavram tabanlı yetenekler eklerken SAM 2 görsel istemleriyle geriye dönük uyumluluğu korur.
SAM 3, Segment Anything with Concepts (SA-Co) veri kümesiyle eğitilir:
Eğitim Verileri:
- 5.2M görsel ve 4M benzersiz isim öbeği (SA-Co/HQ) - yüksek kaliteli insan anotasyonları
- 52.5K video ve 24.8K benzersiz isim öbeği (SA-Co/VIDEO)
- 38M isim öbeği genelinde 1.4B sentetik maske (SA-Co/SYN)
- Zor negatif örneklerle zenginleştirilmiş 15 harici veri kümesi (SA-Co/EXT)
Kıyaslama Verileri:
- 126K görsel/video genelinde 214K benzersiz kavram
- Mevcut kıyaslamalardan 50× daha fazla kavram (ör. LVIS'te ~4K kavram var)
- İnsan performansının sınırlarını ölçmek için SA-Co/Gold üzerinde üçlü anotasyon
Bu muazzam ölçek ve çeşitlilik, SAM 3'ün açık kelime dağarcıklı kavramlarda üstün sıfır örnekli genelleme yapmasını sağlar.
SAM 3 ve YOLO26 farklı kullanım alanlarına hitap eder:
SAM 3'ün Avantajları:
- Açık kelime dağarcıklı: Eğitim gerektirmeden metin istemleriyle her kavramı segmentlere ayırır
- Sıfır örnekli: Yeni kategorilerde hemen çalışır
- Etkileşimli: Örnek tabanlı iyileştirme, benzer nesnelere genellenir
- Kavram tabanlı: Bir kategorinin tüm örneklerini otomatik olarak bulur
- Doğruluk: LVIS sıfır örnekli örnek segmentasyonunda 47.0 AP
YOLO26'nın Avantajları:
- Hız: İsteğe bağlı, NMS gerektirmeyen uçtan uca bir başlıkla çıkarım çok daha hızlıdır
- Verimlilik: 539× daha küçük modeller (6.4MB'ye karşı 3.45GB)
- Kaynak dostu: Uç cihazlarda ve mobil cihazlarda çalışır
- Gerçek zamanlı: Üretim ortamlarında kullanıma göre optimize edilmiştir
Öneri:
- Metinle veya örneklerle tanımlanan kavramların tüm örneklerini bulman gereken esnek, açık kelime dağarcıklı segmentasyon için SAM 3'ü kullan
- Kategorilerin önceden bilindiği yüksek hızlı üretim ortamları için YOLO26'yı kullan
- Geometrik istemlerle etkileşimli, tek nesne segmentasyonu için SAM 2'yi kullan
SAM 3, basit isim öbekleri için tasarlanmıştır (ör. "kırmızı elma", "şapka takan kişi"). Akıl yürütme gerektiren karmaşık sorgular için SAM 3'ü bir MLLM ile SAM 3 Agent olarak birlikte kullan:
Basit sorgular (yerel SAM 3):
- "sarı okul otobüsü"
- "çizgili kedi"
- "kırmızı şapka takan kişi"
Karmaşık sorgular (MLLM ile SAM 3 Agent):
- "Hediye kutusu tutmayan, oturmuş kişiler"
- "Tasması olmayan, kameraya en yakın köpek"
- "Kişinin elinden daha büyük kırmızı nesneler"
SAM 3 Agent, SAM 3'ün segmentasyonunu MLLM akıl yürütme yetenekleriyle birleştirerek ReasonSeg doğrulama kümesinde 76.0 gIoU elde eder (önceki en iyi 65.0 değerine kıyasla %16.9 iyileşme).
Üçlü insan anotasyonuna sahip SA-Co/Gold kıyaslamasında:
- İnsan performansının alt sınırı: 74.2 CGF1 (en ihtiyatlı anotatör)
- SAM 3 performansı: 65.0 CGF1
- Başarı: Tahmini insan performansı alt sınırının %88'i
- İnsan performansının üst sınırı: 81.4 CGF1 (en hoşgörülü anotatör)
SAM 3, açık kelime dağarcıklı kavram segmentasyonunda insan düzeyindeki doğruluğa yaklaşan güçlü bir performans sergiler; aradaki fark esas olarak belirsiz veya öznel kavramlarda (ör. "küçük pencere", "rahat oda") görülür.