SAM 3: Kavramlarla Her Şeyi Segmentleme#

SAM 3 (Her Şeyi Segmentleme Modeli 3), Meta'nın İstemlenebilir Kavram Segmentasyonu (PCS) için yayımladığı temel modeldir. SAM 2 üzerine inşa edilen SAM 3, temelde yeni bir yetenek sunar: metin istemleri, görüntü örnekleri veya her ikisiyle belirtilen bir görsel kavramın tüm örneklerini algılama, segmentlere ayırma ve takip etme. Tek bir istemle tek nesneyi segmentlere ayıran önceki SAM sürümlerinden farklı olarak SAM 3, görüntülerde veya videolarda herhangi bir yerde görünen bir kavramın her örneğini bulup segmentlere ayırabilir; bu da modern örnek segmentasyonu alanındaki açık kelime dağarcığı hedefleriyle uyumludur.
Watch: How to Use Meta Segment Anything 3 with Ultralytics | Text-Prompt Segmentation on Images & Videos
SAM 3, metin ipuçları, görsel örnek ipuçları ve video takibi ile kavram bölütleme için yerel destek sağlayarak ultralytics paketine tamamen entegre edilmiştir. Daha yeni olan SAM 3.1 kontrol noktası, görsel tahmini için desteklenmektedir.
Genel Bakış#
SAM 3, İstemlenebilir Kavram Segmentasyonu alanında mevcut sistemlere kıyasla 2 kat performans artışı sağlarken SAM 2'nin etkileşimli görsel segmentasyon yeteneklerini korur ve geliştirir. Model, kullanıcıların basit isim öbekleri (ör. "sarı okul otobüsü", "çizgili kedi") kullanarak veya hedef nesnenin örnek görüntülerini sağlayarak kavramları belirtmesine olanak tanıyan açık kelime dağarcıklı segmentasyonda başarılıdır. Bu yetenekler, kolaylaştırılmış predict ve track iş akışlarına dayanan üretime hazır işlem hatlarını tamamlar.

İstemlenebilir Kavram Segmentasyonu (PCS) nedir?#
PCS görevi, girdi olarak bir kavram istemi alır ve eşleşen tüm nesne örnekleri için benzersiz kimliklere sahip segmentasyon maskeleri döndürür. Kavram istemleri şunlar olabilir:
- Metin: Sıfır örnekli öğrenmeye benzer şekilde "kırmızı elma" veya "şapka takan kişi" gibi basit isim öbekleri
- Görüntü örnekleri: Hızlı genelleme için örnek nesnelerin etrafındaki (pozitif veya negatif) sınırlayıcı kutular
- Birleşik: Hassas kontrol için hem metin hem de görüntü örnekleri birlikte
Bu yaklaşım, özgün SAM ailesi ile yaygınlaşan ve yalnızca tek bir belirli nesne örneğini segmentlere ayıran geleneksel görsel istemlerden (noktalar, kutular, maskeler) farklıdır.
Temel Performans Ölçütleri#
| Ölçüt | SAM 3 Başarımı |
|---|---|
| LVIS Sıfır Örnekli Maske AP'si | 47,0 (önceki en iyi değer 38,5'e kıyasla, %22 iyileşme) |
| SA-Co Karşılaştırması | Mevcut sistemlerden 2 kat daha iyi |
| Çıkarım Hızı (H200 GPU) | 100'den fazla algılanan nesneyle görüntü başına 30 ms |
| Video Performansı | ~5 eş zamanlı nesne için gerçeğe yakın zamanlı |
| MOSEv2 VOS Karşılaştırması | 60,1 J&F (SAM 2.1'e kıyasla +%25,5, önceki SOTA'ya kıyasla +%17) |
| Etkileşimli İyileştirme | 3 örnek isteminden sonra +18,6 CGF1 iyileşme |
| İnsan Performansı Farkı | SA-Co/Gold üzerinde tahmini alt sınırın %88'ine ulaşır |
Üretimde model ölçütleri ve ödünleşimleri hakkında bilgi için model değerlendirme içgörülerine ve YOLO performans ölçütlerine bak.
SAM 3.1#
Meta tarafından 27 Mart 2026'da yayınlanan SAM 3.1, çok nesneli video takibi için paylaşımlı belleğe dayalı bir yaklaşım olan Nesne Çoklaması özelliğini ekleyen yeni bir SAM 3 kontrol noktasıdır. SAM 3.1, takibi yapılan her nesneyi bağımsız olarak işlemek yerine nesneleri sabit kapasiteli gruplarda toplar ve bunları ortaklaşa işler; Meta, bunun tek bir H100 GPU üzerinde 128 nesnede ~7 kat hızlanma sağladığını bildirmektedir. Görsel dedektörü ve etkileşimli nokta ipucu başlığı, SAM 3 mimarisini korur.
| Kıyaslama | Ölçüt | SAM 3 | SAM 3.1 |
|---|---|---|---|
| SA-Co/VEval SA-V (test) | cgF1 | 30.3 | 30.5 |
| SA-Co/VEval YT-Temporal-1B (test) | cgF1 | 50.8 | 52.9 |
| SA-Co/VEval SmartGlasses (test) | cgF1 | 36.4 | 36.3 |
| MOSEv1 (val) | J&F | 78.4 | 79.6 |
| DAVIS17 (val) | J&F | 92.2 | 92.7 |
| SA-V (test) | J&F | 84.4 | 85.1 |
| YTVOS19 (val) | G | 89.7 | 89.3 |
| MOSEv2 (val) | J&Ḟ | 60.3 | 62.3 |
Ultralytics, SAM 3.1 kontrol noktasını (sam3.1_multiplex.pt) SAM 3 görsel tahminleyicilerine yükler: nokta ve kutu ipuçları için SAM("sam3.1_multiplex.pt"), metin ve örnek ipuçları için SAM3SemanticPredictor. Nesne Çoklaması video takibi henüz desteklenmemektedir, bu nedenle sam3.pt öğesini SAM3VideoPredictor ve SAM3VideoSemanticPredictor ile birlikte kullanmaya devam et.
Mimari#
SAM 3, Perception Encoder (PE) görsel omurgasını paylaşan bir algılayıcı ve izleyiciden oluşur. Bu ayrıştırılmış tasarım, görev çatışmalarını önlerken hem görüntü düzeyinde algılamayı hem de video düzeyinde takibi mümkün kılar ve Ultralytics Python kullanımı ile CLI kullanımı ile uyumlu bir arayüz sunar.
Temel Bileşenler#
-
Algılayıcı: Görüntü düzeyinde kavram algılama için DETR tabanlı mimari
- İsim öbeği istemleri için metin kodlayıcı
- Görüntü tabanlı istemler için örnek kodlayıcı
- Görüntü özelliklerini istemlere göre koşullandıran füzyon kodlayıcı
- Tanımayı ("ne") yerelleştirmeden ("nerede") ayıran yeni presence head
- Örnek segmentasyon maskeleri oluşturmak için maske başlığı
-
İzleyici: SAM 2'den devralınan bellek tabanlı video segmentasyonu
- İstem kodlayıcı, maske kod çözücü, bellek kodlayıcı
- Kareler arasında nesne görünümünü depolamak için bellek bankası
- Çok nesneli ortamlarda Kalman filtresi gibi tekniklerle desteklenen zamansal ayrıştırma
-
Presence Token: Hedef kavramın görüntüde/karede bulunup bulunmadığını tahmin eden, tanımayı yerelleştirmeden ayırarak algılamayı iyileştiren öğrenilmiş küresel belirteç.

Temel Yenilikler#
- Ayrıştırılmış Tanıma ve Yerelleştirme: Presence head kavramın varlığını genel düzeyde tahmin ederken öneri sorguları yalnızca yerelleştirmeye odaklanır ve çakışan hedefleri önler.
- Birleşik Kavram ve Görsel İstemler: Hem PCS'yi (kavram istemleri) hem de PVS'yi (SAM 2'nin tıklamaları/kutuları gibi görsel istemler) tek bir modelde destekler.
- Etkileşimli Örnek İyileştirme: Kullanıcılar sonuçları yinelemeli olarak iyileştirmek için pozitif veya negatif görüntü örnekleri ekleyebilir; model yalnızca tek tek örnekleri düzeltmek yerine benzer nesnelere genelleme yapar.
- Zamansal Ayrıştırma: Videoda örtülmeleri, kalabalık sahneleri ve takip hatalarını ele almak için maske parçası algılama skorlarını ve düzenli olarak yeniden istem göndermeyi kullanır; bu yaklaşım örnek segmentasyonu ve takibi için en iyi uygulamalarla uyumludur.
SA-Co Veri Kümesi#
SAM 3, Meta'nın bugüne kadarki en büyük ve en çeşitli segmentasyon veri kümesi olan Kavramlarla Her Şeyi Segmentleme (SA-Co) üzerinde eğitilmiştir ve COCO ile LVIS gibi yaygın karşılaştırma ölçütlerinin ötesine geçer.
Eğitim Verileri#
| Veri Kümesi Bileşeni | Açıklama | Ölçek |
|---|---|---|
| SA-Co/HQ | 4 aşamalı veri motorundan elde edilen, insanlar tarafından yüksek kaliteli şekilde açıklanmış görüntü verileri | 5,2 milyon görüntü, 4 milyon benzersiz isim öbeği |
| SA-Co/SYN | İnsan müdahalesi olmadan yapay zekâ tarafından etiketlenen sentetik veri kümesi | 38 milyon isim öbeği, 1,4 milyar maske |
| SA-Co/EXT | Zor negatiflerle zenginleştirilmiş 15 harici veri kümesi | Kaynağa göre değişir |
| SA-Co/VIDEO | Zamansal takibe sahip video açıklamaları | 52,5 bin video, 24,8 bin benzersiz isim öbeği |
Karşılaştırma Verileri#
SA-Co değerlendirme karşılaştırması, 126 bin görüntü ve videoda 214 bin benzersiz ifade içerir ve mevcut karşılaştırma ölçütlerinden 50 kattan fazla kavram sunar. Şunları içerir:
- SA-Co/Gold: İnsan performansı sınırlarını ölçmek için üçlü açıklanmış 7 alan
- SA-Co/Silver: Tek insan açıklamasına sahip 10 alan
- SA-Co/Bronze ve SA-Co/Bio: Kavram segmentasyonuna uyarlanmış 9 mevcut veri kümesi
- SA-Co/VEval: 3 alana sahip video karşılaştırması (SA-V, YT-Temporal-1B, SmartGlasses)
Veri Motoru Yenilikleri#
SAM 3'ün insanı ve modeli döngüye dahil eden ölçeklenebilir veri motoru, şu yollarla 2 kat açıklama verimliliği sağlar:
- Yapay Zekâ Açıklayıcıları: Llama tabanlı modeller, zor negatifler dahil olmak üzere çeşitli isim öbekleri önerir
- Yapay Zekâ Doğrulayıcıları: İnce ayarlı çok modlu LLM'ler, maske kalitesini ve eksiksizliğini insana yakın performansla doğrular
- Aktif Madencilik: İnsan emeğini, yapay zekânın zorlandığı zorlu hata örneklerine odaklar
- Ontoloji Odaklı: Kavram kapsamı için Wikidata temelli geniş bir ontolojiden yararlanır
Kurulum#
ultralytics paketini yükle veya yükselt:
pip install -U ultralyticsDiğer Ultralytics modellerinden farklı olarak SAM 3 ağırlıkları (sam3.pt) otomatik olarak indirilmez. Önce Hugging Face üzerindeki SAM 3 model sayfasından model ağırlıklarına erişim istemen, ardından onaylandıktan sonra sam3.pt dosyasını bu sayfadan indirmen gerekir. İndirilen sam3.pt dosyasını çalışma dizinine yerleştir veya modeli yüklerken tam yolu belirt.
SAM 3.1 ağırlıkları (sam3.1_multiplex.pt), SAM 3.1 model sayfasında aynı şekilde kısıtlanmıştır. Aşağıdaki görsel örneklerinin sam3.pt kullandığı herhangi bir yere sam3.1_multiplex.pt ekle.
Tahmin sırasında yukarıdaki hatayı alırsan yanlış clip paketi yüklü demektir. Aşağıdaki komutu çalıştırarak doğru clip paketini yükle:
pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.gitSAM 3 Nasıl Kullanılır: Kavram Segmentasyonunda Çok Yönlülük#
SAM 3, farklı tahminci arayüzleri aracılığıyla hem İstemlenebilir Kavram Segmentasyonu (PCS) hem de İstemlenebilir Görsel Segmentasyon (PVS) görevlerini destekler:
Desteklenen Görevler ve Modeller#
| Görev Türü | İstem Türleri | Çıktı |
|---|---|---|
| Kavram Segmentasyonu (PCS) | Metin (isim öbekleri), görüntü örnekleri | Kavramla eşleşen tüm örnekler |
| Görsel Segmentasyon (PVS) | Noktalar, kutular, maskeler | Tek nesne örneği (SAM 2 tarzı) |
| Etkileşimli İyileştirme | Örnekleri veya tıklamaları yinelemeli olarak ekle/kaldır | İyileştirilmiş doğrulukla rafine edilmiş segmentasyon |
Kavram Segmentasyonu Örnekleri#
Metin İstemleriyle Segmentasyon#
Metin açıklaması kullanarak bir kavramın tüm örneklerini bul ve segmentlere ayır. Metin istemleri SAM3SemanticPredictor arayüzünü gerektirir.
from ultralytics.models.sam import SAM3SemanticPredictor
# Initialize predictor with configuration
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"model": "sam3.pt",
"quantize": 16, # Use FP16 for faster inference
"save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Set image once for multiple queries
predictor.set_image("path/to/image.jpg")
# Query with multiple text prompts
results = predictor(text=["person", "bus", "glasses"])
# Works with descriptive phrases
results = predictor(text=["person with red cloth", "person with blue cloth"])
# Query with a single concept
results = predictor(text=["a person"])Görüntü Örnekleriyle Segmentasyon#
Tüm benzer örnekleri bulmak için sınırlayıcı kutuları görsel istemler olarak kullan. Bu işlem kavram tabanlı eşleştirme için ayrıca SAM3SemanticPredictor gerektirir.
from ultralytics.models.sam import SAM3SemanticPredictor
# Initialize predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Set image
predictor.set_image("path/to/image.jpg")
# Provide bounding box examples to segment similar objects
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])
# Multiple bounding boxes as exemplars of the same visual concept
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])Verimlilik için Özellik Tabanlı Çıkarım#
Verimliliği artırmak için görüntü özelliklerini bir kez çıkar ve birden çok segmentasyon sorgusunda yeniden kullan.
import cv2
from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors
# Initialize predictors
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)
# Extract features from the first predictor
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]
# Setup second predictor and reuse features
predictor2.setup_model()
# Perform inference using shared features with text prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])
# Perform inference using shared features with bounding box prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])
# Visualize results
if masks is not None:
masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
im = cv2.imread(source)
annotator = Annotator(im, pil=False)
annotator.masks(masks, [colors(x, True) for x in range(len(masks))])
cv2.imshow("result", annotator.result())
cv2.waitKey(0)Video Kavram Segmentasyonu#
Sınırlayıcı Kutularla Video Boyunca Kavramları İzleme#
Sınırlayıcı kutu istemlerini kullanarak video kareleri boyunca nesne örneklerini algıla ve takip et.
from ultralytics.models.sam import SAM3VideoPredictor
# Create video predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)
# Track objects using bounding box prompts
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)
# Process and display results
for r in results:
r.show() # Display frame with segmentation masksMetin İstemleriyle Kavramları İzleme#
Metinle belirtilen kavramların tüm örneklerini video kareleri boyunca takip et.
from ultralytics.models.sam import SAM3VideoSemanticPredictor
# Initialize semantic video predictor
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"imgsz": 640,
"model": "sam3.pt",
"quantize": 16,
"save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)
# Track concepts using text prompts
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)
# Process results
for r in results:
r.show() # Display frame with tracked objects
# Alternative: Track with bounding box prompts
results = predictor(
source="path/to/video.mp4",
bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
labels=[1, 1], # Positive labels
stream=True,
)Görsel İstemler (SAM 2 Uyumluluğu)#
SAM 3, tek nesne segmentasyonu için SAM 2'nin görsel istemleriyle tam geriye dönük uyumluluğu korur:
Temel SAM arayüzü, SAM 2 ile tam olarak aynı şekilde çalışır ve yalnızca görsel istemlerin (noktalar, kutular veya maskeler) belirttiği belirli alanı segmente eder.
from ultralytics import SAM
model = SAM("sam3.pt")
# Single point prompt - segments object at specific location
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()
# Multiple points - segments single object with multiple point hints
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])
# Box prompt - segments object within bounding box
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()Görsel istemlerle (noktalar/kutular/maskeler) SAM("sam3.pt") kullanıldığında, tıpkı SAM 2'de olduğu gibi o konumdaki yalnızca belirli nesne segmente edilir. Bir kavramın tüm örneklerini segmentlere ayırmak için yukarıda gösterildiği gibi metin veya örnek istemleriyle SAM3SemanticPredictor kullan.
Performans Karşılaştırmaları#
Görüntü Segmentasyonu#
SAM 3, LVIS ve segmentasyon için COCO gibi gerçek dünya veri kümeleri de dahil olmak üzere birden çok karşılaştırma testinde son teknoloji sonuçlara ulaşır:
| Kıyaslama | Ölçüt | SAM 3 | Önceki En İyi | İyileştirme |
|---|---|---|---|---|
| LVIS (sıfır örnekli) | Maske AP'si | 47.0 | 38.5 | +22.1% |
| SA-Co/Gold | CGF1 | 65.0 | 34.3 (OWLv2) | +89.5% |
| COCO (sıfır örnekli) | Kutu AP'si | 53.5 | 52.2 (T-Rex2) | +2.5% |
| ADE-847 (anlamsal seg) | mIoU | 14.7 | 9.2 (APE-D) | +59.8% |
| PascalConcept-59 | mIoU | 59.4 | 58.5 (APE-D) | +1.5% |
| Cityscapes (anlamsal seg) | mIoU | 65.1 | 44.2 (APE-D) | +47.3% |
Hızlı denemeler için veri kümesi seçeneklerini Ultralytics veri kümeleri sayfasında keşfet.
Video Segmentasyonu Performansı#
SAM 3, DAVIS 2017 ve YouTube-VOS gibi video karşılaştırma testlerinde SAM 2'ye ve önceki son teknoloji yöntemlere kıyasla önemli iyileştirmeler gösterir:
| Kıyaslama | Ölçüt | SAM 3 | SAM 2.1 L | İyileştirme |
|---|---|---|---|---|
| MOSEv2 | J&F | 60.1 | 47.9 | +25.5% |
| DAVIS 2017 | J&F | 92.0 | 90.7 | +1.4% |
| LVOSv2 | J&F | 88.2 | 79.6 | +10.8% |
| SA-V | J&F | 84.6 | 78.4 | +7.9% |
| YTVOS19 | J&F | 89.6 | 89.3 | +0.3% |
Az Örnekli Uyarlama#
SAM 3, veri merkezli yapay zeka iş akışlarıyla ilgili olarak, yeni alanlara çok az örnekle uyarlanmada başarılıdır:
| Kıyaslama | 0 örnekli AP | 10 örnekli AP | Önceki En İyi (10 örnekli) |
|---|---|---|---|
| ODinW13 | 59.9 | 71.6 | 67.9 (gDino1.5-Pro) |
| RF100-VL | 14.3 | 35.7 | 33.7 (gDino-T) |
Etkileşimli İyileştirmenin Etkinliği#
SAM 3'ün örneklerle kavram tabanlı istem kullanımı, görsel istem kullanımına kıyasla çok daha hızlı yakınsar:
| Eklenen İstemler | CGF1 Skoru | Yalnızca Metne Göre Kazanç | PVS Taban Çizgisine Göre Kazanç |
|---|---|---|---|
| Yalnızca metin | 46.4 | taban çizgisi | taban çizgisi |
| +1 örnek | 57.6 | +11.2 | +6.7 |
| +2 örnek | 62.2 | +15.8 | +9.7 |
| +3 örnek | 65.0 | +18.6 | +11.2 |
| +4 örnek | 65.7 | +19.3 | +11.5 (plato) |
Nesne Sayma Doğruluğu#
SAM 3, nesne sayma için yaygın bir gereksinim olan tüm örnekleri segmente ederek doğru sayım sağlar:
| Kıyaslama | Doğruluk | MAE | En İyi MLLM'ye Göre |
|---|---|---|---|
| CountBench | 95.6% | 0.11 | %92.4 (Gemini 2.5) |
| PixMo-Count | 87.3% | 0.22 | %88.8 (Molmo-72B) |
SAM 3 ve SAM 2 ile YOLO Karşılaştırması#
Burada SAM 3'ün yeteneklerini SAM 2 ve YOLO26 modelleriyle karşılaştırıyoruz. Aynı tür istemlerden gerçek zamanlı, açık kelime dağarcıklı algılama ve segmentasyon için YOLOE sayfasına bak:
| Yetenek | SAM 3 | SAM 2 | YOLO26n-seg |
|---|---|---|---|
| Kavram Segmentasyonu | ✅ Metin/örneklerden tüm örnekler | ❌ Desteklenmiyor | ❌ Desteklenmiyor |
| Görsel Segmentasyon | ✅ Tek örnek (SAM 2 uyumlu) | ✅ Tek örnek | ✅ Tüm örnekler |
| Sıfır Örnekli Yetenek | ✅ Açık kelime dağarcığı | ✅ Geometrik istemler | ❌ Kapalı küme |
| Etkileşimli İyileştirme | ✅ Örnekler + tıklamalar | ✅ Yalnızca tıklamalar | ❌ Desteklenmiyor |
| Video Takibi | ✅ Kimliklerle çoklu nesne | ✅ Çoklu nesne | ✅ Çoklu nesne |
| LVIS Maske AP (sıfır atışlı) | 47.0 | N/A | N/A |
| MOSEv2 J&F | 60.1 | 47.9 | N/A |
| Hız (GPU, ms/im) | 2921 | 857 | 8.4 |
| Model Boyutu | 3.45 GB | 162 MB (temel) | 6.4 MB |
Hız, torch==2.9.1 ve ultralytics==8.4.19 kullanılarak NVIDIA RTX PRO 6000 üzerinde kıyaslanmıştır.
Önemli Çıkarımlar:
- SAM 3: Açık kelime dağarcıklı kavram segmentasyonu ve metin ya da örnek istemleriyle bir kavramın tüm örneklerini bulmak için en iyisi
- SAM 2: Görüntülerde ve videolarda geometrik istemlerle etkileşimli tek nesne segmentasyonu için en iyisi
- YOLO26: GPU'lar, CPU'lar ve uç cihazlarda dağıtım için birçok biçime aktarılabilir isteğe bağlı NMS'siz uçtan uca çıkarımla gerçek zamanlı, yüksek hızlı bölütleme için en iyisi
SAM ile YOLO Karşılaştırması#
SAM 3, SAM 2, SAM, MobileSAM ve FastSAM ile Ultralytics YOLO segmentasyon modellerinin (YOLOv8, YOLO11, YOLO26) boyut, parametre ve GPU çıkarım hızı açısından karşılaştırması:
| Model | Boyut (MB) | Parametreler (M) | Hız (GPU) (ms/im) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 1306 |
| Meta SAM2-b | 162 | 80.8 | 857 |
| Meta SAM2-t | 78.1 | 38.9 | 668 |
| Meta SAM3 | 3450 | 473.6 | 2921 |
| MobileSAM | 40.7 | 10.1 | 605 |
| YOLOv8 omurgası ile FastSAM-s | 23.7 | 11.8 | 55.9 |
| Ultralytics YOLOv8n-seg | 6.7 (515 kat daha küçük) | 3.4 (139.1 kat daha az) | 17.4 (167 kat daha hızlı) |
| Ultralytics YOLO11n-seg | 5.9 (585 kat daha küçük) | 2.9 (163.1 kat daha az) | 12.6 (231 kat daha hızlı) |
| Ultralytics YOLO26n-seg | 6.4 (539 kat daha küçük) | 2.7 (175.2 kat daha az) | 8.4 (347 kat daha hızlı) |
Bu karşılaştırma, SAM varyantları ile YOLO segmentasyon modelleri arasındaki model boyutları ve hızlardaki önemli farkları ortaya koyar. SAM benzersiz otomatik segmentasyon yetenekleri sunarken, özellikle YOLOv8n-seg, YOLO11n-seg ve YOLO26n-seg olmak üzere YOLO modelleri önemli ölçüde daha küçük, daha hızlı ve hesaplama açısından daha verimlidir.
Testler, torch==2.9.1 ve ultralytics==8.4.19 kullanılarak 96 GB VRAM'e sahip NVIDIA RTX PRO 6000 üzerinde gerçekleştirilmiştir. Bu testi yeniden oluşturmak için:
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# Profile SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# Profile YOLO models
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
model(ASSETS, nms=False) # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11Değerlendirme Metrikleri#
SAM 3, tanıdık F1 skoru, kesinlik ve duyarlılık ölçülerini tamamlayan, PCS görevi için tasarlanmış yeni metrikler sunar.
Sınıflandırma Geçişli F1 (CGF1)#
Konumlandırma ve sınıflandırmayı birleştiren birincil metrik:
CGF1 = 100 × pmF1 × IL_MCC
Burada:
- pmF1 (Pozitif Makro F1): Pozitif örneklerdeki konumlandırma kalitesini ölçer
- IL_MCC (Görüntü Düzeyi Matthews Korelasyon Katsayısı): İkili sınıflandırma doğruluğunu ölçer ("kavram mevcut mu?")
Bu Metrikler Neden Kullanılıyor?#
Geleneksel AP metrikleri kalibrasyonu hesaba katmaz ve bu durum modellerin pratikte kullanılmasını zorlaştırır. SAM 3'ün metrikleri yalnızca 0.5'in üzerindeki güven değerine sahip tahminleri değerlendirerek iyi kalibrasyonu zorunlu kılar ve etkileşimli predict ve track döngülerindeki gerçek dünya kullanım modellerini taklit eder.
Temel Ablasyonlar ve İçgörüler#
Varlık Başlığının Etkisi#
Varlık başlığı, tanımayı konumlandırmadan ayırarak önemli iyileştirmeler sağlar:
| Yapılandırma | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| Varlık başlığı olmadan | 57.6 | 0.77 | 74.7 |
| Varlık başlığıyla | 63.3 | 0.82 | 77.1 |
Varlık başlığı, temel olarak tanıma yeteneğini iyileştirerek +5.7 CGF1 artışı (+%9.9) sağlar (IL_MCC +%6.5).
Zor Negatiflerin Etkisi#
| Zor Negatifler/Görüntü | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| 0 | 31.8 | 0.44 | 70.2 |
| 5 | 44.8 | 0.62 | 71.9 |
| 30 | 49.2 | 0.68 | 72.3 |
Zor negatifler, açık kelime dağarcıklı tanıma için kritik öneme sahiptir ve IL_MCC'yi %54.5 oranında artırır (0.44 → 0.68).
Eğitim Verilerinin Ölçeklendirilmesi#
| Veri Kaynakları | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| Yalnızca harici | 30.9 | 0.46 | 66.3 |
| Harici + Sentetik | 39.7 | 0.57 | 70.6 |
| Harici + Yüksek kaliteli | 51.8 | 0.71 | 73.2 |
| Üçünün tamamı | 54.3 | 0.74 | 73.5 |
Yüksek kaliteli insan açıklamaları, yalnızca sentetik veya harici verilere kıyasla büyük kazanımlar sağlar. Veri kalitesi uygulamaları hakkında arka plan bilgisi için veri toplama ve açıklama sayfasına bak.
Uygulamalar#
SAM 3'ün kavram segmentasyonu yeteneği yeni kullanım alanlarını mümkün kılar:
- İçerik Moderasyonu: Medya kitaplıkları genelinde belirli içerik türlerinin tüm örneklerini bulma
- E-ticaret: Katalog görüntülerindeki belirli bir türe ait tüm ürünleri segmentlere ayırma ve otomatik açıklamayı destekleme
- Tıbbi Görüntüleme: Belirli doku türlerinin veya anormalliklerin tüm oluşumlarını belirleme
- Otonom Sistemler: Trafik işaretlerinin, yayaların veya araçların tüm örneklerini kategoriye göre takip etme
- Video Analitiği: Belirli kıyafetleri giyen veya belirli eylemleri gerçekleştiren tüm insanları sayma ve takip etme
- Veri Kümesi Açıklama: Nadir nesne kategorilerinin tüm örneklerini hızla açıklama
- Bilimsel Araştırma: Belirli ölçütleri karşılayan tüm örnekleri nicel olarak değerlendirme ve analiz etme
SAM 3 Agent: Genişletilmiş Dil Akıl Yürütme#
SAM 3, OWLv2 ve T-Rex gibi açık kelime dağarcıklı sistemlere benzer şekilde, akıl yürütme gerektiren karmaşık sorguları işlemek için Çok Modlu Büyük Dil Modelleri (MLLMs) ile birleştirilebilir.
Akıl Yürütme Görevlerindeki Performans#
| Kıyaslama | Ölçüt | SAM 3 Agent (Gemini 2.5 Pro) | Önceki En İyi |
|---|---|---|---|
| ReasonSeg (doğrulama) | gIoU | 76.0 | 65.0 (SoTA) |
| ReasonSeg (test) | gIoU | 73.8 | 61.3 (SoTA) |
| OmniLabel (doğrulama) | AP | 46.7 | 36.5 (REAL) |
| RefCOCO+ | Acc | 91.2 | 89.3 (LISA) |
Karmaşık Sorgu Örnekleri#
SAM 3 Agent, akıl yürütme gerektiren sorguları işleyebilir:
- "Oturmuş ancak ellerinde hediye kutusu tutmayan insanlar"
- "Kameraya en yakın olan ve tasma takmayan köpek"
- "Kişinin elinden daha büyük kırmızı nesneler"
MLLM, SAM 3'e basit isim öbeği sorguları önerir, döndürülen maskeleri analiz eder ve memnun kalana kadar yinelemeye devam eder.
Sınırlamalar#
SAM 3 önemli bir ilerlemeyi temsil etse de bazı sınırlamaları vardır:
- İfade Karmaşıklığı: Basit isim öbekleri için en uygunudur; uzun gönderimsel ifadeler veya karmaşık akıl yürütme MLLM entegrasyonu gerektirebilir
- Belirsizlik İşleme: Bazı kavramlar doğası gereği belirsiz kalır (ör. "küçük pencere", "kullanışlı oda")
- Hesaplama Gereksinimleri: YOLO gibi özelleştirilmiş algılama modellerinden daha büyük ve daha yavaştır
- Kelime Dağarcığı Kapsamı: Atomik görsel kavramlara odaklanır; MLLM desteği olmadan bileşimsel akıl yürütme sınırlıdır
- Nadir Kavramlar: Eğitim verilerinde yeterince temsil edilmeyen son derece nadir veya ince ayrıntılı kavramlarda performans düşebilir
Atıf#
@misc{carion2025sam3,
title = {SAM 3: Segment Anything with Concepts},
author = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
year = {2025},
eprint = {2511.16719},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2511.16719}
}SSS#
SAM 3, Meta tarafından 19 Kasım 2025 tarihinde yayınlanmış olup predict mode ve track mode desteğiyle
ultralyticspaketine tamamen entegre edilmiştir.Evet! SAM 3, kavram segmentasyonu, SAM 2 tarzı görsel yönlendirmeler ve çoklu nesne video takibi dahil olmak üzere Ultralytics Python paketine tamamen entegre edilmiştir. SAM 3 ve SAM 3.1 ayrıca Ultralytics Platform üzerindeki akıllı etiketleme özelliğine de güç verir; burada SAM 3.1 varsayılan modeldir ve görselleri yalnızca birkaç tıklamayla etiketleyebilirsin.
Evet, görsel tahmini için. Bu sayfadaki görsel örneklerinin
sam3.ptkullandığı her yerdesam3.1_multiplex.ptyükle; nokta ve kutu yönlendirmeleri içinSAM("sam3.1_multiplex.pt"), metin ve örnek yönlendirmeleri için iseSAM3SemanticPredictorkullan. Nesne Çoğullama video takibi henüz desteklenmiyor, bu nedenle video tahmin edicileriylesam3.ptkullanmaya devam et. Meta'nın kıyaslamaları için SAM 3.1 sayfasına göz at.PCS, SAM 3'te tanıtılan ve bir görüntü veya videodaki görsel bir kavramın tüm örneklerini segmente eden yeni bir görevdir. Belirli bir nesne örneğini hedefleyen geleneksel segmentasyonun aksine PCS, bir kategorinin her oluşumunu bulur. Örneğin:
- Metin istemi: "sarı okul otobüsü" → sahnedeki tüm sarı okul otobüslerini segmente eder
- Görüntü örneği: Bir köpeğin çevresine çizilen kutu → görüntüdeki tüm köpekleri segmente eder
- Birleşik: "çizgili kedi" + örnek kutusu → örnekle eşleşen tüm çizgili kedileri segmente eder
Nesne algılama ve örnek segmentasyonu hakkında ilgili arka plan bilgilerine göz at.
Özellik SAM 2 SAM 3 Görev İstem başına tek nesne Bir kavramın tüm örnekleri İstem Türleri Noktalar, kutular, maskeler + Metin ifadeleri, görüntü örnekleri Algılama Yeteneği Harici algılayıcı gerektirir Yerleşik açık kelime dağarcıklı algılayıcı Tanıma Yalnızca geometri tabanlı Metin ve görsel tanıma Mimari Yalnızca izleyici Varlık başlığına sahip algılayıcı + izleyici Sıfır Örnekli Performans Uygulanamaz (görsel istemler gerektirir) LVIS'te 47.0 AP, SA-Co'da 2 kat daha iyi Etkileşimli İyileştirme Yalnızca tıklamalar Tıklamalar + örnek genellemesi SAM 3, kavram tabanlı yetenekler eklerken SAM 2 görsel istemleriyle geriye dönük uyumluluğu korur.
SAM 3, Kavramlarla Her Şeyi Segment Et (SA-Co) veri kümesiyle eğitilir:
Eğitim Verileri:
- 5,2 milyon görüntü ve 4 milyon benzersiz isim öbeği (SA-Co/HQ) - yüksek kaliteli insan açıklamaları
- 52,5 bin video ve 24,8 bin benzersiz isim öbeği (SA-Co/VIDEO)
- 38 milyon isim öbeğinde toplam 1,4 milyar sentetik maske (SA-Co/SYN)
- Zor negatiflerle zenginleştirilmiş 15 harici veri kümesi (SA-Co/EXT)
Karşılaştırma Verileri:
- 126 bin görüntü/video genelinde 214 bin benzersiz kavram
- Mevcut karşılaştırma ölçütlerinden 50 kat daha fazla kavram (ör. LVIS'te ~4 bin kavram bulunur)
- İnsan performansı sınırlarını ölçmek için SA-Co/Gold üzerinde üçlü açıklama
Bu muazzam ölçek ve çeşitlilik, SAM 3'ün açık kelime dağarcığındaki kavramlar arasında üstün sıfır örnekli genelleme yapabilmesini sağlar.
SAM 3 ve YOLO26 farklı kullanım alanlarına hizmet eder:
SAM 3'ün Avantajları:
- Açık kelime dağarcığı: Eğitim gerektirmeden metin istemleri aracılığıyla herhangi bir kavramı segmente eder
- Sıfır örnekli: Yeni kategoriler üzerinde hemen çalışır
- Etkileşimli: Örnek tabanlı iyileştirme benzer nesnelere genellenir
- Kavram tabanlı: Bir kategorinin tüm örneklerini otomatik olarak bulur
- Doğruluk: LVIS sıfır örnekli örnek segmentasyonunda 47.0 AP
YOLO26'nın Avantajları:
- Hız: İsteğe bağlı NMS'siz uçtan uca başlık ile kat kat daha hızlı çıkarım
- Verimlilik: 539 kat daha küçük modeller (6,4 MB ve 3,45 GB'ye kıyasla)
- Kaynak dostu: Uç cihazlarda ve mobil cihazlarda çalışır
- Gerçek zamanlı: Üretim dağıtımları için optimize edilmiştir
Öneri:
- Metin veya örneklerle açıklanan kavramların tüm örneklerini bulman gereken esnek, açık kelime dağarcıklı segmentasyon için SAM 3 kullan
- Kategorilerin önceden bilindiği yüksek hızlı üretim dağıtımları için YOLO26 kullan
- Geometrik istemlerle etkileşimli tek nesne segmentasyonu için SAM 2 kullan
SAM 3, basit isim öbekleri (ör. "kırmızı elma", "şapka takan kişi") için tasarlanmıştır. Akıl yürütme gerektiren karmaşık sorgular için SAM 3'ü SAM 3 Agent olarak bir MLLM ile birleştir:
Basit sorgular (yerel SAM 3):
- "sarı okul otobüsü"
- "çizgili kedi"
- "kırmızı şapka takan kişi"
Karmaşık sorgular (MLLM içeren SAM 3 Agent):
- "Oturup hediye kutusu tutmayan kişiler"
- "Tasması olmayan ve kameraya en yakın köpek"
- "Kişinin elinden daha büyük kırmızı nesneler"
SAM 3 Agent, SAM 3'ün segmentasyonunu MLLM akıl yürütme yetenekleriyle birleştirerek ReasonSeg doğrulamasında 76.0 gIoU elde eder (önceki en iyi değer 65.0, iyileşme +%16,9).
Üçlü insan açıklamasına sahip SA-Co/Gold karşılaştırmasında:
- İnsan alt sınırı: 74.2 CGF1 (en tutucu açıklayıcı)
- SAM 3 performansı: 65.0 CGF1
- Başarı: Tahmini insan alt sınırının %88'i
- İnsan üst sınırı: 81.4 CGF1 (en hoşgörülü açıklayıcı)
SAM 3, açık kelime dağarcıklı kavram segmentasyonunda insan düzeyindeki doğruluğa yaklaşan güçlü bir performans elde eder; aradaki fark temel olarak belirsiz veya öznel kavramlarda görülür (ör. "küçük pencere", "kullanışlı oda").