Ultralytics YOLO27:

SAM 3: Segment Anything mit Konzepten#

Übersicht der promptbaren Konzeptsegmentierung mit SAM 3

SAM 3 (Segment Anything Model 3) ist Metas veröffentlichtes Basismodell für Promptable Concept Segmentation (PCS). Aufbauend auf SAM 2 führt SAM 3 eine grundlegend neue Fähigkeit ein: Es erkennt, segmentiert und verfolgt alle Instanzen eines visuellen Konzepts, das durch Text-Prompts, Bildbeispiele oder beides vorgegeben wird. Im Gegensatz zu früheren SAM-Versionen, die pro Prompt einzelne Objekte segmentieren, kann SAM 3 jedes Vorkommen eines Konzepts in Bildern oder Videos finden und segmentieren und entspricht damit den Open-Vocabulary-Zielen der modernen Instanzsegmentierung.



Watch: How to Use Meta Segment Anything 3 with Ultralytics | Text-Prompt Segmentation on Images & Videos

SAM 3 ist vollständig in das Paket ultralytics integriert und bietet native Unterstützung für die Konzeptsegmentierung mit Texteingaben, Bildbeispieleingaben und Videotracking. Der neuere SAM 3.1-Checkpunkt wird für die Bildvorhersage unterstützt.

Übersicht#

SAM 3 erzielt bei Promptable Concept Segmentation einen 2× höheren Leistungswert als bestehende Systeme und erhält beziehungsweise verbessert dabei die Fähigkeiten von SAM 2 für interaktive visuelle Segmentierung. Das Modell ist besonders leistungsfähig bei der Open-Vocabulary-Segmentierung: Du kannst Konzepte mit einfachen Nominalphrasen angeben, etwa „yellow school bus“ oder „striped cat“, oder Beispielbilder des Zielobjekts bereitstellen. Diese Fähigkeiten ergänzen produktionsreife Pipelines, die auf optimierten predict- und track-Workflows basieren.

Beispiele für die Segmentierung mit SAM-3-Text-Prompts

Was ist Promptable Concept Segmentation (PCS)?#

Die PCS-Aufgabe nimmt einen Konzept-Prompt als Eingabe und gibt Segmentierungsmasken mit eindeutigen Identitäten für alle passenden Objektinstanzen zurück. Konzept-Prompts können sein:

  • Text: Einfache Nominalphrasen wie „red apple“ oder „person wearing a hat“, ähnlich wie beim Zero-Shot-Lernen
  • Bildbeispiele: Begrenzungsrahmen um Beispielobjekte (positiv oder negativ) zur schnellen Verallgemeinerung
  • Kombiniert: Text und Bildbeispiele zusammen für präzise Kontrolle

Dies unterscheidet sich von herkömmlichen visuellen Prompts (Punkte, Rahmen, Masken), die nur eine einzelne, spezifische Objektinstanz segmentieren, wie es durch die ursprüngliche SAM-Familie bekannt wurde.

Wichtige Leistungskennzahlen#

KennzahlErgebnis von SAM 3
LVIS Zero-Shot Mask AP47,0 (gegenüber dem bisherigen Bestwert von 38,5, Verbesserung um +22 %)
SA-Co-Benchmark2× besser als bestehende Systeme
Inferenzgeschwindigkeit (H200 GPU)30 ms pro Bild bei mehr als 100 erkannten Objekten
VideoleistungNahezu in Echtzeit für ~5 gleichzeitig verfolgte Objekte
MOSEv2-VOS-Benchmark60,1 J&F (+25,5 % gegenüber SAM 2.1, +17 % gegenüber dem bisherigen SOTA)
Interaktive VerfeinerungVerbesserung um +18,6 CGF1 nach 3 Beispiel-Prompts
Abstand zur menschlichen LeistungErreicht 88 % der geschätzten unteren Grenze auf SA-Co/Gold

Informationen zu Modellmetriken und Zielkonflikten in der Produktion findest du unter Erkenntnisse zur Modellevaluierung und YOLO-Leistungsmetriken.

SAM 3.1#

SAM 3.1, veröffentlicht von Meta am 27. März 2026, ist ein neuer SAM 3-Checkpunkt, der Object Multiplex hinzufügt, einen Shared-Memory-Ansatz für das Multi-Objekt-Videotracking. Anstatt jedes verfolgte Objekt unabhängig zu verarbeiten, gruppiert SAM 3.1 Objekte in Buckets mit fester Kapazität und verarbeitet sie gemeinsam, was laut Meta bei 128 Objekten auf einer einzelnen H100 GPU zu einer ~7-fachen Beschleunigung führt. Der Bilddetektor und der interaktive Punkt-Prompt-Kopf behalten die SAM 3-Architektur bei.

BenchmarkKennzahlSAM 3SAM 3.1
SA-Co/VEval SA-V (Test)cgF130.330.5
SA-Co/VEval YT-Temporal-1B (Test)cgF150.852.9
SA-Co/VEval SmartGlasses (Test)cgF136.436.3
MOSEv1 (Val)J&F78.479.6
DAVIS17 (Val)J&F92.292.7
SA-V (Test)J&F84.485.1
YTVOS19 (Val)G89.789.3
MOSEv2 (Val)J&Ḟ60.362.3

Ultralytics lädt den SAM 3.1-Checkpunkt (sam3.1_multiplex.pt) in die SAM 3-Bildprädiktoren: SAM("sam3.1_multiplex.pt") für Punkt- und Box-Prompts sowie SAM3SemanticPredictor für Text- und Beispiel-Prompts. Object Multiplex-Videotracking wird noch nicht unterstützt, verwende daher weiterhin sam3.pt mit SAM3VideoPredictor und SAM3VideoSemanticPredictor.

Architektur#

SAM 3 besteht aus einem Detektor und einem Tracker, die sich einen visuellen Perception Encoder (PE) als Backbone teilen. Dieses entkoppelte Design vermeidet Zielkonflikte und ermöglicht gleichzeitig die Detektion auf Bildebene und das Tracking auf Videoebene, mit einer Schnittstelle, die mit der Python-Nutzung und CLI-Nutzung von Ultralytics kompatibel ist.

Zentrale Komponenten#

  • Detektor: DETR-basierte Architektur zur Konzeptdetektion auf Bildebene

    • Text-Encoder für Prompts in Form von Nominalphrasen
    • Beispiel-Encoder für bildbasierte Prompts
    • Fusion-Encoder zur Konditionierung von Bildmerkmalen anhand der Prompts
    • Neuer Presence Head, der Erkennung („was“) und Lokalisierung („wo“) entkoppelt
    • Masken-Head zur Erzeugung von Instanzsegmentierungsmasken
  • Tracker: Auf SAM 2 basierende, speicherbasierte Videosegmentierung

    • Prompt-Encoder, Masken-Decoder, Speicher-Encoder
    • Speicherbank zum Speichern des Objekt-Erscheinungsbilds über mehrere Frames hinweg
    • Zeitliche Disambiguierung, unterstützt durch Techniken wie einen Kalman-Filter in Szenarien mit mehreren Objekten
  • Presence Token: Ein gelernter globaler Token, der vorhersagt, ob das Zielkonzept im Bild oder Frame vorhanden ist, und die Detektion verbessert, indem er Erkennung und Lokalisierung voneinander trennt.

Diagramm der SAM-3-Modellarchitektur

Wichtige Innovationen#

  1. Entkoppelte Erkennung und Lokalisierung: Der Presence Head sagt global voraus, ob das Konzept vorhanden ist, während sich Proposal-Queries ausschließlich auf die Lokalisierung konzentrieren und so widersprüchliche Ziele vermeiden.
  2. Vereinheitlichte Konzept- und visuelle Prompts: Unterstützt PCS (Konzept-Prompts) und PVS (visuelle Prompts wie Klicks und Rahmen aus SAM 2) in einem einzigen Modell.
  3. Interaktive Verfeinerung mit Bildbeispielen: Du kannst positive oder negative Bildbeispiele hinzufügen, um die Ergebnisse schrittweise zu verfeinern. Das Modell verallgemeinert dabei auf ähnliche Objekte, anstatt nur einzelne Instanzen zu korrigieren.
  4. Zeitliche Disambiguierung: Verwendet Detektionswerte von Masklets und regelmäßige neue Prompts, um Verdeckungen, überfüllte Szenen und Tracking-Fehler in Videos zu bewältigen, entsprechend den Best Practices für Instanzsegmentierung und Tracking.

SA-Co-Datensatz#

SAM 3 wird mit Segment Anything with Concepts (SA-Co) trainiert, Metas bislang größtem und vielfältigstem Segmentierungsdatensatz, der über gängige Benchmarks wie COCO und LVIS hinausgeht.

Trainingsdaten#

DatensatzkomponenteBeschreibungUmfang
SA-Co/HQHochwertige, von Menschen annotierte Bilddaten aus einer Datenpipeline mit 4 Phasen5,2 Mio. Bilder, 4 Mio. eindeutige Nominalphrasen
SA-Co/SYNSynthetischer Datensatz, der ohne menschliche Beteiligung durch KI annotiert wurde38 Mio. Nominalphrasen, 1,4 Mrd. Masken
SA-Co/EXT15 externe Datensätze, angereichert mit schwierigen NegativbeispielenJe nach Quelle unterschiedlich
SA-Co/VIDEOVideoannotationen mit zeitlichem Tracking52,5 Tsd. Videos, 24,8 Tsd. eindeutige Nominalphrasen

Benchmarkdaten#

Der SA-Co-Evaluierungsbenchmark enthält 214 Tsd. eindeutige Phrasen aus 126 Tsd. Bildern und Videos und bietet damit über 50× mehr Konzepte als bestehende Benchmarks. Er umfasst:

  • SA-Co/Gold: 7 Domänen, dreifach annotiert zur Messung der Grenzen menschlicher Leistung
  • SA-Co/Silver: 10 Domänen, jeweils einmal von Menschen annotiert
  • SA-Co/Bronze und SA-Co/Bio: 9 bestehende Datensätze, angepasst für die Konzeptsegmentierung
  • SA-Co/VEval: Videobenchmark mit 3 Domänen (SA-V, YT-Temporal-1B, SmartGlasses)

Innovationen der Datenpipeline#

Die skalierbare Datenpipeline von SAM 3 mit Menschen und Modellen im Regelkreis erzielt durch folgende Maßnahmen einen 2× höheren Annotierungsdurchsatz:

  1. KI-Annotatoren: Auf Llama basierende Modelle schlagen vielfältige Nominalphrasen vor, darunter schwierige Negativbeispiele
  2. KI-Verifizierer: Feinabgestimmte multimodale LLMs überprüfen Maskenqualität und Vollständigkeit mit nahezu menschlicher Leistung
  3. Aktives Mining: Konzentriert den menschlichen Aufwand auf anspruchsvolle Fehlerfälle, bei denen die KI Schwierigkeiten hat
  4. Ontologiebasiert: Nutzt eine große, auf Wikidata gestützte Ontologie für eine umfassende Konzeptabdeckung

Installation#

Installiere oder aktualisiere das ultralytics-Paket:

pip install -U ultralytics
SAM-3-Modellgewichte erforderlich

Im Gegensatz zu anderen Ultralytics-Modellen werden die SAM-3-Gewichte (sam3.pt) nicht automatisch heruntergeladen. Du musst zunächst auf der SAM-3-Modellseite auf Hugging Face Zugriff auf die Modellgewichte anfordern und anschließend nach der Genehmigung sam3.pt von dieser Seite herunterladen. Lege die heruntergeladene Datei sam3.pt in deinem Arbeitsverzeichnis ab oder gib beim Laden des Modells den vollständigen Pfad an.

SAM 3.1-Gewichte (sam3.1_multiplex.pt) sind auf der SAM 3.1-Modellseite auf dieselbe Weise geschützt. Übergebe sam3.1_multiplex.pt überall dort, wo die Bildbeispiele unten sam3.pt verwenden.

`TypeError: 'SimpleTokenizer' object is not callable`

Wenn dieser Fehler während der Vorhersage auftritt, ist das falsche Paket clip installiert. Installiere das korrekte Paket clip, indem du Folgendes ausführst:

pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.git

So verwendest du SAM 3: Vielseitigkeit bei der Konzeptsegmentierung#

SAM 3 unterstützt die Aufgaben Promptable Concept Segmentation (PCS) und Promptable Visual Segmentation (PVS) über unterschiedliche Predictor-Schnittstellen:

Unterstützte Aufgaben und Modelle#

AufgabentypPrompt-TypenAusgabe
Konzeptsegmentierung (PCS)Text (Nominalphrasen), BildbeispieleAlle zum Konzept passenden Instanzen
Visuelle Segmentierung (PVS)Punkte, Rahmen, MaskenEinzelne Objektinstanz (im Stil von SAM 2)
Interaktive VerfeinerungBeispiele oder Klicks schrittweise hinzufügen beziehungsweise entfernenVerfeinerte Segmentierung mit verbesserter Genauigkeit

Beispiele für Konzeptsegmentierung#

Segmentierung mit Text-Prompts#

Textbasierte Konzeptsegmentierung

Finde mithilfe einer Textbeschreibung alle Instanzen eines Konzepts und segmentiere sie. Für Text-Prompts ist die Schnittstelle SAM3SemanticPredictor erforderlich.

from ultralytics.models.sam import SAM3SemanticPredictor

# Initialize predictor with configuration
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "model": "sam3.pt",
    "quantize": 16,  # Use FP16 for faster inference
    "save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Set image once for multiple queries
predictor.set_image("path/to/image.jpg")

# Query with multiple text prompts
results = predictor(text=["person", "bus", "glasses"])

# Works with descriptive phrases
results = predictor(text=["person with red cloth", "person with blue cloth"])

# Query with a single concept
results = predictor(text=["a person"])

Segmentierung mit Bildbeispielen#

Segmentierung auf Basis von Bildbeispielen

Verwende Begrenzungsrahmen als visuelle Prompts, um alle ähnlichen Instanzen zu finden. Dies erfordert für den konzeptbasierten Abgleich ebenfalls SAM3SemanticPredictor.

from ultralytics.models.sam import SAM3SemanticPredictor

# Initialize predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Set image
predictor.set_image("path/to/image.jpg")

# Provide bounding box examples to segment similar objects
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])

# Multiple bounding boxes as exemplars of the same visual concept
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])

Merkmalsbasierte Inferenz für mehr Effizienz#

Bildmerkmale für mehrere Abfragen wiederverwenden

Extrahiere die Bildmerkmale einmal und verwende sie für mehrere Segmentierungsabfragen wieder, um die Effizienz zu verbessern.

import cv2

from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors

# Initialize predictors
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)

# Extract features from the first predictor
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]

# Setup second predictor and reuse features
predictor2.setup_model()

# Perform inference using shared features with text prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])

# Perform inference using shared features with bounding box prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])

# Visualize results
if masks is not None:
    masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
    im = cv2.imread(source)
    annotator = Annotator(im, pil=False)
    annotator.masks(masks, [colors(x, True) for x in range(len(masks))])

    cv2.imshow("result", annotator.result())
    cv2.waitKey(0)

Videokonzeptsegmentierung#

Konzepte im Video mithilfe von Begrenzungsrahmen verfolgen#

Videoverfolgung mit visuellen Prompts

Erkenne und verfolge Objektinstanzen über mehrere Videobilder hinweg mithilfe von Begrenzungsrahmen-Prompts.

from ultralytics.models.sam import SAM3VideoPredictor

# Create video predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)

# Track objects using bounding box prompts
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)

# Process and display results
for r in results:
    r.show()  # Display frame with segmentation masks

Konzepte mit Text-Prompts verfolgen#

Videoverfolgung mit semantischen Abfragen

Verfolge alle Instanzen der durch Text angegebenen Konzepte über mehrere Videobilder hinweg.

from ultralytics.models.sam import SAM3VideoSemanticPredictor

# Initialize semantic video predictor
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "imgsz": 640,
    "model": "sam3.pt",
    "quantize": 16,
    "save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)

# Track concepts using text prompts
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)

# Process results
for r in results:
    r.show()  # Display frame with tracked objects

# Alternative: Track with bounding box prompts
results = predictor(
    source="path/to/video.mp4",
    bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
    labels=[1, 1],  # Positive labels
    stream=True,
)

Visuelle Prompts (Kompatibilität mit SAM 2)#

SAM 3 ist für die visuellen Prompts von SAM 2 zur Segmentierung einzelner Objekte vollständig abwärtskompatibel:

Visuelle Prompts im Stil von SAM 2

Die grundlegende Schnittstelle SAM verhält sich genau wie SAM 2 und segmentiert nur den durch visuelle Prompts (Punkte, Begrenzungsrahmen oder Masken) angegebenen Bereich.

from ultralytics import SAM

model = SAM("sam3.pt")

# Single point prompt - segments object at specific location
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()

# Multiple points - segments single object with multiple point hints
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])

# Box prompt - segments object within bounding box
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()
Visuelle Prompts im Vergleich zur Konzeptsegmentierung

Wenn du SAM("sam3.pt") mit visuellen Prompts (Punkten/Begrenzungsrahmen/Masken) verwendest, wird wie bei SAM 2 nur das spezifische Objekt an dieser Position segmentiert. Um alle Instanzen eines Konzepts zu segmentieren, verwende SAM3SemanticPredictor mit Text- oder Beispielbild-Prompts wie oben gezeigt.

Leistungsbenchmarks#

Bildsegmentierung#

SAM 3 erzielt bei mehreren Benchmarks Ergebnisse auf dem neuesten Stand der Technik, darunter praxisnahe Datensätze wie LVIS und COCO zur Segmentierung:

BenchmarkKennzahlSAM 3Bisheriger BestwertVerbesserung
LVIS (Zero-Shot)Masken-AP47.038.5+22.1%
SA-Co/GoldCGF165.034.3 (OWLv2)+89.5%
COCO (Zero-Shot)Box-AP53.552.2 (T-Rex2)+2.5%
ADE-847 (semantische Segmentierung)mIoU14.79.2 (APE-D)+59.8%
PascalConcept-59mIoU59.458.5 (APE-D)+1.5%
Cityscapes (semantische Segmentierung)mIoU65.144.2 (APE-D)+47.3%

Entdecke Optionen für Datensätze zum schnellen Experimentieren in Ultralytics-Datensätzen.

Leistung bei der Videosegmentierung#

SAM 3 zeigt gegenüber SAM 2 und dem bisherigen Stand der Technik deutliche Verbesserungen bei Videobenchmarks wie DAVIS 2017 und YouTube-VOS:

BenchmarkKennzahlSAM 3SAM 2.1 LVerbesserung
MOSEv2J&F60.147.9+25.5%
DAVIS 2017J&F92.090.7+1.4%
LVOSv2J&F88.279.6+10.8%
SA-VJ&F84.678.4+7.9%
YTVOS19J&F89.689.3+0.3%

Few-Shot-Anpassung#

SAM 3 eignet sich hervorragend für die Anpassung an neue Domänen mit nur wenigen Beispielen, was für Workflows im Bereich der datenzentrierten KI relevant ist:

BenchmarkAP mit 0 BeispielenAP mit 10 BeispielenBisheriger Bestwert (10 Beispiele)
ODinW1359.971.667.9 (gDino1.5-Pro)
RF100-VL14.335.733.7 (gDino-T)

Wirksamkeit der interaktiven Verfeinerung#

Die konzeptbasierte Prompt-Verwendung von SAM 3 mit Beispielbildern konvergiert deutlich schneller als die Verwendung visueller Prompts:

Hinzugefügte PromptsCGF1-WertGewinn gegenüber nur TextGewinn gegenüber der PVS-Baseline
Nur Text46.4BaselineBaseline
+1 Beispielbild57.6+11.2+6.7
+2 Beispielbilder62.2+15.8+9.7
+3 Beispielbilder65.0+18.6+11.2
+4 Beispielbilder65.7+19.3+11.5 (Plateau)

Genauigkeit der Objekterkennung und -zählung#

SAM 3 ermöglicht eine präzise Zählung, indem alle Instanzen segmentiert werden – eine häufige Anforderung bei der Objektzählung:

BenchmarkGenauigkeitMAEgegenüber dem besten MLLM
CountBench95.6%0.1192.4 % (Gemini 2.5)
PixMo-Count87.3%0.2288.8% (Molmo-72B)

Vergleich von SAM 3, SAM 2 und YOLO#

Hier vergleichen wir die Fähigkeiten der Modelle SAM 2 und YOLO26 mit SAM 3. Informationen zur Echtzeiterkennung und -segmentierung mit offenem Vokabular auf Grundlage derselben Arten von Prompts findest du unter YOLOE:

FunktionSAM 3SAM 2YOLO26n-seg
Konzeptsegmentierung✅ Alle Instanzen aus Text/Beispielbildern❌ Nicht unterstützt❌ Nicht unterstützt
Visuelle Segmentierung✅ Einzelne Instanz (mit SAM 2 kompatibel)✅ Einzelne Instanz✅ Alle Instanzen
Zero-Shot-Fähigkeit✅ Offenes Vokabular✅ Geometrische Prompts❌ Geschlossene Menge
Interaktive Verfeinerung✅ Beispiele + Klicks✅ Nur Klicks❌ Nicht unterstützt
Video-Tracking✅ Mehrere Objekte mit Identitäten✅ Mehrere Objekte✅ Mehrere Objekte
LVIS-Masken-AP (Zero-Shot)47.0Nicht verfügbarNicht verfügbar
MOSEv2 J&F60.147.9Nicht verfügbar
Geschwindigkeit (GPU, ms/Bild)29218578.4
Modellgröße3.45 GB162 MB (Basis)6,4 MB

Die Geschwindigkeit wurde auf einer NVIDIA RTX PRO 6000 mit torch==2.9.1 und ultralytics==8.4.19 gemessen.

Wichtige Erkenntnisse:

  • SAM 3: Am besten für die Segmentierung von Konzepten mit offenem Vokabular geeignet, um alle Instanzen eines Konzepts anhand von Text- oder Beispielvorgaben zu finden
  • SAM 2: Am besten für die interaktive Segmentierung einzelner Objekte in Bildern und Videos mit geometrischen Vorgaben geeignet
  • YOLO26: Am besten geeignet für Echtzeit-Segmentierung mit hoher Geschwindigkeit und optionaler NMS-freier End-to-End-Inferenz, in viele Formate exportierbar für den Einsatz auf GPUs, CPUs und Edge-Geräten

SAM-Vergleich mit YOLO#

Vergleich von SAM 3, SAM 2, SAM, MobileSAM und FastSAM mit den Segmentierungsmodellen von Ultralytics YOLO (YOLOv8, YOLO11, YOLO26) hinsichtlich Größe, Parameteranzahl und GPU-Inferenzgeschwindigkeit:

ModellGröße
(MB)
Parameter
(M)
Geschwindigkeit (GPU)
(ms/Bild)
Meta SAM-b37593.71306
Meta SAM2-b16280.8857
Meta SAM2-t78.138.9668
Meta SAM33450473.62921
MobileSAM40.710.1605
FastSAM-s mit Backbone von YOLOv823.711.855.9
Ultralytics YOLOv8n-seg6,7 (515x kleiner)3,4 (139,1x weniger)17,4 (167x schneller)
Ultralytics YOLO11n-seg5,9 (585-mal kleiner)2,9 (163,1x weniger)12,6 (231x schneller)
Ultralytics YOLO26n-seg6,4 (539x kleiner)2,7 (175,2-mal weniger)8,4 (347-mal schneller)

Dieser Vergleich zeigt die deutlichen Unterschiede bei Modellgrößen und Geschwindigkeiten zwischen SAM-Varianten und YOLO-Segmentierungsmodellen. Während SAM einzigartige Funktionen zur automatischen Segmentierung bietet, sind YOLO-Modelle, insbesondere YOLOv8n-seg, YOLO11n-seg und YOLO26n-seg, deutlich kleiner, schneller und recheneffizienter.

Die Tests wurden auf einer NVIDIA RTX PRO 6000 mit 96 GB VRAM unter Verwendung von torch==2.9.1 und ultralytics==8.4.19 durchgeführt. So kannst du diesen Test reproduzieren:

Beispiel
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# Profile SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# Profile YOLO models
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    model(ASSETS, nms=False)  # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11

Evaluierungsmetriken#

SAM 3 führt neue Metriken für die PCS-Aufgabe ein, die bekannte Kennzahlen wie den F1-Score, die Präzision und den Recall ergänzen.

Klassifikationsgesteuerter F1-Score (CGF1)#

Die zentrale Metrik, die Lokalisierung und Klassifikation kombiniert:

CGF1 = 100 × pmF1 × IL_MCC

Dabei gilt:

  • pmF1 (positiver Makro-F1-Score): Misst die Qualität der Lokalisierung bei positiven Beispielen
  • IL_MCC (Matthews-Korrelationskoeffizient auf Bildebene): Misst die Genauigkeit der binären Klassifikation („Ist das Konzept vorhanden?“)

Warum diese Metriken?#

Traditionelle AP-Metriken berücksichtigen keine Kalibrierung, wodurch Modelle in der Praxis schwer einsetzbar sind. Durch die Bewertung ausschließlich von Vorhersagen mit einer Konfidenz von über 0,5 erzwingen die Metriken von SAM 3 eine gute Kalibrierung und bilden reale Nutzungsmuster in interaktiven predict- und track-Schleifen nach.

Wichtige Ablationen und Erkenntnisse#

Auswirkungen des Presence-Heads#

Der Presence-Head entkoppelt Erkennung und Lokalisierung und sorgt für deutliche Verbesserungen:

KonfigurationCGF1IL_MCCpmF1
Ohne Presence-Head57.60.7774.7
Mit Presence-Head63.30.8277.1

Der Presence-Head sorgt für einen CGF1-Zuwachs von +5,7 (+9,9 %) und verbessert hauptsächlich die Erkennungsfähigkeit (IL_MCC +6,5 %).

Auswirkungen schwieriger Negativbeispiele#

Schwierige Negativbeispiele/BildCGF1IL_MCCpmF1
031.80.4470.2
544.80.6271.9
3049.20.6872.3

Schwierige Negativbeispiele sind für die Erkennung mit offenem Vokabular entscheidend und verbessern IL_MCC um 54,5 % (0,44 → 0,68).

Skalierung der Trainingsdaten#

DatenquellenCGF1IL_MCCpmF1
Nur externe Daten30.90.4666.3
Externe + synthetische Daten39.70.5770.6
Externe + hochwertige Daten51.80.7173.2
Alle drei54.30.7473.5

Hochwertige Annotationen durch Menschen liefern große Verbesserungen gegenüber ausschließlich synthetischen oder externen Daten. Hintergrundinformationen zu Verfahren für die Datenqualität findest du unter Datensammlung und Annotation.

Anwendungen#

Die Konzeptsegmentierung von SAM 3 ermöglicht neue Anwendungsfälle:

  • Inhaltsmoderation: Alle Instanzen bestimmter Inhaltstypen in Mediatheken finden
  • E-Commerce: Alle Produkte eines bestimmten Typs in Katalogbildern segmentieren und automatische Annotation unterstützen
  • Medizinische Bildgebung: Alle Vorkommen bestimmter Gewebetypen oder Anomalien identifizieren
  • Autonome Systeme: Alle Instanzen von Verkehrsschildern, Fußgängern oder Fahrzeugen nach Kategorie verfolgen
  • Videoanalyse: Alle Personen zählen und verfolgen, die bestimmte Kleidung tragen oder bestimmte Handlungen ausführen
  • Datensatzannotation: Alle Instanzen seltener Objektkategorien schnell annotieren
  • Wissenschaftliche Forschung: Alle Proben quantifizieren und analysieren, die bestimmte Kriterien erfüllen

SAM-3-Agent: Erweitertes Sprachverständnis#

SAM 3 kann mit multimodalen großen Sprachmodellen (MLLMs) kombiniert werden, um komplexe Anfragen zu bearbeiten, die Schlussfolgerungen erfordern – ähnlich wie Systeme mit offenem Vokabular wie OWLv2 und T-Rex.

Leistung bei Schlussfolgerungsaufgaben#

BenchmarkKennzahlSAM-3-Agent (Gemini 2.5 Pro)Bisheriger Bestwert
ReasonSeg (Validierung)gIoU76.065,0 (SoTA)
ReasonSeg (Test)gIoU73.861,3 (SoTA)
OmniLabel (Validierung)AP46.736,5 (REAL)
RefCOCO+Acc91.289,3 (LISA)

Beispiele für komplexe Anfragen#

Der SAM-3-Agent kann Anfragen bearbeiten, die Schlussfolgerungen erfordern:

  • „Personen, die sitzen, aber keine Geschenkbox in den Händen halten“
  • „Der Hund, der der Kamera am nächsten ist und kein Halsband trägt“
  • "Rote Objekte, die größer als die Hand der Person sind"

Das MLLM schlägt SAM 3 einfache Nominalphrasen als Abfragen vor, analysiert die zurückgegebenen Masken und wiederholt den Vorgang, bis das Ergebnis zufriedenstellend ist.

Einschränkungen#

SAM 3 stellt zwar einen bedeutenden Fortschritt dar, weist jedoch gewisse Einschränkungen auf:

  • Komplexität der Phrasen: Am besten für einfache Nominalphrasen geeignet; lange beschreibende Ausdrücke oder komplexe Schlussfolgerungen erfordern möglicherweise die Integration eines MLLM
  • Umgang mit Mehrdeutigkeiten: Einige Konzepte bleiben grundsätzlich mehrdeutig (z. B. "kleines Fenster", "gemütlicher Raum")
  • Rechenanforderungen: Größer und langsamer als spezialisierte Erkennungsmodelle wie YOLO
  • Umfang des Vokabulars: Auf elementare visuelle Konzepte fokussiert; ohne Unterstützung durch ein MLLM ist die kombinatorische Schlussfolgerung eingeschränkt
  • Seltene Konzepte: Die Leistung kann bei äußerst seltenen oder feingranularen Konzepten abnehmen, die in den Trainingsdaten nicht ausreichend vertreten sind

Zitierung#

Zitat
@misc{carion2025sam3,
  title         = {SAM 3: Segment Anything with Concepts},
  author        = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
  year          = {2025},
  eprint        = {2511.16719},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2511.16719}
}

FAQ#

  • SAM 3 wurde von Meta am 19. November 2025 veröffentlicht und ist vollständig in das ultralytics-Paket integriert, mit Unterstützung für den Vorhersagemodus und den Verfolgungsmodus.

  • Ja! SAM 3 ist vollständig in das Ultralytics Python-Paket integriert, einschließlich Konzeptsegmentierung, visueller Prompts im SAM 2-Stil und Video-Tracking für mehrere Objekte. SAM 3 und SAM 3.1 treiben auch die smart annotation-Funktion auf der Ultralytics Platform an, wo SAM 3.1 das Standardmodell ist und du Bilder mit nur wenigen Klicks annotieren kannst.

  • Ja, für die Bildvorhersage. Lade sam3.1_multiplex.pt überall dort, wo die Bildbeispiele auf dieser Seite sam3.pt verwenden: SAM("sam3.1_multiplex.pt") für Punkt- und Box-Prompts sowie SAM3SemanticPredictor für Text- und Exemplar-Prompts. Object Multiplex-Video-Tracking wird noch nicht unterstützt, verwende daher weiterhin sam3.pt mit den Videoprädiktoren. Siehe SAM 3.1 für die Benchmarks von Meta.

  • PCS ist eine neue Aufgabe in SAM 3, bei der alle Instanzen eines visuellen Konzepts in einem Bild oder Video segmentiert werden. Anders als bei der herkömmlichen Segmentierung, die auf eine bestimmte Objektinstanz abzielt, findet PCS jedes Vorkommen einer Kategorie. Zum Beispiel:

    • Texteingabe: "gelber Schulbus" → segmentiert alle gelben Schulbusse in der Szene
    • Bildbeispiel: Rahmen um einen Hund → segmentiert alle Hunde im Bild
    • Kombiniert: "getigerte Katze" + Beispielrahmen → segmentiert alle getigerten Katzen, die dem Beispiel entsprechen

    Weitere Hintergrundinformationen findest du unter Objekterkennung und Instanzsegmentierung.

  • MerkmalSAM 2SAM 3
    AufgabeEin einzelnes Objekt pro EingabeaufforderungAlle Instanzen eines Konzepts
    Arten von EingabeaufforderungenPunkte, Rahmen, Masken+ Textphrasen, Bildbeispiele
    ErkennungsfähigkeitErfordert einen externen DetektorIntegrierter Detektor mit offenem Vokabular
    ErkennungNur geometriebasiertText- und Bilderkennung
    ArchitekturNur TrackerDetektor + Tracker mit Anwesenheitskopf
    Leistung ohne Training auf BeispieldatenNicht zutreffend (erfordert visuelle Prompts)47,0 AP auf LVIS, 2× besser auf SA-Co
    Interaktive VerfeinerungNur KlicksKlicks + Verallgemeinerung anhand von Beispielen

    SAM 3 bleibt mit dem visuellen Prompting von SAM 2 abwärtskompatibel und ergänzt dieses um konzeptbasierte Funktionen.

  • SAM 3 wird mit dem Datensatz Segment Anything with Concepts (SA-Co) trainiert:

    Trainingsdaten:

    • 5,2 Mio. Bilder mit 4 Mio. eindeutigen Nominalphrasen (SA-Co/HQ) – hochwertige Annotationen von Menschen
    • 52,5 Tsd. Videos mit 24,8 Tsd. eindeutigen Nominalphrasen (SA-Co/VIDEO)
    • 1,4 Mrd. synthetische Masken mit 38 Mio. Nominalphrasen (SA-Co/SYN)
    • 15 externe Datensätze, angereichert mit schwierigen Negativbeispielen (SA-Co/EXT)

    Benchmarkdaten:

    • 214 Tsd. eindeutige Konzepte in 126 Tsd. Bildern/Videos
    • 50× mehr Konzepte als bestehende Benchmarks (z. B. umfasst LVIS ~4 Tsd. Konzepte)
    • Dreifache Annotation auf SA-Co/Gold zur Messung der Grenzen menschlicher Leistung

    Dieser enorme Umfang und diese Vielfalt ermöglichen SAM 3 eine überlegene Verallgemeinerung ohne vorherige Beispieldaten über Konzepte mit offenem Vokabular hinweg.

  • SAM 3 und YOLO26 decken unterschiedliche Anwendungsfälle ab:

    Vorteile von SAM 3:

    • Offenes Vokabular: Segmentiert jedes Konzept anhand von Texteingaben, ohne Training
    • Ohne vorherige Beispieldaten: Funktioniert sofort mit neuen Kategorien
    • Interaktiv: Die Verfeinerung anhand von Beispielen lässt sich auf ähnliche Objekte verallgemeinern
    • Konzeptbasiert: Findet automatisch alle Instanzen einer Kategorie
    • Genauigkeit: 47,0 AP bei der Instanzsegmentierung auf LVIS ohne vorherige Beispieldaten

    Vorteile von YOLO26:

    • Geschwindigkeit: Um Größenordnungen schnellere Inferenz mit einem optionalen NMS-freien End-to-End-Kopf
    • Effizienz: 539× kleinere Modelle (6,4 MB gegenüber 3,45 GB)
    • Ressourcenschonend: Läuft auf Edge-Geräten und Mobilgeräten
    • Echtzeit: Für Produktiveinsätze optimiert

    Empfehlung:

    • Verwende SAM 3 für eine flexible Segmentierung mit offenem Vokabular, wenn du alle Instanzen von Konzepten finden musst, die durch Text oder Beispiele beschrieben werden.
    • Verwende YOLO26 für Hochgeschwindigkeits-Produktiveinsätze, bei denen die Kategorien im Voraus bekannt sind.
    • Verwende SAM 2 für die interaktive Segmentierung einzelner Objekte mit geometrischen Prompts.
  • SAM 3 ist für einfache Nominalphrasen ausgelegt (z. B. "roter Apfel", "Person mit Hut"). Für komplexe Anfragen, die Schlussfolgerungen erfordern, kannst du SAM 3 mit einem MLLM als SAM 3 Agent kombinieren:

    Einfache Anfragen (natives SAM 3):

    • "gelber Schulbus"
    • "getigerte Katze"
    • "Person mit rotem Hut"

    Komplexe Anfragen (SAM 3 Agent mit MLLM):

    • "Menschen, die sitzen, aber keine Geschenkbox halten"
    • "Der Hund, der der Kamera am nächsten ist und kein Halsband trägt"
    • "Rote Objekte, die größer als die Hand der Person sind"

    SAM 3 Agent erreicht 76,0 gIoU bei der Validierung von ReasonSeg (gegenüber 65,0 beim bisherigen Bestwert, Verbesserung um +16,9 %), indem die Segmentierung von SAM 3 mit den Schlussfolgerungsfähigkeiten eines MLLM kombiniert wird.

  • Auf dem SA-Co/Gold-Benchmark mit dreifacher Annotation durch Menschen:

    • Untere Grenze menschlicher Leistung: 74,2 CGF1 (konservativste annotierende Person)
    • Leistung von SAM 3: 65,0 CGF1
    • Erreicht: 88 % der geschätzten unteren Grenze menschlicher Leistung
    • Obere Grenze menschlicher Leistung: 81,4 CGF1 (freizügigste annotierende Person)

    SAM 3 erzielt eine starke Leistung und nähert sich bei der Segmentierung von Konzepten mit offenem Vokabular der Genauigkeit von Menschen an. Die Abweichung besteht hauptsächlich bei mehrdeutigen oder subjektiven Konzepten (z. B. "kleines Fenster", "gemütlicher Raum").

Kommentare