SAM 3: Alles anhand von Konzepten segmentieren#

SAM 3 (Segmentierungsmodell für alles 3) ist Metas veröffentlichtes Basismodell für die konzeptgesteuerte Segmentierung (PCS). Aufbauend auf SAM 2 führt SAM 3 eine grundlegend neue Fähigkeit ein: Es erkennt, segmentiert und verfolgt alle Instanzen eines visuellen Konzepts, das durch Textvorgaben, Beispielbilder oder beides beschrieben wird. Anders als frühere SAM-Versionen, die pro Vorgabe einzelne Objekte segmentieren, kann SAM 3 jedes Vorkommen eines Konzepts in Bildern oder Videos finden und segmentieren. Damit unterstützt es die Ziele eines offenen Vokabulars in der modernen Instanzsegmentierung.
Ansehen: So verwendest du Meta Segment Anything 3 mit Ultralytics | Segmentierung von Bildern und Videos anhand von Textvorgaben
SAM 3 ist vollständig in das Paket ultralytics integriert und unterstützt nativ die Konzeptsegmentierung anhand von Textvorgaben, Beispielbildern und Videoverfolgung. Der neuere SAM 3.1-Checkpoint wird für Bildvorhersagen unterstützt.
Übersicht#
SAM 3 erzielt bei der konzeptgesteuerten Segmentierung eine doppelt so hohe Leistung wie bestehende Systeme und erhält zugleich die Fähigkeiten von SAM 2 zur interaktiven visuellen Segmentierung aufrecht und verbessert sie. Das Modell eignet sich hervorragend für die Segmentierung mit offenem Vokabular: Nutzer können Konzepte mit einfachen Nominalgruppen angeben (z. B. „gelber Schulbus“, „getigerte Katze“) oder Beispielbilder des Zielobjekts bereitstellen. Diese Fähigkeiten ergänzen produktionsreife Abläufe, die auf schlanke Arbeitsabläufe zum Vorhersagen und Verfolgen setzen.

Was ist konzeptgesteuerte Segmentierung (PCS)?#
Die PCS-Aufgabe nimmt eine Konzeptvorgabe entgegen und gibt Segmentierungsmasken mit eindeutigen IDs für alle passenden Objektinstanzen zurück. Als Konzeptvorgaben kommen infrage:
- Text: Einfache Nominalgruppen wie „roter Apfel“ oder „Person mit Hut“, ähnlich wie beim Zero-Shot-Lernen
- Beispielbilder: Begrenzungsboxen um Beispielobjekte (positiv oder negativ) zur schnellen Verallgemeinerung
- Kombiniert: Text und Beispielbilder gemeinsam für eine präzise Steuerung
Dies unterscheidet sich von herkömmlichen visuellen Vorgaben (Punkte, Boxen, Masken), die nur eine einzelne, bestimmte Objektinstanz segmentieren – ein Ansatz, der durch die ursprüngliche SAM-Familie bekannt wurde.
Wichtige Leistungskennzahlen#
| Kennzahl | Ergebnis von SAM 3 |
|---|---|
| LVIS-Masken-AP im Zero-Shot-Verfahren | 47.0 (gegenüber dem bisherigen Bestwert von 38.5: Verbesserung um 22 %) |
| SA-Co-Benchmark | Doppelt so gut wie bestehende Systeme |
| Inferenzgeschwindigkeit (H200-GPU) | 30 ms pro Bild mit über 100 erkannten Objekten |
| Videoleistung | Nahezu in Echtzeit für ~5 gleichzeitig verfolgte Objekte |
| MOSEv2-VOS-Benchmark | 60.1 J&F (25.5 % besser als SAM 2.1, 17 % besser als der bisherige Spitzenwert) |
| Interaktive Verfeinerung | Verbesserung um +18.6 CGF1 nach 3 Beispielvorgaben |
| Abstand zur menschlichen Leistung | Erreicht 88 % der geschätzten Untergrenze bei SA-Co/Gold |
Hintergrundinformationen zu Modellkennzahlen und Kompromissen im Produktionseinsatz findest du unter Einblicke in die Modellbewertung und YOLO-Leistungskennzahlen.
SAM 3.1#
SAM 3.1, das Meta am 27. März 2026 veröffentlicht hat, ist ein neuer SAM 3-Checkpoint, der Object Multiplex einführt – einen Ansatz für die Videoverfolgung mehrerer Objekte mit gemeinsam genutztem Speicher. Statt jedes verfolgte Objekt einzeln zu verarbeiten, gruppiert SAM 3.1 die Objekte in Buckets mit fester Kapazität und verarbeitet sie gemeinsam. Laut Meta ist das bei 128 Objekten auf einer einzelnen H100-GPU etwa 7-mal schneller. Der Bilddetektor und der interaktive Kopf für Punktvorgaben behalten die SAM 3-Architektur bei.
| Benchmark | Kennzahl | SAM 3 | SAM 3.1 |
|---|---|---|---|
| SA-Co/VEval SA-V (Test) | cgF1 | 30.3 | 30.5 |
| SA-Co/VEval YT-Temporal-1B (Test) | cgF1 | 50.8 | 52.9 |
| SA-Co/VEval SmartGlasses (Test) | cgF1 | 36.4 | 36.3 |
| MOSEv1 (Validierung) | J&F | 78.4 | 79.6 |
| DAVIS17 (Validierung) | J&F | 92.2 | 92.7 |
| SA-V (Test) | J&F | 84.4 | 85.1 |
| YTVOS19 (Validierung) | G | 89.7 | 89.3 |
| MOSEv2 (Validierung) | J&Ḟ | 60.3 | 62.3 |
Ultralytics lädt den SAM 3.1-Checkpoint (sam3.1_multiplex.pt) in die SAM 3-Bildprädiktoren: SAM("sam3.1_multiplex.pt") für Punkt- und Boxvorgaben sowie SAM3SemanticPredictor für Text- und Beispielvorgaben. Die Videoverfolgung mit Object Multiplex wird noch nicht unterstützt. Verwende daher weiterhin sam3.pt mit SAM3VideoPredictor und SAM3VideoSemanticPredictor.
Architektur#
SAM 3 besteht aus einem Detektor und einem Tracker, die sich eine Bildverarbeitungs-Backbone namens Perception Encoder (PE) teilen. Dieses entkoppelte Design vermeidet Konflikte zwischen Aufgaben und ermöglicht sowohl die Erkennung auf Bildebene als auch die Verfolgung auf Videoebene. Die Schnittstelle ist mit der Python-Nutzung und der CLI-Nutzung von Ultralytics kompatibel.
Kernkomponenten#
-
Detektor: DETR-basierte Architektur zur Erkennung von Konzepten auf Bildebene
- Textencoder für Vorgaben in Form von Nominalgruppen
- Beispielbild-Encoder für bildbasierte Vorgaben
- Fusionsencoder, der Bildmerkmale anhand der Vorgaben konditioniert
- Neuartiger Präsenzkopf, der Erkennung („was“) und Lokalisierung („wo“) voneinander trennt
- Maskenkopf zur Erzeugung von Instanzsegmentierungsmasken
-
Tracker: Von SAM 2 übernommene speicherbasierte Videosegmentierung
- Vorgaben-Encoder, Maskendekodierer, Speicher-Encoder
- Speicherbank zum Speichern des Erscheinungsbilds von Objekten über mehrere Frames hinweg
- Zeitliche Unterscheidung mithilfe von Verfahren wie einem Kalman-Filter bei der Verfolgung mehrerer Objekte
-
Präsenztoken: Ein trainiertes globales Token, das vorhersagt, ob das Zielkonzept im Bild oder Frame vorhanden ist. Dadurch wird die Erkennung verbessert, indem sie von der Lokalisierung getrennt wird.

Wichtige Innovationen#
- Entkoppelte Erkennung und Lokalisierung: Der Presence-Head sagt das globale Vorhandensein eines Konzepts voraus, während sich Proposal-Queries ausschließlich auf die Lokalisierung konzentrieren und so widersprüchliche Ziele vermeiden.
- Einheitliche Konzept- und visuelle Prompts: Unterstützt PCS (Konzept-Prompts) und PVS (visuelle Prompts wie Klicks/Boxen in SAM 2) in einem einzigen Modell.
- Interaktive Verfeinerung mit Beispielen: Nutzer können positive oder negative Bildbeispiele hinzufügen, um die Ergebnisse schrittweise zu verfeinern. Das Modell verallgemeinert dabei auf ähnliche Objekte, statt nur einzelne Instanzen zu korrigieren.
- Zeitliche Disambiguierung: Verwendet Masklet-Erkennungsscores und regelmäßige erneute Prompts, um Verdeckungen, überfüllte Szenen und Tracking-Fehler in Videos zu bewältigen und orientiert sich dabei an den Best Practices für Instanzsegmentierung und Tracking.
SA-Co-Datensatz#
SAM 3 wird mit Segment Anything with Concepts (SA-Co) trainiert, dem bisher größten und vielfältigsten Segmentierungsdatensatz von Meta, der über gängige Benchmarks wie COCO und LVIS hinausgeht.
Trainingsdaten#
| Datensatzkomponente | Beschreibung | Umfang |
|---|---|---|
| SA-Co/HQ | Hochwertige, von Menschen annotierte Bilddaten aus einer vierphasigen Datenpipeline | 5,2 Mio. Bilder, 4 Mio. einzigartige Nominalphrasen |
| SA-Co/SYN | Synthetischer Datensatz, der ohne menschliche Beteiligung durch KI annotiert wurde | 38 Mio. Nominalphrasen, 1,4 Mrd. Masken |
| SA-Co/EXT | 15 externe Datensätze, ergänzt um schwierige Negativbeispiele | Je nach Quelle unterschiedlich |
| SA-Co/VIDEO | Videoannotationen mit zeitlichem Tracking | 52,5 Tsd. Videos, 24,8 Tsd. einzigartige Nominalphrasen |
Benchmarkdaten#
Der SA-Co-Evaluierungsbenchmark umfasst 214 Tsd. einzigartige Phrasen aus 126 Tsd. Bildern und Videos und bietet damit über 50-mal mehr Konzepte als bestehende Benchmarks. Er umfasst:
- SA-Co/Gold: 7 Domänen, dreifach annotiert, um die Grenzen der menschlichen Leistung zu messen
- SA-Co/Silver: 10 Domänen, jeweils einmal von Menschen annotiert
- SA-Co/Bronze und SA-Co/Bio: 9 bestehende Datensätze, angepasst für die Konzeptsegmentierung
- SA-Co/VEval: Videobenchmark mit 3 Domänen (SA-V, YT-Temporal-1B, SmartGlasses)
Innovationen bei der Datenpipeline#
Die skalierbare Datenpipeline von SAM 3 mit Menschen und Modellen im Regelkreis erreicht durch Folgendes einen 2-mal höheren Annotationsdurchsatz:
- KI-Annotatoren: Auf Llama basierende Modelle schlagen vielfältige Nominalphrasen vor, darunter schwierige Negativbeispiele
- KI-Prüfer: Feinabgestimmte multimodale LLMs überprüfen die Maskenqualität und Vollständigkeit nahezu auf menschlichem Leistungsniveau
- Aktive Suche: Konzentriert den menschlichen Aufwand auf schwierige Fehlerfälle, bei denen KI an ihre Grenzen stößt
- Ontologiegesteuert: Nutzt eine umfangreiche, in Wikidata verankerte Ontologie, um eine breite Konzeptabdeckung zu erzielen
Installation#
Installiere das Paket ultralytics oder aktualisiere es:
pip install -U ultralyticsIm Gegensatz zu anderen Ultralytics-Modellen werden die Gewichte von SAM 3 (sam3.pt) nicht automatisch heruntergeladen. Du musst zuerst auf der SAM 3-Modellseite auf Hugging Face Zugriff auf die Modellgewichte beantragen und nach der Genehmigung sam3.pt von dieser Seite herunterladen. Lege die heruntergeladene Datei sam3.pt in deinem Arbeitsverzeichnis ab oder gib beim Laden des Modells den vollständigen Pfad an.
Die Gewichte von SAM 3.1 (sam3.1_multiplex.pt) sind auf der SAM 3.1-Modellseite auf dieselbe Weise zugangsbeschränkt. Übergib sam3.1_multiplex.pt überall dort, wo die folgenden Bildbeispiele sam3.pt verwenden.
Wenn dieser Fehler bei der Vorhersage auftritt, ist das falsche Paket clip installiert. Installiere das richtige Paket clip mit folgendem Befehl:
pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.gitSAM 3 verwenden: Vielseitigkeit bei der Konzeptsegmentierung#
SAM 3 unterstützt Aufgaben der Prompt-basierten Konzeptsegmentierung (PCS) und der Prompt-basierten visuellen Segmentierung (PVS) über unterschiedliche Predictor-Schnittstellen:
Unterstützte Aufgaben und Modelle#
| Aufgabentyp | Prompt-Typen | Ausgabe |
|---|---|---|
| Konzeptsegmentierung (PCS) | Text (Nominalphrasen), Bildbeispiele | Alle Instanzen, die dem Konzept entsprechen |
| Visuelle Segmentierung (PVS) | Punkte, Boxen, Masken | Einzelne Objektinstanz (wie bei SAM 2) |
| Interaktive Verfeinerung | Beispiele oder Klicks schrittweise hinzufügen/entfernen | Verfeinerte Segmentierung mit höherer Genauigkeit |
Beispiele für die Konzeptsegmentierung#
Segmentierung mit Text-Prompts#
Finde und segmentiere alle Instanzen eines Konzepts mithilfe einer Textbeschreibung. Für Text-Prompts ist die Schnittstelle SAM3SemanticPredictor erforderlich.
from ultralytics.models.sam import SAM3SemanticPredictor
# Predictor mit Konfiguration initialisieren
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"model": "sam3.pt",
"quantize": 16, # FP16 für schnellere Inferenz verwenden
"save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Bild einmalig für mehrere Abfragen festlegen
predictor.set_image("path/to/image.jpg")
# Mit mehreren Text-Prompts abfragen
results = predictor(text=["person", "bus", "glasses"])
# Funktioniert mit beschreibenden Phrasen
results = predictor(text=["person with red cloth", "person with blue cloth"])
# Mit einem einzelnen Konzept abfragen
results = predictor(text=["a person"])Segmentierung mit Bildbeispielen#
Verwende Begrenzungsrahmen als visuelle Prompts, um alle ähnlichen Instanzen zu finden. Für den konzeptbasierten Abgleich ist außerdem SAM3SemanticPredictor erforderlich.
from ultralytics.models.sam import SAM3SemanticPredictor
# Predictor initialisieren
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Bild festlegen
predictor.set_image("path/to/image.jpg")
# Beispiele mit Begrenzungsrahmen bereitstellen, um ähnliche Objekte zu segmentieren
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])
# Mehrere Begrenzungsrahmen als Beispiele für dasselbe visuelle Konzept
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])Merkmalsbasierte Inferenz für mehr Effizienz#
Extrahiere Bildmerkmale einmal und verwende sie für mehrere Segmentierungsabfragen wieder, um die Effizienz zu steigern.
import cv2
from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors
# Predictors initialisieren
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)
# Merkmale mit dem ersten Predictor extrahieren
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]
# Zweiten Predictor einrichten und Merkmale wiederverwenden
predictor2.setup_model()
# Inferenz mit gemeinsam genutzten Merkmalen und Text-Prompt ausführen
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])
# Inferenz mit gemeinsam genutzten Merkmalen und Begrenzungsrahmen-Prompt ausführen
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])
# Ergebnisse visualisieren
if masks is not None:
masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
im = cv2.imread(source)
annotator = Annotator(im, pil=False)
annotator.masks(masks, [colors(x, True) for x in range(len(masks))])
cv2.imshow("result", annotator.result())
cv2.waitKey(0)Videokonzeptsegmentierung#
Konzepte über ein Video hinweg mit Begrenzungsrahmen verfolgen#
Erkenne und verfolge Objektinstanzen über Videobilder hinweg mithilfe von Begrenzungsrahmen-Prompts.
from ultralytics.models.sam import SAM3VideoPredictor
# Video-Predictor erstellen
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)
# Objekte mithilfe von Begrenzungsrahmen-Prompts verfolgen
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)
# Ergebnisse verarbeiten und anzeigen
for r in results:
r.show() # Bild mit Segmentierungsmasken anzeigenKonzepte mit Text-Prompts verfolgen#
Verfolge alle Instanzen von Konzepten, die per Text angegeben werden, über Videobilder hinweg.
from ultralytics.models.sam import SAM3VideoSemanticPredictor
# Semantischen Video-Predictor initialisieren
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"imgsz": 640,
"model": "sam3.pt",
"quantize": 16,
"save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)
# Konzepte mithilfe von Text-Prompts verfolgen
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)
# Ergebnisse verarbeiten
for r in results:
r.show() # Bild mit verfolgten Objekten anzeigen
# Alternative: Mit Begrenzungsrahmen-Prompts verfolgen
results = predictor(
source="path/to/video.mp4",
bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
labels=[1, 1], # Positive Bezeichnungen
stream=True,
)Visuelle Prompts (Kompatibilität mit SAM 2)#
SAM 3 ist vollständig abwärtskompatibel mit dem visuellen Prompting von SAM 2 für die Segmentierung einzelner Objekte:
Die grundlegende Schnittstelle SAM verhält sich genau wie SAM 2 und segmentiert ausschließlich den durch visuelle Prompts (Punkte, Boxen oder Masken) angegebenen Bereich.
from ultralytics import SAM
model = SAM("sam3.pt")
# Einzelpunkt-Prompt – segmentiert das Objekt an einer bestimmten Position
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()
# Mehrere Punkte – segmentiert ein einzelnes Objekt anhand mehrerer Punkthinweise
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])
# Box-Prompt – segmentiert das Objekt innerhalb einer Begrenzungsbox
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()Mit SAM("sam3.pt") und visuellen Prompts (Punkten/Boxen/Masken) wird nur das jeweilige Objekt an dieser Position segmentiert, genau wie bei SAM 2. Um alle Instanzen eines Konzepts zu segmentieren, verwende SAM3SemanticPredictor mit Text- oder Beispiel-Prompts wie oben gezeigt.
Leistungsbenchmarks#
Bildsegmentierung#
SAM 3 erzielt Spitzenresultate in mehreren Benchmarks, darunter praxisnahe Datensätze wie LVIS und COCO für die Segmentierung:
| Benchmark | Kennzahl | SAM 3 | Bisheriger Bestwert | Verbesserung |
|---|---|---|---|---|
| LVIS (Zero-Shot) | Masken-AP | 47.0 | 38.5 | +22.1% |
| SA-Co/Gold | CGF1 | 65.0 | 34.3 (OWLv2) | +89.5% |
| COCO (Zero-Shot) | Box-AP | 53.5 | 52.2 (T-Rex2) | +2.5% |
| ADE-847 (semantische Segmentierung) | mIoU | 14.7 | 9.2 (APE-D) | +59.8% |
| PascalConcept-59 | mIoU | 59.4 | 58.5 (APE-D) | +1.5% |
| Cityscapes (semantische Segmentierung) | mIoU | 65.1 | 44.2 (APE-D) | +47.3% |
Entdecke Datensatzoptionen für schnelle Experimente in Ultralytics-Datensätzen.
Leistung bei der Videosegmentierung#
SAM 3 bietet deutliche Verbesserungen gegenüber SAM 2 und bisherigen Spitzenmodellen in Videobenchmarks wie DAVIS 2017 und YouTube-VOS:
| Benchmark | Kennzahl | SAM 3 | SAM 2.1 L | Verbesserung |
|---|---|---|---|---|
| MOSEv2 | J&F | 60.1 | 47.9 | +25.5% |
| DAVIS 2017 | J&F | 92.0 | 90.7 | +1.4% |
| LVOSv2 | J&F | 88.2 | 79.6 | +10.8% |
| SA-V | J&F | 84.6 | 78.4 | +7.9% |
| YTVOS19 | J&F | 89.6 | 89.3 | +0.3% |
Few-Shot-Anpassung#
SAM 3 passt sich mit wenigen Beispielen besonders gut an neue Domänen an – relevant für datenzentrierte KI-Workflows:
| Benchmark | AP mit 0 Beispielen | AP mit 10 Beispielen | Bisheriger Bestwert (10 Beispiele) |
|---|---|---|---|
| ODinW13 | 59.9 | 71.6 | 67.9 (gDino1.5-Pro) |
| RF100-VL | 14.3 | 35.7 | 33.7 (gDino-T) |
Effektivität der interaktiven Verfeinerung#
Das exemplarbasierte Prompting auf Konzeptebene von SAM 3 konvergiert deutlich schneller als visuelles Prompting:
| Hinzugefügte Prompts | CGF1-Wert | Zuwachs gegenüber nur Text | Zuwachs gegenüber der PVS-Baseline |
|---|---|---|---|
| Nur Text | 46.4 | Baseline | Baseline |
| +1 Beispiel | 57.6 | +11.2 | +6.7 |
| +2 Beispiele | 62.2 | +15.8 | +9.7 |
| +3 Beispiele | 65.0 | +18.6 | +11.2 |
| +4 Beispiele | 65.7 | +19.3 | +11.5 (Plateau) |
Genauigkeit der Objektzählung#
SAM 3 zählt genau, indem alle Instanzen segmentiert werden – eine häufige Anforderung bei der Objektzählung:
| Benchmark | Genauigkeit | MAE | gegenüber dem besten MLLM |
|---|---|---|---|
| CountBench | 95.6% | 0.11 | 92.4% (Gemini 2.5) |
| PixMo-Count | 87.3% | 0.22 | 88.8% (Molmo-72B) |
Vergleich von SAM 3, SAM 2 und YOLO#
Hier vergleichen wir die Fähigkeiten von SAM 3 mit SAM 2 und YOLO26. Informationen zur echtzeitfähigen Erkennung und Segmentierung mit offenem Vokabular anhand derselben Prompt-Arten findest du unter YOLOE:
| Fähigkeit | SAM 3 | SAM 2 | YOLO26n-seg |
|---|---|---|---|
| Konzeptsegmentierung | ✅ Alle Instanzen anhand von Text/Beispielen | ❌ Nicht unterstützt | ❌ Nicht unterstützt |
| Visuelle Segmentierung | ✅ Einzelne Instanz (kompatibel mit SAM 2) | ✅ Einzelne Instanz | ✅ Alle Instanzen |
| Zero-Shot-Fähigkeit | ✅ Offenes Vokabular | ✅ Geometrische Prompts | ❌ Geschlossene Klassenmenge |
| Interaktive Verfeinerung | ✅ Beispiele + Klicks | ✅ Nur Klicks | ❌ Nicht unterstützt |
| Video-Tracking | ✅ Mehrere Objekte mit Identitäten | ✅ Mehrere Objekte | ✅ Mehrere Objekte |
| LVIS-Masken-AP (Zero-Shot) | 47.0 | Nicht zutreffend | Nicht zutreffend |
| MOSEv2 J&F | 60.1 | 47.9 | Nicht zutreffend |
| Geschwindigkeit (GPU, ms/Bild) | 2921 | 857 | 8.4 |
| Modellgröße | 3.45 GB | 162 MB (Basis) | 6.4 MB |
Geschwindigkeit gemessen auf NVIDIA RTX PRO 6000 mit torch==2.9.1 und ultralytics==8.4.19.
Wichtigste Erkenntnisse:
- SAM 3: Am besten für die Konzeptsegmentierung mit offenem Vokabular geeignet, um alle Instanzen eines Konzepts anhand von Text- oder Beispiel-Prompts zu finden
- SAM 2: Am besten für die interaktive Segmentierung einzelner Objekte in Bildern und Videos mit geometrischen Prompts geeignet
- YOLO26: Am besten für echtzeitfähige, schnelle Segmentierung mit optionaler NMS-freier End-to-End-Inferenz geeignet; für den Einsatz auf GPUs, CPUs und Edge-Geräten in viele Formate exportierbar
Vergleich von SAM und YOLO#
Vergleich von SAM 3, SAM 2, SAM, MobileSAM und FastSAM mit den Ultralytics-Segmentierungsmodellen YOLO (YOLOv8, YOLO11, YOLO26) hinsichtlich Größe, Parameteranzahl und GPU-Inferenzgeschwindigkeit:
| Modell | Größe (MB) | Parameter (M) | Geschwindigkeit (GPU) (ms/Bild) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 1306 |
| Meta SAM2-b | 162 | 80.8 | 857 |
| Meta SAM2-t | 78.1 | 38.9 | 668 |
| Meta SAM3 | 3450 | 473.6 | 2921 |
| MobileSAM | 40.7 | 10.1 | 605 |
| FastSAM-s mit YOLOv8-Backbone | 23.7 | 11.8 | 55.9 |
| Ultralytics YOLOv8n-seg | 6.7 (515-mal kleiner) | 3.4 (139.1-mal weniger) | 17.4 (167-mal schneller) |
| Ultralytics YOLO11n-seg | 5.9 (585-mal kleiner) | 2.9 (163.1-mal weniger) | 12.6 (231-mal schneller) |
| Ultralytics YOLO26n-seg | 6.4 (539-mal kleiner) | 2.7 (175.2-mal weniger) | 8.4 (347-mal schneller) |
Dieser Vergleich zeigt die erheblichen Unterschiede bei Modellgrößen und Geschwindigkeiten zwischen SAM-Varianten und YOLO-Segmentierungsmodellen. SAM bietet zwar einzigartige Möglichkeiten zur automatischen Segmentierung, doch YOLO-Modelle, insbesondere YOLOv8n-seg, YOLO11n-seg und YOLO26n-seg, sind deutlich kleiner, schneller und recheneffizienter.
Die Tests wurden auf einer NVIDIA RTX PRO 6000 mit 96 GB VRAM unter Verwendung von torch==2.9.1 und ultralytics==8.4.19 durchgeführt. So kannst du den Test reproduzieren:
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# SAM3, SAM2-t, SAM2-b, SAM-b und MobileSAM profilieren
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# FastSAM-s profilieren
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# YOLO-Modelle profilieren
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
model(ASSETS, nms=False) # NMS-freier YOLO26-Head; für YOLOv8/YOLO11 ohne FunktionEvaluierungsmetriken#
SAM 3 führt neue Metriken für die PCS-Aufgabe ein, die bekannte Kennzahlen wie F1-Score, Präzision und Recall ergänzen.
Klassifikationsgesteuerter F1-Score (CGF1)#
Die zentrale Metrik, die Lokalisierung und Klassifizierung kombiniert:
CGF1 = 100 × pmF1 × IL_MCC
Dabei gilt:
- pmF1 (Positive Macro F1): Misst die Lokalisierungsqualität bei positiven Beispielen
- IL_MCC (Matthews-Korrelationskoeffizient auf Bildebene): Misst die Genauigkeit der binären Klassifizierung („Ist das Konzept vorhanden?“)
Warum diese Metriken?#
Herkömmliche AP-Metriken berücksichtigen die Kalibrierung nicht, wodurch sich Modelle in der Praxis nur schwer einsetzen lassen. Da nur Vorhersagen mit einer Konfidenz über 0,5 bewertet werden, sorgen die Metriken von SAM 3 für eine gute Kalibrierung und bilden die Nutzung in interaktiven Vorhersage- und Tracking-Schleifen nach.
Wichtige Ablationen und Erkenntnisse#
Einfluss des Presence-Heads#
Der Presence-Head entkoppelt die Erkennung von der Lokalisierung und führt so zu deutlichen Verbesserungen:
| Konfiguration | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| Ohne Presence | 57.6 | 0.77 | 74.7 |
| Mit Presence | 63.3 | 0.82 | 77.1 |
Der Presence-Head sorgt für eine CGF1-Steigerung um +5,7 (+9,9 %) und verbessert vor allem die Erkennungsfähigkeit (IL_MCC +6,5 %).
Auswirkung schwieriger Negativbeispiele#
| Schwierige Negativbeispiele pro Bild | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| 0 | 31.8 | 0.44 | 70.2 |
| 5 | 44.8 | 0.62 | 71.9 |
| 30 | 49.2 | 0.68 | 72.3 |
Schwierige Negativbeispiele sind für die Erkennung mit offenem Vokabular entscheidend und verbessern IL_MCC um 54,5 % (0,44 → 0,68).
Skalierung der Trainingsdaten#
| Datenquellen | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| Nur externe Daten | 30.9 | 0.46 | 66.3 |
| Externe + synthetische Daten | 39.7 | 0.57 | 70.6 |
| Externe Daten + HQ | 51.8 | 0.71 | 73.2 |
| Alle drei | 54.3 | 0.74 | 73.5 |
Hochwertige Annotationen von Menschen führen zu deutlichen Verbesserungen gegenüber synthetischen oder ausschließlich externen Daten. Hintergrundinformationen zu Praktiken für die Datenqualität findest du unter Datenerfassung und Annotation.
Anwendungsfälle#
Die Fähigkeit von SAM 3 zur Konzeptsegmentierung ermöglicht neue Anwendungsfälle:
- Inhaltsmoderation: Finde alle Vorkommen bestimmter Inhaltstypen in Medienbibliotheken
- E-Commerce: Segmentiere alle Produkte eines bestimmten Typs in Katalogbildern und unterstütze so die automatische Annotation
- Medizinische Bildgebung: Erkenne alle Vorkommen bestimmter Gewebetypen oder Anomalien
- Autonome Systeme: Verfolge alle Verkehrsschilder, Fußgänger oder Fahrzeuge einer bestimmten Kategorie
- Videoanalyse: Zähle und verfolge alle Personen, die bestimmte Kleidung tragen oder bestimmte Handlungen ausführen
- Datensatzannotation: Annotiere schnell alle Vorkommen seltener Objektkategorien
- Wissenschaftliche Forschung: Quantifiziere und analysiere alle Proben, die bestimmten Kriterien entsprechen
SAM 3 Agent: Erweitertes Sprachverständnis#
SAM 3 lässt sich mit multimodalen großen Sprachmodellen (MLLMs) kombinieren, um komplexe Anfragen zu bearbeiten, die Schlussfolgerungen erfordern – ähnlich wie Systeme mit offenem Vokabular wie OWLv2 und T-Rex.
Leistung bei Schlussfolgerungsaufgaben#
| Benchmark | Kennzahl | SAM 3 Agent (Gemini 2.5 Pro) | Bisheriger Bestwert |
|---|---|---|---|
| ReasonSeg (Validierung) | gIoU | 76.0 | 65.0 (Spitzenwert) |
| ReasonSeg (Test) | gIoU | 73.8 | 61.3 (Spitzenwert) |
| OmniLabel (Validierung) | AP | 46.7 | 36.5 (REAL) |
| RefCOCO+ | Acc | 91.2 | 89.3 (LISA) |
Beispiele für komplexe Anfragen#
SAM 3 Agent kann Anfragen bearbeiten, die Schlussfolgerungen erfordern:
- „Personen, die sich hinsetzen, aber keine Geschenkbox in den Händen halten“
- „Der Hund, der der Kamera am nächsten ist und kein Halsband trägt“
- „Rote Objekte, die größer als die Hand der Person sind“
Das MLLM schlägt SAM 3 einfache Anfragen in Form von Nominalphrasen vor, analysiert die zurückgegebenen Masken und wiederholt den Vorgang, bis es zufrieden ist.
Einschränkungen#
SAM 3 stellt zwar einen bedeutenden Fortschritt dar, hat aber gewisse Einschränkungen:
- Komplexität von Phrasen: Am besten für einfache Nominalphrasen geeignet; lange beschreibende Ausdrücke oder komplexe Schlussfolgerungen erfordern möglicherweise die Integration eines MLLM
- Umgang mit Mehrdeutigkeit: Manche Konzepte bleiben grundsätzlich mehrdeutig (z. B. „kleines Fenster“, „gemütliches Zimmer“)
- Rechenaufwand: Größer und langsamer als spezialisierte Erkennungsmodelle wie YOLO
- Umfang des Vokabulars: Auf elementare visuelle Konzepte ausgerichtet; ohne Unterstützung durch ein MLLM sind die Möglichkeiten zum kompositionalen Schlussfolgern begrenzt
- Seltene Konzepte: Die Leistung kann bei äußerst seltenen oder feingranularen Konzepten nachlassen, die in den Trainingsdaten nur unzureichend vertreten sind
Zitat#
@misc{carion2025sam3,
title = {SAM 3: Segment Anything with Concepts},
author = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
year = {2025},
eprint = {2511.16719},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2511.16719}
}Häufig gestellte Fragen#
SAM 3 wurde am 19. November 2025 von Meta veröffentlicht und ist vollständig in das Paket
ultralyticsintegriert. Es unterstützt den Vorhersagemodus und den Tracking-Modus.Ja! SAM 3 ist vollständig in das Ultralytics-Python-Paket integriert und umfasst Konzeptsegmentierung, visuelle Prompts im Stil von SAM 2 sowie die Verfolgung mehrerer Objekte in Videos. SAM 3 und SAM 3.1 unterstützen außerdem die Funktion für intelligente Annotation auf der Ultralytics Platform. Dort ist SAM 3.1 das Standardmodell, und du kannst Bilder mit nur wenigen Klicks annotieren.
Ja, für Bildvorhersagen. Lade
sam3.1_multiplex.ptüberall dort, wo in den Bildbeispielen auf dieser Seitesam3.ptverwendet wird:SAM("sam3.1_multiplex.pt")für Punkt- und Box-Prompts undSAM3SemanticPredictorfür Text- und Beispiel-Prompts. Die Videoverfolgung mit Object Multiplex wird noch nicht unterstützt. Verwende daher weiterhinsam3.ptmit den Videovorhersagern. Unter SAM 3.1 findest du die Benchmarks von Meta.PCS ist eine neue, mit SAM 3 eingeführte Aufgabe, bei der alle Vorkommen eines visuellen Konzepts in einem Bild oder Video segmentiert werden. Im Gegensatz zur herkömmlichen Segmentierung, die auf ein bestimmtes Objektvorkommen abzielt, findet PCS jedes Vorkommen einer Kategorie. Zum Beispiel:
- Text-Prompt: „gelber Schulbus“ → segmentiert alle gelben Schulbusse in der Szene
- Bildbeispiel: Einen Hund einkreisen → alle Hunde im Bild segmentieren
- Kombiniert: „gestreifte Katze“ + Beispielbox → alle gestreiften Katzen segmentieren, die dem Beispiel entsprechen
Weitere Hintergrundinformationen findest du zu Objekterkennung und Instanzsegmentierung.
Merkmal SAM 2 SAM 3 Aufgabe Ein einzelnes Objekt pro Prompt Alle Instanzen eines Konzepts Prompt-Typen Punkte, Boxen, Masken + Textphrasen, Bildbeispiele Erkennungsfähigkeit Benötigt einen externen Detektor Integrierter Detektor mit offenem Vokabular Erkennung Nur geometriebasiert Text- und visuelle Erkennung Architektur Nur Tracker Detektor + Tracker mit Presence-Head Zero-Shot-Leistung Nicht zutreffend (benötigt visuelle Prompts) 47,0 AP auf LVIS, 2× besser auf SA-Co Interaktive Verfeinerung Nur Klicks Klicks + Verallgemeinerung anhand von Beispielen SAM 3 behält die Abwärtskompatibilität mit visuellen Prompts von SAM 2 bei und ergänzt sie um Konzeptfunktionen.
SAM 3 wird mit dem Datensatz Segment Anything with Concepts (SA-Co) trainiert:
Trainingsdaten:
- 5,2 Mio. Bilder mit 4 Mio. einzigartigen Nominalphrasen (SA-Co/HQ) – hochwertige Annotationen von Menschen
- 52,5 Tsd. Videos mit 24,8 Tsd. einzigartigen Nominalphrasen (SA-Co/VIDEO)
- 1,4 Mrd. synthetische Masken für 38 Mio. Nominalphrasen (SA-Co/SYN)
- 15 externe Datensätze, ergänzt um schwierige Negativbeispiele (SA-Co/EXT)
Benchmark-Daten:
- 214 Tsd. einzigartige Konzepte in 126 Tsd. Bildern/Videos
- 50× mehr Konzepte als in bestehenden Benchmarks (z. B. umfasst LVIS ~4 Tsd. Konzepte)
- Dreifachannotation auf SA-Co/Gold zur Bestimmung der Grenzen menschlicher Leistung
Dieser enorme Umfang und die Vielfalt ermöglichen SAM 3 eine hervorragende Zero-Shot-Verallgemeinerung über Konzepte mit offenem Vokabular hinweg.
SAM 3 und YOLO26 eignen sich für unterschiedliche Anwendungsfälle:
Vorteile von SAM 3:
- Offenes Vokabular: Segmentiert jedes Konzept anhand von Text-Prompts, ohne dass ein Training erforderlich ist
- Zero-Shot: Funktioniert sofort mit neuen Kategorien
- Interaktiv: Die Verfeinerung anhand von Beispielen lässt sich auf ähnliche Objekte übertragen
- Konzeptbasiert: Findet automatisch alle Instanzen einer Kategorie
- Genauigkeit: 47,0 AP bei der Zero-Shot-Instanzsegmentierung auf LVIS
Vorteile von YOLO26:
- Geschwindigkeit: Die Inferenz ist um Größenordnungen schneller; optional steht ein durchgängiger Head ohne NMS zur Verfügung
- Effizienz: 539× kleinere Modelle (6,4 MB gegenüber 3,45 GB)
- Ressourcenschonend: Läuft auf Edge-Geräten und Mobilgeräten
- Echtzeit: Für den Einsatz in Produktivumgebungen optimiert
Empfehlung:
- Verwende SAM 3 für flexible Segmentierung mit offenem Vokabular, wenn du alle Instanzen von Konzepten finden möchtest, die durch Text oder Beispiele beschrieben werden.
- Verwende YOLO26 für den schnellen Einsatz in Produktivumgebungen, wenn die Kategorien im Voraus bekannt sind.
- Verwende SAM 2 für die interaktive Segmentierung einzelner Objekte mit geometrischen Prompts.
SAM 3 ist für einfache Nominalphrasen ausgelegt (z. B. „roter Apfel“, „Person mit Hut“). Bei komplexen Anfragen, die Schlussfolgerungen erfordern, kannst du SAM 3 mit einem MLLM als SAM 3 Agent kombinieren:
Einfache Anfragen (SAM 3 nativ):
- „gelber Schulbus“
- „gestreifte Katze“
- „Person mit rotem Hut“
Komplexe Anfragen (SAM 3 Agent mit MLLM):
- „Personen, die sitzen, aber keine Geschenkbox halten“
- „Der Hund, der der Kamera am nächsten ist und kein Halsband trägt“
- „Rote Objekte, die größer als die Hand der Person sind“
SAM 3 Agent erreicht 76,0 gIoU auf der Validierungsmenge von ReasonSeg (gegenüber dem bisherigen Bestwert von 65,0, eine Verbesserung um +16,9 %), indem die Segmentierung von SAM 3 mit den Schlussfolgerungsfähigkeiten eines MLLM kombiniert wird.
Auf dem SA-Co/Gold-Benchmark mit dreifacher menschlicher Annotation:
- Untere Grenze menschlicher Leistung: 74,2 CGF1 (konservativste annotierende Person)
- Leistung von SAM 3: 65,0 CGF1
- Ergebnis: 88 % der geschätzten unteren Grenze menschlicher Leistung
- Obere Grenze menschlicher Leistung: 81,4 CGF1 (großzügigste annotierende Person)
SAM 3 erzielt eine starke Leistung und nähert sich bei der Segmentierung von Konzepten mit offenem Vokabular der Genauigkeit von Menschen an. Der Unterschied zeigt sich vor allem bei mehrdeutigen oder subjektiven Konzepten (z. B. „kleines Fenster“, „gemütliches Zimmer“).