COCO-Seg-Datensatz#
Der COCO-Seg-Datensatz stellt COCO (Objekte in ihrem Kontext (COCO)) Instanzsegmentierungsmasken bereit – 118.287 Trainings- und 5.000 Validierungsbilder mit Polygonmasken für 80 Objektkategorien – im Ultralytics YOLO-Beschriftungsformat. Er verwendet die Originalbilder und nativen Segmentierungsannotationen von COCO, die für das YOLO-Training konvertiert wurden, und ist damit eine wichtige Ressource für Forschende und Entwickler, die an Aufgaben der Instanzsegmentierung arbeiten.
Auf COCO-Seg vortrainierte Modelle#
| Modell | Größe (Pixel) | mAPBox 50–95 (e2e) | mAPMaske 50–95 (e2e) | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n-seg | 640 | 39.6 | 33.9 | 53.3 ± 0.5 | 2.1 ± 0.0 | 2.7 | 9.3 |
| YOLO26s-seg | 640 | 47.3 | 40.0 | 118.4 ± 0.9 | 3.3 ± 0.0 | 10.4 | 34.5 |
| YOLO26m-seg | 640 | 52.5 | 44.1 | 328.2 ± 2.4 | 6.7 ± 0.1 | 23.6 | 121.7 |
| YOLO26l-seg | 640 | 54.4 | 45.5 | 387.0 ± 3.7 | 8.0 ± 0.1 | 28.0 | 140.1 |
| YOLO26x-seg | 640 | 56.5 | 47.0 | 787.0 ± 6.8 | 16.4 ± 0.1 | 62.8 | 314.0 |
Wichtige Funktionen#
- COCO-Seg stellt Instanzsegmentierungsmasken für 123.287 annotierte COCO-train2017/val2017-Bilder bereit (118.287 Training + 5.000 Validierung) – von der insgesamt etwa ~330.000 Bilder umfassenden COCO-Veröffentlichung.
- Der Datensatz besteht aus denselben 80 Objektkategorien wie der ursprüngliche COCO-Datensatz.
- Die Annotationen stellen Instanzsegmentierungsmasken im YOLO-Polygon-Beschriftungsformat bereit.
- COCO-Seg stellt standardisierte mAP- und mAR-Metriken zur Bewertung der Leistung bei der Instanzsegmentierung bereit und ermöglicht dadurch einen effektiven Vergleich der Modellleistung.
- Downloadgröße: Bei der ersten Verwendung etwa ~20,3 GB (
train2017.zip+val2017.zip+ Beschriftungen). Die 7 GB große Dateitest2017.zipwird nicht automatisch abgerufen, da für diese Bilder keine Ground-Truth-Daten vorliegen und sie nur für eine test-dev2017-Einreichung benötigt werden.
Datensatzstruktur#
Der COCO-Seg-Datensatz ist in drei Teilmengen unterteilt:
- Train2017: 118.287 Bilder zum Trainieren von Modellen für die Instanzsegmentierung.
- Val2017: 5.000 Bilder, die während der Modellentwicklung zur Validierung verwendet werden.
- Test-dev2017: 20.288 der 40.670 test2017-Bilder, die zum Benchmarking verwendet werden. Die Ground-Truth-Annotationen für diese Teilmenge sind nicht öffentlich verfügbar. Daher müssen Vorhersagen zur Bewertung an den COCO-Bewertungsserver übermittelt werden.
Für kleinere Experimente findest du die Teilmengen COCO128-Seg (128 Bilder) und COCO8-Seg (8 Bilder).
Anwendungen#
COCO-Seg wird häufig zum Trainieren und Bewerten von Deep-Learning-Modellen für die Instanzsegmentierung eingesetzt, etwa der YOLO-Modelle. Die große Anzahl annotierter Bilder, die Vielfalt der Objektkategorien und die standardisierten Bewertungsmetriken machen den Datensatz zu einer unverzichtbaren Ressource für Forschende und Praktiker im Bereich Computer Vision. Die vollständigen COCO-Seg-Annotationen können außerdem auf der Ultralytics Platform durchsucht und verwaltet werden.
Dataset-YAML#
Eine YAML-Datei dient zum Definieren der Datensatzkonfiguration. Sie enthält Informationen zu den Pfaden, Klassen und weiteren relevanten Eigenschaften des Datensatzes. Beim COCO-Seg-Datensatz wird die Datei coco.yaml unter https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco.yaml verwaltet.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# COCO 2017 dataset https://cocodataset.org by Microsoft
# Documentation: https://docs.ultralytics.com/datasets/detect/coco
# Example usage: yolo train data=coco.yaml
# parent
# ├── ultralytics
# └── datasets
# └── coco ← downloads here (20.3 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco # dataset root dir
train: train2017.txt # train images (relative to 'path') 118287 images
val: val2017.txt # val images (relative to 'path') 5000 images
test: test-dev2017.txt # 20288 of 40670 images, submit via https://cocodataset.org/#detection-eval
# Classes
names:
0: person
1: bicycle
2: car
3: motorcycle
4: airplane
5: bus
6: train
7: truck
8: boat
9: traffic light
10: fire hydrant
11: stop sign
12: parking meter
13: bench
14: bird
15: cat
16: dog
17: horse
18: sheep
19: cow
20: elephant
21: bear
22: zebra
23: giraffe
24: backpack
25: umbrella
26: handbag
27: tie
28: suitcase
29: frisbee
30: skis
31: snowboard
32: sports ball
33: kite
34: baseball bat
35: baseball glove
36: skateboard
37: surfboard
38: tennis racket
39: bottle
40: wine glass
41: cup
42: fork
43: knife
44: spoon
45: bowl
46: banana
47: apple
48: sandwich
49: orange
50: broccoli
51: carrot
52: hot dog
53: pizza
54: donut
55: cake
56: chair
57: couch
58: potted plant
59: bed
60: dining table
61: toilet
62: tv
63: laptop
64: mouse
65: remote
66: keyboard
67: cell phone
68: microwave
69: oven
70: toaster
71: sink
72: refrigerator
73: book
74: clock
75: vase
76: scissors
77: teddy bear
78: hair drier
79: toothbrush
# Download script/URL (optional)
download: |
from pathlib import Path
from ultralytics.utils import ASSETS_URL
from ultralytics.utils.downloads import download
# Download labels
segments = True # segment or box labels
dir = Path(yaml["path"]) # dataset root dir
urls = [ASSETS_URL + ("/coco2017labels-segments.zip" if segments else "/coco2017labels.zip")] # labels
download(urls, dir=dir.parent)
# Download data (test2017.zip excluded: ground truth is withheld, only used for the eval-server test-dev split)
urls = [
"http://images.cocodataset.org/zips/train2017.zip", # 19G, 118k images
"http://images.cocodataset.org/zips/val2017.zip", # 1G, 5k images
]
download(urls, dir=dir / "images", threads=3)Verwendung#
Um ein YOLO26n-seg-Modell 100 Epochen lang mit einer Bildgröße von 640 auf dem COCO-Seg-Datensatz zu trainieren, kannst du die folgenden Codeausschnitte verwenden. Eine vollständige Liste der verfügbaren Argumente findest du auf der Seite zum Training des Modells.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-seg.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="coco.yaml", epochs=100, imgsz=640)Beispielbilder und Annotationen#
COCO-Seg enthält dieselben vielfältigen Bilder, Objektkategorien und komplexen Szenen wie COCO. Die Instanzsegmentierungsmasken werden im YOLO-Beschriftungsformat bereitgestellt. Hier siehst du einige Beispiele für Bilder aus dem Datensatz sowie die zugehörigen Instanzsegmentierungsmasken:

- Mosaikbild: Dieses Bild zeigt einen Trainingsstapel, der aus zu einem Mosaik zusammengesetzten Datensatzbildern besteht. Mosaikbildung ist eine beim Training verwendete Technik, bei der mehrere Bilder zu einem einzigen Bild kombiniert werden, um die Vielfalt der Objekte und Szenen in jedem Trainingsstapel zu erhöhen. Dadurch kann das Modell besser auf unterschiedliche Objektgrößen, Seitenverhältnisse und Kontexte generalisieren.
Zitate und Danksagungen#
Wenn du den COCO-Seg-Datensatz für deine Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte die ursprüngliche COCO-Veröffentlichung und erwähne die Erweiterung zu COCO-Seg:
@misc{lin2015microsoft,
title={Microsoft COCO: Common Objects in Context},
author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
year={2015},
eprint={1405.0312},
archivePrefix={arXiv},
primaryClass={cs.CV}
}Wir danken dem COCO-Konsortium für die Erstellung und Pflege dieser unschätzbaren Ressource für die Computer-Vision-Community. Weitere Informationen zum COCO-Datensatz und seinen Erstellern findest du auf der Website des COCO-Datensatzes.
FAQ#
COCO-Seg ist die Verpackung der nativen Instanzsegmentierungsmasken von COCO im Ultralytics YOLO-Format (Objekte in ihrem Kontext (COCO)) für dieselben 118.287 train2017- und 5.000 val2017-Bilder. Die ursprünglichen COCO-Annotationen enthalten bereits diese Polygonmasken für alle 80 Objektkategorien. COCO-Seg konvertiert sie in das YOLO-Beschriftungsformat, das für das Training der Objektinstanzsegmentierung verwendet wird.
Um ein YOLO26n-seg-Modell 100 Epochen lang mit einer Bildgröße von 640 auf dem COCO-Seg-Datensatz zu trainieren, kannst du die folgenden Codeausschnitte verwenden. Eine detaillierte Liste der verfügbaren Trainingsargumente findest du auf der Seite zum Training des Modells.
Trainingsbeispielfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-seg.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="coco.yaml", epochs=100, imgsz=640)Der COCO-Seg-Datensatz umfasst mehrere wesentliche Merkmale:
- Stellt Instanzsegmentierungsmasken für 123.287 annotierte COCO-train2017/val2017-Bilder bereit (118.287 Training + 5.000 Validierung).
- Annotiert dieselben 80 Objektkategorien wie der ursprüngliche COCO-Datensatz.
- Stellt Instanzsegmentierungsmasken im YOLO-Polygon-Beschriftungsformat bereit.
- Verwendet standardisierte Bewertungsmetriken wie die mittlere Präzision Precision (mAP) und den mittleren Recall (mAR) für Aufgaben der Instanzsegmentierung.
Der COCO-Seg-Datensatz unterstützt mehrere vortrainierte YOLO26-Segmentierungsmodelle mit unterschiedlichen Leistungsmetriken. Hier findest du eine Zusammenfassung der verfügbaren Modelle und ihrer wichtigsten Metriken:
Modell Größe
(Pixel)mAPBox
50–95 (e2e)mAPMaske
50–95 (e2e)Geschwindigkeit
CPU ONNX
(ms)Geschwindigkeit
T4 TensorRT10
(ms)Parameter
(M)FLOPs
(B)YOLO26n-seg 640 39.6 33.9 53.3 ± 0.5 2.1 ± 0.0 2.7 9.3 YOLO26s-seg 640 47.3 40.0 118.4 ± 0.9 3.3 ± 0.0 10.4 34.5 YOLO26m-seg 640 52.5 44.1 328.2 ± 2.4 6.7 ± 0.1 23.6 121.7 YOLO26l-seg 640 54.4 45.5 387.0 ± 3.7 8.0 ± 0.1 28.0 140.1 YOLO26x-seg 640 56.5 47.0 787.0 ± 6.8 16.4 ± 0.1 62.8 314.0 Diese Modelle reichen vom kompakten YOLO26n-seg bis zum leistungsfähigeren YOLO26x-seg und bieten unterschiedliche Kompromisse zwischen Geschwindigkeit und Genauigkeit für verschiedene Anwendungsanforderungen. Weitere Informationen zur Modellauswahl findest du auf der Ultralytics-Modellseite.
Der COCO-Seg-Datensatz ist für bestimmte Trainings- und Bewertungsanforderungen in drei Teilmengen unterteilt:
- Train2017: Umfasst 118.287 Bilder, die hauptsächlich zum Trainieren von Modellen für die Instanzsegmentierung verwendet werden.
- Val2017: Umfasst 5.000 Bilder, die während des Trainingsprozesses zur Validierung verwendet werden.
- Test-dev2017: Umfasst 20.288 der 40.670 test2017-Bilder, die zum Testen und Benchmarking trainierter Modelle vorgesehen sind. Beachte, dass die Ground-Truth-Annotationen für diese Teilmenge nicht öffentlich verfügbar sind und die Leistungsergebnisse zur Bewertung an den COCO-Bewertungsserver übermittelt werden.
Für kleinere Experimente kannst du auch den COCO128-Seg-Datensatz (128 Bilder) oder den COCO8-Seg-Datensatz in Betracht ziehen, eine kompakte Version mit nur 8 Bildern aus dem COCO-train2017-Satz.



