COCO-Seg-Datensatz#
Der COCO-Seg-Datensatz stellt COCO (Alltagsobjekte in Kontext) mit Masken zur Instanzsegmentierung bereit: 118.287 Trainings- und 5.000 Validierungsbilder mit Polygonmasken aus 80 Objektkategorien im Ultralytics-YOLO-Labelformat. Er verwendet die Originalbilder und nativen Segmentierungsannotationen von COCO, die für das YOLO-Training umgewandelt wurden, und ist damit eine wichtige Ressource für Forschende und Entwickler, die an Aufgaben der Instanzsegmentierung arbeiten.
Mit COCO-Seg vortrainierte Modelle#
| Modell | Größe (Pixel) | mAPBox 50-95(e2e) | mAPMaske 50-95(e2e) | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n-seg | 640 | 39.6 | 33.9 | 53.3 ± 0.5 | 2.1 ± 0.0 | 2.7 | 9.3 |
| YOLO26s-seg | 640 | 47.3 | 40.0 | 118.4 ± 0.9 | 3.3 ± 0.0 | 10.4 | 34.5 |
| YOLO26m-seg | 640 | 52.5 | 44.1 | 328.2 ± 2.4 | 6.7 ± 0.1 | 23.6 | 121.7 |
| YOLO26l-seg | 640 | 54.4 | 45.5 | 387.0 ± 3.7 | 8.0 ± 0.1 | 28.0 | 140.1 |
| YOLO26x-seg | 640 | 56.5 | 47.0 | 787.0 ± 6.8 | 16.4 ± 0.1 | 62.8 | 314.0 |
Wichtige Funktionen#
- COCO-Seg bietet Masken zur Instanzsegmentierung für 123.287 beschriftete COCO-Bilder aus train2017/val2017 (118.287 Trainingsbilder + 5.000 Validierungsbilder) und umfasst damit einen Teil der insgesamt ~330K Bilder der COCO-Veröffentlichung.
- Der Datensatz umfasst dieselben 80 Objektkategorien wie der ursprüngliche COCO-Datensatz.
- Die Annotationen enthalten Masken zur Instanzsegmentierung im YOLO-Polygon-Labelformat.
- COCO-Seg stellt standardisierte mAP- und mAR-Metriken zur Bewertung der Leistung bei der Instanzsegmentierung bereit und ermöglicht so einen aussagekräftigen Vergleich der Modellleistung.
- Downloadgröße: ~20,3 GB bei der ersten Verwendung (
train2017.zip+val2017.zip+ Labels). Die 7-GB-Dateitest2017.zipwird nicht automatisch abgerufen, da für diese Bilder die Ground Truth zurückgehalten wird und sie nur für eine test-dev2017-Einreichung benötigt werden.
Datensatzstruktur#
Der COCO-Seg-Datensatz ist in drei Teilmengen unterteilt:
- Train2017: 118.287 Bilder zum Trainieren von Modellen zur Instanzsegmentierung.
- Val2017: 5.000 Bilder, die während der Modellentwicklung zur Validierung verwendet werden.
- Test-dev2017: 20.288 der 40.670 test2017-Bilder, die für Benchmarking verwendet werden. Die Ground-Truth-Annotationen für diese Teilmenge sind nicht öffentlich verfügbar. Daher müssen Vorhersagen zur Bewertung beim COCO-Evaluierungsserver eingereicht werden.
Für kleinere Experimente sieh dir die Teilmengen COCO128-Seg (128 Bilder) und COCO8-Seg (8 Bilder) an.
Anwendungsfälle#
COCO-Seg wird häufig zum Trainieren und Bewerten von Modellen für Deep Learning im Bereich der Instanzsegmentierung verwendet, etwa der YOLO-Modelle. Die große Zahl annotierter Bilder, die Vielfalt der Objektkategorien und die standardisierten Bewertungsmetriken machen den Datensatz zu einer unverzichtbaren Ressource für Forschende und Fachleute im Bereich Computer Vision. Die vollständigen COCO-Seg-Annotationen lassen sich außerdem auf der Ultralytics Platform durchsuchen und verwalten.
YAML-Datei des Datensatzes#
Eine YAML-Datei dient zur Definition der Datensatzkonfiguration. Sie enthält Informationen zu den Pfaden, Klassen und weiteren relevanten Eigenschaften des Datensatzes. Für den COCO-Seg-Datensatz wird die Datei coco.yaml unter https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco.yaml verwaltet.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# COCO 2017 dataset https://cocodataset.org by Microsoft
# Documentation: https://docs.ultralytics.com/datasets/detect/coco
# Example usage: yolo train data=coco.yaml
# parent
# ├── ultralytics
# └── datasets
# └── coco ← downloads here (20.3 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco # dataset root dir
train: train2017.txt # train images (relative to 'path') 118287 images
val: val2017.txt # val images (relative to 'path') 5000 images
test: test-dev2017.txt # 20288 of 40670 images, submit via https://cocodataset.org/#detection-eval
# Classes
names:
0: person
1: bicycle
2: car
3: motorcycle
4: airplane
5: bus
6: train
7: truck
8: boat
9: traffic light
10: fire hydrant
11: stop sign
12: parking meter
13: bench
14: bird
15: cat
16: dog
17: horse
18: sheep
19: cow
20: elephant
21: bear
22: zebra
23: giraffe
24: backpack
25: umbrella
26: handbag
27: tie
28: suitcase
29: frisbee
30: skis
31: snowboard
32: sports ball
33: kite
34: baseball bat
35: baseball glove
36: skateboard
37: surfboard
38: tennis racket
39: bottle
40: wine glass
41: cup
42: fork
43: knife
44: spoon
45: bowl
46: banana
47: apple
48: sandwich
49: orange
50: broccoli
51: carrot
52: hot dog
53: pizza
54: donut
55: cake
56: chair
57: couch
58: potted plant
59: bed
60: dining table
61: toilet
62: tv
63: laptop
64: mouse
65: remote
66: keyboard
67: cell phone
68: microwave
69: oven
70: toaster
71: sink
72: refrigerator
73: book
74: clock
75: vase
76: scissors
77: teddy bear
78: hair drier
79: toothbrush
# Download script/URL (optional)
download: |
from pathlib import Path
from ultralytics.utils import ASSETS_URL
from ultralytics.utils.downloads import download
# Download labels
segments = True # segment or box labels
dir = Path(yaml["path"]) # dataset root dir
urls = [ASSETS_URL + ("/coco2017labels-segments.zip" if segments else "/coco2017labels.zip")] # labels
download(urls, dir=dir.parent)
# Download data (test2017.zip excluded: ground truth is withheld, only used for the eval-server test-dev split)
urls = [
"http://images.cocodataset.org/zips/train2017.zip", # 19G, 118k images
"http://images.cocodataset.org/zips/val2017.zip", # 1G, 5k images
]
download(urls, dir=dir / "images", threads=3)Verwendung#
Um ein YOLO26n-seg-Modell mit dem COCO-Seg-Datensatz 100 Epochen lang bei einer Bildgröße von 640 zu trainieren, kannst du die folgenden Codeausschnitte verwenden. Eine vollständige Liste der verfügbaren Argumente findest du auf der Seite zum Training des Modells.
from ultralytics import YOLO
# Ein Modell laden
model = YOLO("yolo26n-seg.pt") # ein vortrainiertes Modell laden (für das Training empfohlen)
# Das Modell trainieren
results = model.train(data="coco.yaml", epochs=100, imgsz=640)Beispielbilder und Annotationen#
COCO-Seg enthält dieselbe Vielfalt an Bildern, Objektkategorien und komplexen Szenen wie COCO. Die Instanzsegmentierungsmasken liegen im YOLO-Label-Format vor. Hier siehst du einige Beispielbilder aus dem Datensatz und die zugehörigen Instanzsegmentierungsmasken:

- Mosaikbild: Dieses Bild zeigt einen Trainingsbatch aus mosaikierten Datensatzbildern. Mosaikbildung ist eine beim Training eingesetzte Technik, bei der mehrere Bilder zu einem einzigen Bild kombiniert werden, um die Vielfalt der Objekte und Szenen in jedem Trainingsbatch zu erhöhen. Dadurch kann das Modell besser auf unterschiedliche Objektgrößen, Seitenverhältnisse und Kontexte generalisieren.
Zitate und Danksagungen#
Wenn du den COCO-Seg-Datensatz in deiner Forschung oder Entwicklungsarbeit verwendest, zitiere bitte das ursprüngliche COCO-Paper und erwähne die Erweiterung zu COCO-Seg:
@misc{lin2015microsoft,
title={Microsoft COCO: Common Objects in Context},
author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
year={2015},
eprint={1405.0312},
archivePrefix={arXiv},
primaryClass={cs.CV}
}Wir danken dem COCO-Konsortium für die Erstellung und Pflege dieser wertvollen Ressource für die Computer-Vision-Community. Weitere Informationen zum COCO-Datensatz und seinen Erstellern findest du auf der COCO-Datensatzwebsite.
Häufig gestellte Fragen#
COCO-Seg ist die Verpackung der nativen Instanzsegmentierungsmasken von COCO (Alltagsobjekte im Kontext) im Ultralytics-YOLO-Format für dieselben 118.287 train2017- und 5.000 val2017-Bilder. Die ursprünglichen COCO-Annotationen enthalten bereits diese Polygonmasken für alle 80 Objektkategorien. COCO-Seg wandelt sie in das YOLO-Label-Format um, das für das Training zur Objektinstanzsegmentierung verwendet wird.
Um ein YOLO26n-seg-Modell mit dem COCO-Seg-Datensatz 100 Epochen lang bei einer Bildgröße von 640 zu trainieren, kannst du die folgenden Codeausschnitte verwenden. Eine ausführliche Liste der verfügbaren Trainingsargumente findest du auf der Seite zum Training des Modells.
Trainingsbeispielfrom ultralytics import YOLO # Ein Modell laden model = YOLO("yolo26n-seg.pt") # ein vortrainiertes Modell laden (für das Training empfohlen) # Das Modell trainieren results = model.train(data="coco.yaml", epochs=100, imgsz=640)Der COCO-Seg-Datensatz bietet mehrere wichtige Merkmale:
- Stellt Instanzsegmentierungsmasken für 123.287 annotierte COCO-train2017-/val2017-Bilder bereit (118.287 Train + 5.000 Val).
- Annotiert dieselben 80 Objektkategorien wie das ursprüngliche COCO.
- Stellt Instanzsegmentierungsmasken im YOLO-Polygon-Label-Format bereit.
- Verwendet standardisierte Bewertungsmetriken wie die mittlere durchschnittliche Präzision (mAP) und den mittleren durchschnittlichen Recall (mAR) für Aufgaben der Instanzsegmentierung.
Der COCO-Seg-Datensatz unterstützt mehrere vortrainierte YOLO26-Segmentierungsmodelle mit unterschiedlichen Leistungsmetriken. Hier findest du eine Übersicht der verfügbaren Modelle und ihrer wichtigsten Metriken:
Modell Größe
(Pixel)mAPBox
50-95(e2e)mAPMaske
50-95(e2e)Geschwindigkeit
CPU ONNX
(ms)Geschwindigkeit
T4 TensorRT10
(ms)Parameter
(M)FLOPs
(B)YOLO26n-seg 640 39.6 33.9 53.3 ± 0.5 2.1 ± 0.0 2.7 9.3 YOLO26s-seg 640 47.3 40.0 118.4 ± 0.9 3.3 ± 0.0 10.4 34.5 YOLO26m-seg 640 52.5 44.1 328.2 ± 2.4 6.7 ± 0.1 23.6 121.7 YOLO26l-seg 640 54.4 45.5 387.0 ± 3.7 8.0 ± 0.1 28.0 140.1 YOLO26x-seg 640 56.5 47.0 787.0 ± 6.8 16.4 ± 0.1 62.8 314.0 Diese Modelle reichen vom leichten YOLO26n-seg bis zum leistungsstärkeren YOLO26x-seg und bieten unterschiedliche Kompromisse zwischen Geschwindigkeit und Genauigkeit für verschiedene Anwendungsanforderungen. Weitere Informationen zur Modellauswahl findest du auf der Ultralytics-Modellseite.
Der COCO-Seg-Datensatz ist für bestimmte Anforderungen an Training und Bewertung in drei Teilmengen unterteilt:
- Train2017: Umfasst 118.287 Bilder, die vorwiegend zum Trainieren von Modellen zur Instanzsegmentierung verwendet werden.
- Val2017: Umfasst 5.000 Bilder, die während des Trainings zur Validierung verwendet werden.
- Test-dev2017: Umfasst 20.288 der 40.670 test2017-Bilder, die für Tests und das Benchmarking trainierter Modelle vorgesehen sind. Beachte, dass die Ground-Truth-Annotationen für diese Teilmenge nicht öffentlich verfügbar sind und die Leistungsergebnisse zur Bewertung beim COCO-Evaluierungsserver eingereicht werden.
Für kleinere Experimente kannst du auch den COCO128-Seg-Datensatz (128 Bilder) oder den COCO8-Seg-Datensatz in Betracht ziehen, eine kompakte Version mit nur 8 Bildern aus dem COCO-train2017-Datensatz.



