Ultralytics YOLO27:

COCO-Seg-Datensatz#

Der COCO-Seg-Datensatz stellt COCO (Alltagsobjekte in Kontext) mit Masken zur Instanzsegmentierung bereit: 118.287 Trainings- und 5.000 Validierungsbilder mit Polygonmasken aus 80 Objektkategorien im Ultralytics-YOLO-Labelformat. Er verwendet die Originalbilder und nativen Segmentierungsannotationen von COCO, die für das YOLO-Training umgewandelt wurden, und ist damit eine wichtige Ressource für Forschende und Entwickler, die an Aufgaben der Instanzsegmentierung arbeiten.

Mit COCO-Seg vortrainierte Modelle#

ModellGröße
(Pixel)
mAPBox
50-95(e2e)
mAPMaske
50-95(e2e)
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLO26n-seg64039.633.953.3 ± 0.52.1 ± 0.02.79.3
YOLO26s-seg64047.340.0118.4 ± 0.93.3 ± 0.010.434.5
YOLO26m-seg64052.544.1328.2 ± 2.46.7 ± 0.123.6121.7
YOLO26l-seg64054.445.5387.0 ± 3.78.0 ± 0.128.0140.1
YOLO26x-seg64056.547.0787.0 ± 6.816.4 ± 0.162.8314.0

Wichtige Funktionen#

  • COCO-Seg bietet Masken zur Instanzsegmentierung für 123.287 beschriftete COCO-Bilder aus train2017/val2017 (118.287 Trainingsbilder + 5.000 Validierungsbilder) und umfasst damit einen Teil der insgesamt ~330K Bilder der COCO-Veröffentlichung.
  • Der Datensatz umfasst dieselben 80 Objektkategorien wie der ursprüngliche COCO-Datensatz.
  • Die Annotationen enthalten Masken zur Instanzsegmentierung im YOLO-Polygon-Labelformat.
  • COCO-Seg stellt standardisierte mAP- und mAR-Metriken zur Bewertung der Leistung bei der Instanzsegmentierung bereit und ermöglicht so einen aussagekräftigen Vergleich der Modellleistung.
  • Downloadgröße: ~20,3 GB bei der ersten Verwendung (train2017.zip + val2017.zip + Labels). Die 7-GB-Datei test2017.zip wird nicht automatisch abgerufen, da für diese Bilder die Ground Truth zurückgehalten wird und sie nur für eine test-dev2017-Einreichung benötigt werden.

Datensatzstruktur#

Der COCO-Seg-Datensatz ist in drei Teilmengen unterteilt:

  1. Train2017: 118.287 Bilder zum Trainieren von Modellen zur Instanzsegmentierung.
  2. Val2017: 5.000 Bilder, die während der Modellentwicklung zur Validierung verwendet werden.
  3. Test-dev2017: 20.288 der 40.670 test2017-Bilder, die für Benchmarking verwendet werden. Die Ground-Truth-Annotationen für diese Teilmenge sind nicht öffentlich verfügbar. Daher müssen Vorhersagen zur Bewertung beim COCO-Evaluierungsserver eingereicht werden.

Für kleinere Experimente sieh dir die Teilmengen COCO128-Seg (128 Bilder) und COCO8-Seg (8 Bilder) an.

Anwendungsfälle#

COCO-Seg wird häufig zum Trainieren und Bewerten von Modellen für Deep Learning im Bereich der Instanzsegmentierung verwendet, etwa der YOLO-Modelle. Die große Zahl annotierter Bilder, die Vielfalt der Objektkategorien und die standardisierten Bewertungsmetriken machen den Datensatz zu einer unverzichtbaren Ressource für Forschende und Fachleute im Bereich Computer Vision. Die vollständigen COCO-Seg-Annotationen lassen sich außerdem auf der Ultralytics Platform durchsuchen und verwalten.

YAML-Datei des Datensatzes#

Eine YAML-Datei dient zur Definition der Datensatzkonfiguration. Sie enthält Informationen zu den Pfaden, Klassen und weiteren relevanten Eigenschaften des Datensatzes. Für den COCO-Seg-Datensatz wird die Datei coco.yaml unter https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco.yaml verwaltet.

ultralytics/cfg/datasets/coco.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# COCO 2017 dataset https://cocodataset.org by Microsoft
# Documentation: https://docs.ultralytics.com/datasets/detect/coco
# Example usage: yolo train data=coco.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── coco ← downloads here (20.3 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco # dataset root dir
train: train2017.txt # train images (relative to 'path') 118287 images
val: val2017.txt # val images (relative to 'path') 5000 images
test: test-dev2017.txt # 20288 of 40670 images, submit via https://cocodataset.org/#detection-eval

# Classes
names:
  0: person
  1: bicycle
  2: car
  3: motorcycle
  4: airplane
  5: bus
  6: train
  7: truck
  8: boat
  9: traffic light
  10: fire hydrant
  11: stop sign
  12: parking meter
  13: bench
  14: bird
  15: cat
  16: dog
  17: horse
  18: sheep
  19: cow
  20: elephant
  21: bear
  22: zebra
  23: giraffe
  24: backpack
  25: umbrella
  26: handbag
  27: tie
  28: suitcase
  29: frisbee
  30: skis
  31: snowboard
  32: sports ball
  33: kite
  34: baseball bat
  35: baseball glove
  36: skateboard
  37: surfboard
  38: tennis racket
  39: bottle
  40: wine glass
  41: cup
  42: fork
  43: knife
  44: spoon
  45: bowl
  46: banana
  47: apple
  48: sandwich
  49: orange
  50: broccoli
  51: carrot
  52: hot dog
  53: pizza
  54: donut
  55: cake
  56: chair
  57: couch
  58: potted plant
  59: bed
  60: dining table
  61: toilet
  62: tv
  63: laptop
  64: mouse
  65: remote
  66: keyboard
  67: cell phone
  68: microwave
  69: oven
  70: toaster
  71: sink
  72: refrigerator
  73: book
  74: clock
  75: vase
  76: scissors
  77: teddy bear
  78: hair drier
  79: toothbrush

# Download script/URL (optional)
download: |
  from pathlib import Path

  from ultralytics.utils import ASSETS_URL
  from ultralytics.utils.downloads import download

  # Download labels
  segments = True  # segment or box labels
  dir = Path(yaml["path"])  # dataset root dir
  urls = [ASSETS_URL + ("/coco2017labels-segments.zip" if segments else "/coco2017labels.zip")]  # labels
  download(urls, dir=dir.parent)

  # Download data (test2017.zip excluded: ground truth is withheld, only used for the eval-server test-dev split)
  urls = [
      "http://images.cocodataset.org/zips/train2017.zip",  # 19G, 118k images
      "http://images.cocodataset.org/zips/val2017.zip",  # 1G, 5k images
  ]
  download(urls, dir=dir / "images", threads=3)

Verwendung#

Um ein YOLO26n-seg-Modell mit dem COCO-Seg-Datensatz 100 Epochen lang bei einer Bildgröße von 640 zu trainieren, kannst du die folgenden Codeausschnitte verwenden. Eine vollständige Liste der verfügbaren Argumente findest du auf der Seite zum Training des Modells.

Trainingsbeispiel
from ultralytics import YOLO

# Ein Modell laden
model = YOLO("yolo26n-seg.pt")  # ein vortrainiertes Modell laden (für das Training empfohlen)

# Das Modell trainieren
results = model.train(data="coco.yaml", epochs=100, imgsz=640)

Beispielbilder und Annotationen#

COCO-Seg enthält dieselbe Vielfalt an Bildern, Objektkategorien und komplexen Szenen wie COCO. Die Instanzsegmentierungsmasken liegen im YOLO-Label-Format vor. Hier siehst du einige Beispielbilder aus dem Datensatz und die zugehörigen Instanzsegmentierungsmasken:

Mosaik aus einem Trainingsbatch des COCO-Segmentierungsdatensatzes

  • Mosaikbild: Dieses Bild zeigt einen Trainingsbatch aus mosaikierten Datensatzbildern. Mosaikbildung ist eine beim Training eingesetzte Technik, bei der mehrere Bilder zu einem einzigen Bild kombiniert werden, um die Vielfalt der Objekte und Szenen in jedem Trainingsbatch zu erhöhen. Dadurch kann das Modell besser auf unterschiedliche Objektgrößen, Seitenverhältnisse und Kontexte generalisieren.

Zitate und Danksagungen#

Wenn du den COCO-Seg-Datensatz in deiner Forschung oder Entwicklungsarbeit verwendest, zitiere bitte das ursprüngliche COCO-Paper und erwähne die Erweiterung zu COCO-Seg:

Zitat
@misc{lin2015microsoft,
      title={Microsoft COCO: Common Objects in Context},
      author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
      year={2015},
      eprint={1405.0312},
      archivePrefix={arXiv},
      primaryClass={cs.CV}
}

Wir danken dem COCO-Konsortium für die Erstellung und Pflege dieser wertvollen Ressource für die Computer-Vision-Community. Weitere Informationen zum COCO-Datensatz und seinen Erstellern findest du auf der COCO-Datensatzwebsite.

Häufig gestellte Fragen#

  • COCO-Seg ist die Verpackung der nativen Instanzsegmentierungsmasken von COCO (Alltagsobjekte im Kontext) im Ultralytics-YOLO-Format für dieselben 118.287 train2017- und 5.000 val2017-Bilder. Die ursprünglichen COCO-Annotationen enthalten bereits diese Polygonmasken für alle 80 Objektkategorien. COCO-Seg wandelt sie in das YOLO-Label-Format um, das für das Training zur Objektinstanzsegmentierung verwendet wird.

  • Um ein YOLO26n-seg-Modell mit dem COCO-Seg-Datensatz 100 Epochen lang bei einer Bildgröße von 640 zu trainieren, kannst du die folgenden Codeausschnitte verwenden. Eine ausführliche Liste der verfügbaren Trainingsargumente findest du auf der Seite zum Training des Modells.

    Trainingsbeispiel
    from ultralytics import YOLO
    
    # Ein Modell laden
    model = YOLO("yolo26n-seg.pt")  # ein vortrainiertes Modell laden (für das Training empfohlen)
    
    # Das Modell trainieren
    results = model.train(data="coco.yaml", epochs=100, imgsz=640)
  • Der COCO-Seg-Datensatz bietet mehrere wichtige Merkmale:

    • Stellt Instanzsegmentierungsmasken für 123.287 annotierte COCO-train2017-/val2017-Bilder bereit (118.287 Train + 5.000 Val).
    • Annotiert dieselben 80 Objektkategorien wie das ursprüngliche COCO.
    • Stellt Instanzsegmentierungsmasken im YOLO-Polygon-Label-Format bereit.
    • Verwendet standardisierte Bewertungsmetriken wie die mittlere durchschnittliche Präzision (mAP) und den mittleren durchschnittlichen Recall (mAR) für Aufgaben der Instanzsegmentierung.
  • Der COCO-Seg-Datensatz unterstützt mehrere vortrainierte YOLO26-Segmentierungsmodelle mit unterschiedlichen Leistungsmetriken. Hier findest du eine Übersicht der verfügbaren Modelle und ihrer wichtigsten Metriken:

    ModellGröße
    (Pixel)
    mAPBox
    50-95(e2e)
    mAPMaske
    50-95(e2e)
    Geschwindigkeit
    CPU ONNX
    (ms)
    Geschwindigkeit
    T4 TensorRT10
    (ms)
    Parameter
    (M)
    FLOPs
    (B)
    YOLO26n-seg64039.633.953.3 ± 0.52.1 ± 0.02.79.3
    YOLO26s-seg64047.340.0118.4 ± 0.93.3 ± 0.010.434.5
    YOLO26m-seg64052.544.1328.2 ± 2.46.7 ± 0.123.6121.7
    YOLO26l-seg64054.445.5387.0 ± 3.78.0 ± 0.128.0140.1
    YOLO26x-seg64056.547.0787.0 ± 6.816.4 ± 0.162.8314.0

    Diese Modelle reichen vom leichten YOLO26n-seg bis zum leistungsstärkeren YOLO26x-seg und bieten unterschiedliche Kompromisse zwischen Geschwindigkeit und Genauigkeit für verschiedene Anwendungsanforderungen. Weitere Informationen zur Modellauswahl findest du auf der Ultralytics-Modellseite.

  • Der COCO-Seg-Datensatz ist für bestimmte Anforderungen an Training und Bewertung in drei Teilmengen unterteilt:

    1. Train2017: Umfasst 118.287 Bilder, die vorwiegend zum Trainieren von Modellen zur Instanzsegmentierung verwendet werden.
    2. Val2017: Umfasst 5.000 Bilder, die während des Trainings zur Validierung verwendet werden.
    3. Test-dev2017: Umfasst 20.288 der 40.670 test2017-Bilder, die für Tests und das Benchmarking trainierter Modelle vorgesehen sind. Beachte, dass die Ground-Truth-Annotationen für diese Teilmenge nicht öffentlich verfügbar sind und die Leistungsergebnisse zur Bewertung beim COCO-Evaluierungsserver eingereicht werden.

    Für kleinere Experimente kannst du auch den COCO128-Seg-Datensatz (128 Bilder) oder den COCO8-Seg-Datensatz in Betracht ziehen, eine kompakte Version mit nur 8 Bildern aus dem COCO-train2017-Datensatz.

Kommentare