Ultralytics YOLO27:

COCO-Seg-Datensatz#

Der COCO-Seg-Datensatz stellt COCO (Objekte in ihrem Kontext (COCO)) Instanzsegmentierungsmasken bereit – 118.287 Trainings- und 5.000 Validierungsbilder mit Polygonmasken für 80 Objektkategorien – im Ultralytics YOLO-Beschriftungsformat. Er verwendet die Originalbilder und nativen Segmentierungsannotationen von COCO, die für das YOLO-Training konvertiert wurden, und ist damit eine wichtige Ressource für Forschende und Entwickler, die an Aufgaben der Instanzsegmentierung arbeiten.

Auf COCO-Seg vortrainierte Modelle#

ModellGröße
(Pixel)
mAPBox
50–95 (e2e)
mAPMaske
50–95 (e2e)
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLO26n-seg64039.633.953.3 ± 0.52.1 ± 0.02.79.3
YOLO26s-seg64047.340.0118.4 ± 0.93.3 ± 0.010.434.5
YOLO26m-seg64052.544.1328.2 ± 2.46.7 ± 0.123.6121.7
YOLO26l-seg64054.445.5387.0 ± 3.78.0 ± 0.128.0140.1
YOLO26x-seg64056.547.0787.0 ± 6.816.4 ± 0.162.8314.0

Wichtige Funktionen#

  • COCO-Seg stellt Instanzsegmentierungsmasken für 123.287 annotierte COCO-train2017/val2017-Bilder bereit (118.287 Training + 5.000 Validierung) – von der insgesamt etwa ~330.000 Bilder umfassenden COCO-Veröffentlichung.
  • Der Datensatz besteht aus denselben 80 Objektkategorien wie der ursprüngliche COCO-Datensatz.
  • Die Annotationen stellen Instanzsegmentierungsmasken im YOLO-Polygon-Beschriftungsformat bereit.
  • COCO-Seg stellt standardisierte mAP- und mAR-Metriken zur Bewertung der Leistung bei der Instanzsegmentierung bereit und ermöglicht dadurch einen effektiven Vergleich der Modellleistung.
  • Downloadgröße: Bei der ersten Verwendung etwa ~20,3 GB (train2017.zip + val2017.zip + Beschriftungen). Die 7 GB große Datei test2017.zip wird nicht automatisch abgerufen, da für diese Bilder keine Ground-Truth-Daten vorliegen und sie nur für eine test-dev2017-Einreichung benötigt werden.

Datensatzstruktur#

Der COCO-Seg-Datensatz ist in drei Teilmengen unterteilt:

  1. Train2017: 118.287 Bilder zum Trainieren von Modellen für die Instanzsegmentierung.
  2. Val2017: 5.000 Bilder, die während der Modellentwicklung zur Validierung verwendet werden.
  3. Test-dev2017: 20.288 der 40.670 test2017-Bilder, die zum Benchmarking verwendet werden. Die Ground-Truth-Annotationen für diese Teilmenge sind nicht öffentlich verfügbar. Daher müssen Vorhersagen zur Bewertung an den COCO-Bewertungsserver übermittelt werden.

Für kleinere Experimente findest du die Teilmengen COCO128-Seg (128 Bilder) und COCO8-Seg (8 Bilder).

Anwendungen#

COCO-Seg wird häufig zum Trainieren und Bewerten von Deep-Learning-Modellen für die Instanzsegmentierung eingesetzt, etwa der YOLO-Modelle. Die große Anzahl annotierter Bilder, die Vielfalt der Objektkategorien und die standardisierten Bewertungsmetriken machen den Datensatz zu einer unverzichtbaren Ressource für Forschende und Praktiker im Bereich Computer Vision. Die vollständigen COCO-Seg-Annotationen können außerdem auf der Ultralytics Platform durchsucht und verwaltet werden.

Dataset-YAML#

Eine YAML-Datei dient zum Definieren der Datensatzkonfiguration. Sie enthält Informationen zu den Pfaden, Klassen und weiteren relevanten Eigenschaften des Datensatzes. Beim COCO-Seg-Datensatz wird die Datei coco.yaml unter https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco.yaml verwaltet.

ultralytics/cfg/datasets/coco.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# COCO 2017 dataset https://cocodataset.org by Microsoft
# Documentation: https://docs.ultralytics.com/datasets/detect/coco
# Example usage: yolo train data=coco.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── coco ← downloads here (20.3 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco # dataset root dir
train: train2017.txt # train images (relative to 'path') 118287 images
val: val2017.txt # val images (relative to 'path') 5000 images
test: test-dev2017.txt # 20288 of 40670 images, submit via https://cocodataset.org/#detection-eval

# Classes
names:
  0: person
  1: bicycle
  2: car
  3: motorcycle
  4: airplane
  5: bus
  6: train
  7: truck
  8: boat
  9: traffic light
  10: fire hydrant
  11: stop sign
  12: parking meter
  13: bench
  14: bird
  15: cat
  16: dog
  17: horse
  18: sheep
  19: cow
  20: elephant
  21: bear
  22: zebra
  23: giraffe
  24: backpack
  25: umbrella
  26: handbag
  27: tie
  28: suitcase
  29: frisbee
  30: skis
  31: snowboard
  32: sports ball
  33: kite
  34: baseball bat
  35: baseball glove
  36: skateboard
  37: surfboard
  38: tennis racket
  39: bottle
  40: wine glass
  41: cup
  42: fork
  43: knife
  44: spoon
  45: bowl
  46: banana
  47: apple
  48: sandwich
  49: orange
  50: broccoli
  51: carrot
  52: hot dog
  53: pizza
  54: donut
  55: cake
  56: chair
  57: couch
  58: potted plant
  59: bed
  60: dining table
  61: toilet
  62: tv
  63: laptop
  64: mouse
  65: remote
  66: keyboard
  67: cell phone
  68: microwave
  69: oven
  70: toaster
  71: sink
  72: refrigerator
  73: book
  74: clock
  75: vase
  76: scissors
  77: teddy bear
  78: hair drier
  79: toothbrush

# Download script/URL (optional)
download: |
  from pathlib import Path

  from ultralytics.utils import ASSETS_URL
  from ultralytics.utils.downloads import download

  # Download labels
  segments = True  # segment or box labels
  dir = Path(yaml["path"])  # dataset root dir
  urls = [ASSETS_URL + ("/coco2017labels-segments.zip" if segments else "/coco2017labels.zip")]  # labels
  download(urls, dir=dir.parent)

  # Download data (test2017.zip excluded: ground truth is withheld, only used for the eval-server test-dev split)
  urls = [
      "http://images.cocodataset.org/zips/train2017.zip",  # 19G, 118k images
      "http://images.cocodataset.org/zips/val2017.zip",  # 1G, 5k images
  ]
  download(urls, dir=dir / "images", threads=3)

Verwendung#

Um ein YOLO26n-seg-Modell 100 Epochen lang mit einer Bildgröße von 640 auf dem COCO-Seg-Datensatz zu trainieren, kannst du die folgenden Codeausschnitte verwenden. Eine vollständige Liste der verfügbaren Argumente findest du auf der Seite zum Training des Modells.

Trainingsbeispiel
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-seg.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="coco.yaml", epochs=100, imgsz=640)

Beispielbilder und Annotationen#

COCO-Seg enthält dieselben vielfältigen Bilder, Objektkategorien und komplexen Szenen wie COCO. Die Instanzsegmentierungsmasken werden im YOLO-Beschriftungsformat bereitgestellt. Hier siehst du einige Beispiele für Bilder aus dem Datensatz sowie die zugehörigen Instanzsegmentierungsmasken:

Mosaik eines Trainingsstapels des COCO-Segmentierungsdatensatzes

  • Mosaikbild: Dieses Bild zeigt einen Trainingsstapel, der aus zu einem Mosaik zusammengesetzten Datensatzbildern besteht. Mosaikbildung ist eine beim Training verwendete Technik, bei der mehrere Bilder zu einem einzigen Bild kombiniert werden, um die Vielfalt der Objekte und Szenen in jedem Trainingsstapel zu erhöhen. Dadurch kann das Modell besser auf unterschiedliche Objektgrößen, Seitenverhältnisse und Kontexte generalisieren.

Zitate und Danksagungen#

Wenn du den COCO-Seg-Datensatz für deine Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte die ursprüngliche COCO-Veröffentlichung und erwähne die Erweiterung zu COCO-Seg:

Zitat
@misc{lin2015microsoft,
      title={Microsoft COCO: Common Objects in Context},
      author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
      year={2015},
      eprint={1405.0312},
      archivePrefix={arXiv},
      primaryClass={cs.CV}
}

Wir danken dem COCO-Konsortium für die Erstellung und Pflege dieser unschätzbaren Ressource für die Computer-Vision-Community. Weitere Informationen zum COCO-Datensatz und seinen Erstellern findest du auf der Website des COCO-Datensatzes.

FAQ#

  • COCO-Seg ist die Verpackung der nativen Instanzsegmentierungsmasken von COCO im Ultralytics YOLO-Format (Objekte in ihrem Kontext (COCO)) für dieselben 118.287 train2017- und 5.000 val2017-Bilder. Die ursprünglichen COCO-Annotationen enthalten bereits diese Polygonmasken für alle 80 Objektkategorien. COCO-Seg konvertiert sie in das YOLO-Beschriftungsformat, das für das Training der Objektinstanzsegmentierung verwendet wird.

  • Um ein YOLO26n-seg-Modell 100 Epochen lang mit einer Bildgröße von 640 auf dem COCO-Seg-Datensatz zu trainieren, kannst du die folgenden Codeausschnitte verwenden. Eine detaillierte Liste der verfügbaren Trainingsargumente findest du auf der Seite zum Training des Modells.

    Trainingsbeispiel
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-seg.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="coco.yaml", epochs=100, imgsz=640)
  • Der COCO-Seg-Datensatz umfasst mehrere wesentliche Merkmale:

    • Stellt Instanzsegmentierungsmasken für 123.287 annotierte COCO-train2017/val2017-Bilder bereit (118.287 Training + 5.000 Validierung).
    • Annotiert dieselben 80 Objektkategorien wie der ursprüngliche COCO-Datensatz.
    • Stellt Instanzsegmentierungsmasken im YOLO-Polygon-Beschriftungsformat bereit.
    • Verwendet standardisierte Bewertungsmetriken wie die mittlere Präzision Precision (mAP) und den mittleren Recall (mAR) für Aufgaben der Instanzsegmentierung.
  • Der COCO-Seg-Datensatz unterstützt mehrere vortrainierte YOLO26-Segmentierungsmodelle mit unterschiedlichen Leistungsmetriken. Hier findest du eine Zusammenfassung der verfügbaren Modelle und ihrer wichtigsten Metriken:

    ModellGröße
    (Pixel)
    mAPBox
    50–95 (e2e)
    mAPMaske
    50–95 (e2e)
    Geschwindigkeit
    CPU ONNX
    (ms)
    Geschwindigkeit
    T4 TensorRT10
    (ms)
    Parameter
    (M)
    FLOPs
    (B)
    YOLO26n-seg64039.633.953.3 ± 0.52.1 ± 0.02.79.3
    YOLO26s-seg64047.340.0118.4 ± 0.93.3 ± 0.010.434.5
    YOLO26m-seg64052.544.1328.2 ± 2.46.7 ± 0.123.6121.7
    YOLO26l-seg64054.445.5387.0 ± 3.78.0 ± 0.128.0140.1
    YOLO26x-seg64056.547.0787.0 ± 6.816.4 ± 0.162.8314.0

    Diese Modelle reichen vom kompakten YOLO26n-seg bis zum leistungsfähigeren YOLO26x-seg und bieten unterschiedliche Kompromisse zwischen Geschwindigkeit und Genauigkeit für verschiedene Anwendungsanforderungen. Weitere Informationen zur Modellauswahl findest du auf der Ultralytics-Modellseite.

  • Der COCO-Seg-Datensatz ist für bestimmte Trainings- und Bewertungsanforderungen in drei Teilmengen unterteilt:

    1. Train2017: Umfasst 118.287 Bilder, die hauptsächlich zum Trainieren von Modellen für die Instanzsegmentierung verwendet werden.
    2. Val2017: Umfasst 5.000 Bilder, die während des Trainingsprozesses zur Validierung verwendet werden.
    3. Test-dev2017: Umfasst 20.288 der 40.670 test2017-Bilder, die zum Testen und Benchmarking trainierter Modelle vorgesehen sind. Beachte, dass die Ground-Truth-Annotationen für diese Teilmenge nicht öffentlich verfügbar sind und die Leistungsergebnisse zur Bewertung an den COCO-Bewertungsserver übermittelt werden.

    Für kleinere Experimente kannst du auch den COCO128-Seg-Datensatz (128 Bilder) oder den COCO8-Seg-Datensatz in Betracht ziehen, eine kompakte Version mit nur 8 Bildern aus dem COCO-train2017-Satz.

Kommentare