Dataset Cityscapes#
Il dataset Cityscapes è un benchmark su larga scala di segmentazione semantica di scene stradali urbane acquisite in 50 città europee, con 2.975 immagini di addestramento annotate dettagliatamente e 500 immagini di validazione distribuite in 19 classi. È uno dei dataset più utilizzati per la ricerca sulla guida autonoma e la comprensione delle scene urbane con i modelli Ultralytics YOLO.
Funzionalità principali#
- Le annotazioni dettagliate di Cityscapes includono 2.975 immagini di addestramento e 500 immagini di validazione distribuite in 19 classi; l'archivio contiene anche 1.525 immagini di test, ma le maschere rilasciate per queste immagini etichettano solo il veicolo ego e il bordo dell'immagine — le annotazioni effettive delle classi sono riservate e, per ottenere i punteggi ufficiali sul set di test, è necessario inviare le predizioni al server di valutazione Cityscapes.
- Il dataset comprende 19 classi di valutazione appartenenti alle categorie superfici piane, persone, veicoli, costruzioni, oggetti, natura e cielo.
- Cityscapes fornisce metriche di valutazione standardizzate come la media dell'intersezione sull'unione (mIoU) per la segmentazione semantica, consentendo di confrontare efficacemente le prestazioni dei modelli.
- Prima di procedere con il download manuale di ~11 GB, verifica rapidamente la pipeline di addestramento utilizzando il sottoinsieme Cityscapes8 da 8 immagini.
Struttura del dataset#
Dopo la preparazione, la configurazione di Ultralytics prevede la seguente struttura:
cityscapes/
├── images/
│ ├── train/
│ ├── val/
│ └── test/
└── masks/
├── train/
├── val/
└── test/Cityscapes non dispone del download automatico dell'archivio. Crea un account sul sito web di Cityscapes, quindi scarica gli archivi leftImg8bit_trainvaltest.zip e gtFine_trainvaltest.zip (~11 GB complessivi) ed estraili entrambi nella directory principale del dataset cityscapes. La prima volta che esegui l'addestramento, Ultralytics li riorganizza automaticamente nella struttura images/ e masks/ indicata sopra.
Le maschere semantiche sono file PNG a canale singolo. Gli ID delle etichette originali di Cityscapes vengono mappati negli ID di addestramento standard delle 19 classi tramite la sezione label_mapping, mentre le etichette ignorate o vuote vengono mappate a 255 per escluderle dall'addestramento e dalla valutazione.
Le maschere gtFine/test rilasciate pubblicamente etichettano solo il veicolo ego e le regioni del bordo dell'immagine; tutte le altre classi sono vuote. Calcola la mIoU sullo split val per la valutazione locale; per ottenere i punteggi ufficiali sul set di test, è necessario inviare le predizioni al server di valutazione Cityscapes.
Applicazioni#
Cityscapes è ampiamente utilizzato per addestrare e valutare modelli di deep learning nella segmentazione semantica, in particolare per la guida autonoma, i sistemi avanzati di assistenza alla guida (ADAS) e la robotica urbana.
Le immagini ad alta risoluzione e le annotazioni dettagliate lo rendono inoltre prezioso per la ricerca sull'analisi delle scene in tempo reale, sulla comprensione delle corsie e degli ostacoli e per qualsiasi attività che richieda una comprensione densa a livello dei pixel di ambienti urbani complessi. I modelli YOLO26 di segmentazione semantica preaddestrati raggiungono fino a 83,6 mIoU sul set di validazione Cityscapes: consulta la pagina dei modelli di segmentazione semantica per la tabella completa dei benchmark. Puoi organizzare, visualizzare e gestire i dati Cityscapes durante l'intero flusso di sviluppo del modello con Ultralytics Platform.
YAML del dataset#
Un file YAML del dataset definisce i percorsi, le classi, la directory delle maschere e la mappatura delle etichette di Cityscapes. Il file cityscapes.yaml è disponibile all'indirizzo https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/cityscapes.yaml.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Cityscapes semantic segmentation dataset (19 classes)
# Documentation: https://docs.ultralytics.com/datasets/semantic/cityscapes
# Example usage: yolo semantic train data=cityscapes.yaml model=yolo26n-sem.pt
# parent
# ├── ultralytics
# └── datasets
# └── cityscapes ← downloads here (11 GB)
# └── images
# └── masks
# Dataset root directory
path: cityscapes # dataset root dir
train: images/train # train images (relative to 'path') 2975 images
val: images/val # val images (relative to 'path') 500 images
test: images/test # test images (relative to 'path') 1525 images
masks_dir: masks # semantic mask directory
# Cityscapes 19-class labels
names:
0: road
1: sidewalk
2: building
3: wall
4: fence
5: pole
6: traffic light
7: traffic sign
8: vegetation
9: terrain
10: sky
11: person
12: rider
13: car
14: truck
15: bus
16: train
17: motorcycle
18: bicycle
# Map source label IDs to train IDs; ignore_label is converted to 255.
label_mapping:
-1: ignore_label
0: ignore_label
1: ignore_label
2: ignore_label
3: ignore_label
4: ignore_label
5: ignore_label
6: ignore_label
7: 0
8: 1
9: ignore_label
10: ignore_label
11: 2
12: 3
13: 4
14: ignore_label
15: ignore_label
16: ignore_label
17: 5
18: ignore_label
19: 6
20: 7
21: 8
22: 9
23: 10
24: 11
25: 12
26: 13
27: 14
28: 15
29: ignore_label
30: ignore_label
31: 16
32: 17
33: 18
# Preparation script (requires manual Cityscapes download)
download: |
from pathlib import Path
from shutil import copy2
cityscapes_dir = Path(yaml["path"]) # dataset root dir
# Download and extract the official Cityscapes leftImg8bit and gtFine archives into cityscapes_dir first.
leftimg8bit_dir = cityscapes_dir / "leftImg8bit"
gtfine_dir = cityscapes_dir / "gtFine"
for split in ("train", "val", "test"):
print(f"Processing {split} set")
src_image_dir = leftimg8bit_dir / split
dst_image_dir = cityscapes_dir / "images" / split
dst_mask_dir = cityscapes_dir / "masks" / split
dst_image_dir.mkdir(parents=True, exist_ok=True)
dst_mask_dir.mkdir(parents=True, exist_ok=True)
image_paths = sorted(src_image_dir.rglob("*_leftImg8bit.png"))
for image_path in image_paths:
relative_path = image_path.relative_to(src_image_dir)
mask_path = gtfine_dir / split / relative_path.parent / image_path.name.replace(
"_leftImg8bit.png", "_gtFine_labelIds.png"
)
if not mask_path.exists():
raise FileNotFoundError(f"Mask not found for {image_path}: {mask_path}")
image_name = image_path.name.replace("_leftImg8bit", "")
mask_name = mask_path.name.replace("_gtFine_labelIds", "")
copy2(image_path, dst_image_dir / image_name)
copy2(mask_path, dst_mask_dir / mask_name)Utilizzo#
Per addestrare un modello YOLO26n-sem sul dataset Cityscapes per 100 epoche con una dimensione delle immagini di 1024, puoi usare i seguenti frammenti di codice. Per un elenco completo degli argomenti disponibili, consulta la pagina Addestramento del modello.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-sem.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="cityscapes.yaml", epochs=100, imgsz=1024)Citazioni, licenza e ringraziamenti#
Cityscapes è distribuito con una licenza personalizzata per uso non commerciale — gratuito per la ricerca e la valutazione accademiche, ma l'uso commerciale, la concessione di licenze o la ridistribuzione dei dati richiedono un'autorizzazione separata da parte del team di Cityscapes.
Se utilizzi il dataset Cityscapes per la tua ricerca o attività di sviluppo, cita il seguente articolo:
@inproceedings{Cordts2016Cityscapes,
title={The Cityscapes Dataset for Semantic Urban Scene Understanding},
author={Cordts, Marius and Omran, Mohamed and Ramos, Sebastian and Rehfeld, Timo and Enzweiler, Markus and Benenson, Rodrigo and Franke, Uwe and Roth, Stefan and Schiele, Bernt},
booktitle={Proc. of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2016}
}Desideriamo ringraziare il team di Cityscapes per aver creato e mantenuto questa preziosa risorsa per le comunità della guida autonoma e della computer vision. Per ulteriori informazioni sul dataset Cityscapes e sui suoi creatori, visita il sito web del dataset Cityscapes.
FAQ#
Il dataset Cityscapes è un benchmark su larga scala di segmentazione semantica di scene stradali urbane in 50 città europee, ampiamente utilizzato come riferimento standard per la ricerca sulla guida autonoma e sui sistemi ADAS. Le sue 19 classi di valutazione annotate dettagliatamente, le immagini ad alta risoluzione e la metrica standardizzata della media dell'intersezione sull'unione (mIoU) lo rendono uno dei benchmark più citati per i modelli di comprensione densa delle scene.
Per addestrare un modello YOLO26n-sem sul dataset Cityscapes per 100 epoche con una dimensione delle immagini di 1024, puoi usare i seguenti frammenti di codice. Per un elenco dettagliato degli argomenti disponibili, consulta la pagina Addestramento del modello.
Esempio di addestramentofrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-sem.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="cityscapes.yaml", epochs=100, imgsz=1024)Dopo la preparazione, il dataset è organizzato nelle directory
images/{train,val,test}/emasks/{train,val,test}/, con ogni immagine associata a una maschera PNG a canale singolo. Il file YAML di Ultralytics associa ogni immagine alla relativa maschera tramite il campomasks_dir: maskse utilizzalabel_mappingper convertire gli ID delle etichette originali di Cityscapes nei 19 ID di addestramento contigui standard, mappando le etichette ignorate e vuote a255. Le maschere dello splittestetichettano solo il veicolo ego e le regioni del bordo, quindi usavalper i controlli locali della mIoU.Sì. Crea un account sul sito web di Cityscapes e scarica gli archivi
leftImg8bit_trainvaltest.zipegtFine_trainvaltest.zip(~11 GB complessivi). Estraili entrambi nella directory principale del datasetcityscapes: la prima volta che esegui l'addestramento, Ultralytics li riorganizza automaticamente nella struttura previstaimages/emasks/.Le maschere sorgente di Cityscapes memorizzano ID delle etichette originali diversi dai 19 ID di addestramento utilizzati per la valutazione. La sezione
label_mappingconverte le etichette valide negli ID di classe contigui0–18e assegna255alle etichette ignorate e vuote, in modo che siano escluse dalla loss e dalle metriche durante l'addestramento e la validazione.No. Cityscapes è distribuito con una licenza non commerciale che consente la ricerca accademica, l'insegnamento e la valutazione, ma vieta l'uso commerciale, la concessione di licenze o la vendita del dataset o di opere derivate. Contatta direttamente il team di Cityscapes per conoscere le opzioni di licenza commerciale.