Датасет Cityscapes#
Датасет Cityscapes — это крупный бенчмарк семантической сегментации городских уличных сцен, снятых в 50 европейских городах, с 2 975 тщательно размеченными изображениями для обучения и 500 изображениями для валидации по 19 классам. Это один из наиболее широко используемых датасетов для исследований в области автономного вождения и понимания городских сцен с моделями Ultralytics YOLO.
Ключевые особенности#
- Полные аннотации Cityscapes включают 2 975 изображений для обучения и 500 изображений для валидации по 19 классам; архив также содержит 1 525 тестовых изображений, но опубликованные для них маски размечают только эго-автомобиль и границу изображения — реальные аннотации классов скрыты, а официальные оценки на тестовом наборе требуют отправки предсказаний на сервер оценки Cityscapes.
- Датасет охватывает 19 классов для оценки, относящихся к категориям плоских поверхностей, людей, транспортных средств, конструкций, объектов, природы и неба.
- Cityscapes предоставляет стандартизированные метрики оценки, такие как среднее пересечение над объединением (mIoU) для семантической сегментации, что позволяет эффективно сравнивать производительность моделей.
- Прежде чем загружать вручную около ~11 ГБ данных, проверь корректность пайплайна обучения на подмножестве из 8 изображений Cityscapes8.
Структура датасета#
После подготовки конфигурация Ultralytics ожидает следующую структуру:
cityscapes/
├── images/
│ ├── train/
│ ├── val/
│ └── test/
└── masks/
├── train/
├── val/
└── test/Cityscapes не поддерживает автоматическую загрузку архивов. Создай аккаунт на сайте Cityscapes, затем скачай архивы leftImg8bit_trainvaltest.zip и gtFine_trainvaltest.zip (около ~11 ГБ в сумме) и распакуй оба в корневой каталог датасета cityscapes. При первом запуске обучения Ultralytics автоматически реорганизует их в указанную выше структуру images/ и masks/.
Семантические маски представлены одноканальными PNG-файлами. Исходные идентификаторы меток Cityscapes сопоставляются со стандартными 19 идентификаторами для обучения через раздел label_mapping, а игнорируемые метки и метки void сопоставляются с 255, чтобы исключить их из обучения и оценки.
В опубликованных масках gtFine/test размечены только области эго-автомобиля и границы изображения — все остальные классы имеют значение void. Для локальной оценки вычисляй mIoU на сплите val; официальные оценки на тестовом наборе требуют отправки предсказаний на сервер оценки Cityscapes.
Применения#
Cityscapes широко используется для обучения и оценки моделей глубокого обучения в задачах семантической сегментации, особенно для автономного вождения, усовершенствованных систем помощи водителю (ADAS) и городской робототехники.
Изображения высокого разрешения и подробные аннотации также делают этот датасет ценным для исследований в области разбора сцен в реальном времени, понимания полос движения и препятствий, а также любых задач, требующих плотного понимания сложных городских сред на уровне отдельных пикселей. Предобученные модели семантической сегментации YOLO26 достигают значения до 83,6 mIoU на валидационном наборе Cityscapes — полную таблицу результатов см. на странице моделей семантической сегментации. Ты можешь организовывать, визуализировать и управлять данными Cityscapes на всех этапах разработки модели с помощью Ultralytics Platform.
YAML датасета#
Файл YAML датасета определяет пути Cityscapes, классы, каталог масок и сопоставление меток. Файл cityscapes.yaml поддерживается по адресу https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/cityscapes.yaml.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Cityscapes semantic segmentation dataset (19 classes)
# Documentation: https://docs.ultralytics.com/datasets/semantic/cityscapes
# Example usage: yolo semantic train data=cityscapes.yaml model=yolo26n-sem.pt
# parent
# ├── ultralytics
# └── datasets
# └── cityscapes ← downloads here (11 GB)
# └── images
# └── masks
# Dataset root directory
path: cityscapes # dataset root dir
train: images/train # train images (relative to 'path') 2975 images
val: images/val # val images (relative to 'path') 500 images
test: images/test # test images (relative to 'path') 1525 images
masks_dir: masks # semantic mask directory
# Cityscapes 19-class labels
names:
0: road
1: sidewalk
2: building
3: wall
4: fence
5: pole
6: traffic light
7: traffic sign
8: vegetation
9: terrain
10: sky
11: person
12: rider
13: car
14: truck
15: bus
16: train
17: motorcycle
18: bicycle
# Map source label IDs to train IDs; ignore_label is converted to 255.
label_mapping:
-1: ignore_label
0: ignore_label
1: ignore_label
2: ignore_label
3: ignore_label
4: ignore_label
5: ignore_label
6: ignore_label
7: 0
8: 1
9: ignore_label
10: ignore_label
11: 2
12: 3
13: 4
14: ignore_label
15: ignore_label
16: ignore_label
17: 5
18: ignore_label
19: 6
20: 7
21: 8
22: 9
23: 10
24: 11
25: 12
26: 13
27: 14
28: 15
29: ignore_label
30: ignore_label
31: 16
32: 17
33: 18
# Preparation script (requires manual Cityscapes download)
download: |
from pathlib import Path
from shutil import copy2
cityscapes_dir = Path(yaml["path"]) # dataset root dir
# Download and extract the official Cityscapes leftImg8bit and gtFine archives into cityscapes_dir first.
leftimg8bit_dir = cityscapes_dir / "leftImg8bit"
gtfine_dir = cityscapes_dir / "gtFine"
for split in ("train", "val", "test"):
print(f"Processing {split} set")
src_image_dir = leftimg8bit_dir / split
dst_image_dir = cityscapes_dir / "images" / split
dst_mask_dir = cityscapes_dir / "masks" / split
dst_image_dir.mkdir(parents=True, exist_ok=True)
dst_mask_dir.mkdir(parents=True, exist_ok=True)
image_paths = sorted(src_image_dir.rglob("*_leftImg8bit.png"))
for image_path in image_paths:
relative_path = image_path.relative_to(src_image_dir)
mask_path = gtfine_dir / split / relative_path.parent / image_path.name.replace(
"_leftImg8bit.png", "_gtFine_labelIds.png"
)
if not mask_path.exists():
raise FileNotFoundError(f"Mask not found for {image_path}: {mask_path}")
image_name = image_path.name.replace("_leftImg8bit", "")
mask_name = mask_path.name.replace("_gtFine_labelIds", "")
copy2(image_path, dst_image_dir / image_name)
copy2(mask_path, dst_mask_dir / mask_name)Использование#
Чтобы обучить модель YOLO26n-sem на датасете Cityscapes в течение 100 эпох с размером изображения 1024, используй следующие фрагменты кода. Полный список доступных аргументов см. на странице обучения модели.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-sem.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="cityscapes.yaml", epochs=100, imgsz=1024)Цитирование, лицензия и благодарности#
Cityscapes распространяется по специальной лицензии для некоммерческого использования — датасет бесплатен для академических исследований и оценки, но для коммерческого использования, лицензирования или распространения данных требуется отдельное разрешение команды Cityscapes.
Если ты используешь датасет Cityscapes в исследовательской или разработческой работе, укажи следующую публикацию:
@inproceedings{Cordts2016Cityscapes,
title={The Cityscapes Dataset for Semantic Urban Scene Understanding},
author={Cordts, Marius and Omran, Mohamed and Ramos, Sebastian and Rehfeld, Timo and Enzweiler, Markus and Benenson, Rodrigo and Franke, Uwe and Roth, Stefan and Schiele, Bernt},
booktitle={Proc. of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2016}
}Мы хотели бы поблагодарить команду Cityscapes за создание и поддержку этого ценного ресурса для сообществ, занимающихся автономным вождением и компьютерным зрением. Дополнительную информацию о датасете Cityscapes и его создателях можно найти на сайте датасета Cityscapes.
Часто задаваемые вопросы#
Датасет Cityscapes — это крупный бенчмарк семантической сегментации городских уличных сцен из 50 европейских городов, широко используемый в качестве стандартного ориентира для исследований автономного вождения и ADAS. Его 19 тщательно размеченных классов для оценки, изображения высокого разрешения и стандартизированная метрика среднего пересечения над объединением (mIoU) делают его одним из наиболее цитируемых бенчмарков для моделей плотного понимания сцен.
Чтобы обучить модель YOLO26n-sem на датасете Cityscapes в течение 100 эпох с размером изображения 1024, используй следующие фрагменты кода. Подробный список доступных аргументов см. на странице обучения модели.
Пример обученияfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-sem.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="cityscapes.yaml", epochs=100, imgsz=1024)После подготовки датасет организован в каталоги
images/{train,val,test}/иmasks/{train,val,test}/, где каждому изображению соответствует одноканальная PNG-маска. YAML-файл Ultralytics связывает каждое изображение с его маской через полеmasks_dir: masksи используетlabel_mappingдля преобразования исходных идентификаторов меток Cityscapes в стандартные 19 последовательных идентификаторов для обучения, сопоставляя игнорируемые метки и метки void со значением255. Маски сплитаtestразмечают только области эго-автомобиля и границы, поэтому для локальной проверки mIoU используйval.Да. Создай аккаунт на сайте Cityscapes и скачай архивы
leftImg8bit_trainvaltest.zipиgtFine_trainvaltest.zip(около ~11 ГБ в сумме). Распакуй оба архива в корневой каталог датасетаcityscapes— при первом запуске обучения Ultralytics автоматически реорганизует их в ожидаемую структуруimages/иmasks/.Исходные маски Cityscapes содержат идентификаторы меток, отличающиеся от 19 идентификаторов для обучения, используемых при оценке. Раздел
label_mappingпреобразует допустимые метки в последовательные идентификаторы классов0–18и назначает255игнорируемым меткам и меткам void, чтобы исключить их из функции потерь и метрик во время обучения и валидации.Нет. Cityscapes распространяется по лицензии для некоммерческого использования, разрешающей академические исследования, обучение и оценку, но запрещающей коммерческое использование, лицензирование или продажу датасета и производных работ. Обратись напрямую к команде Cityscapes по вопросам коммерческого лицензирования.