Tập dữ liệu Cityscapes8#
Giới thiệu#
Tập dữ liệu Cityscapes8 của Ultralytics là một tập dữ liệu phân đoạn ngữ nghĩa nhỏ gọn gồm 8 hình ảnh được lấy mẫu từ tập dữ liệu Cityscapes: 4 ảnh dùng để train và 4 ảnh dùng để validation. Tập dữ liệu này được thiết kế để kiểm thử nhanh, debug và thử nghiệm với các model phân đoạn ngữ nghĩa YOLO và các pipeline train. Nội dung về cảnh đô thị của tập dữ liệu cung cấp một bước kiểm tra pipeline hữu ích trước khi mở rộng lên toàn bộ tập dữ liệu Cityscapes.
Cityscapes8 sử dụng cùng 19 lớp đánh giá và cùng hành vi label_mapping như tập dữ liệu Cityscapes đầy đủ, đồng thời hoàn toàn tương thích với các workflow phân đoạn ngữ nghĩa của YOLO26.
Cityscapes8 chỉ dành cho kiểm thử pipeline, không dùng để benchmark — 8 hình ảnh là quá ít để so sánh mIoU có ý nghĩa. Hãy sử dụng tập validation Cityscapes đầy đủ để có kết quả mang tính đại diện.
Cấu trúc bộ dữ liệu#
Cityscapes8 phản ánh bố cục của tập dữ liệu đầy đủ nhưng không có split test:
cityscapes8/
├── images/
│ ├── train/ # 4 images
│ └── val/ # 4 images
└── masks/
├── train/ # 4 single-channel PNG masks
└── val/ # 4 single-channel PNG masksCác mask được ghép với hình ảnh thông qua trường masks_dir: masks, còn label_mapping chuyển đổi các label ID của Cityscapes nguồn thành 19 train ID liên tiếp được mô tả trong cấu trúc tập dữ liệu Cityscapes đầy đủ.
YAML của bộ dữ liệu#
Cấu hình tập dữ liệu Cityscapes8 được định nghĩa trong một file YAML của dataset, trong đó chỉ định các đường dẫn dataset, tên lớp và metadata thiết yếu khác. Bạn có thể xem file cityscapes8.yaml chính thức trong repository Ultralytics trên GitHub. YAML này chứa URL tải xuống cho subset đóng gói nhỏ.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Cityscapes semantic segmentation dataset (19 classes)
# Documentation: https://docs.ultralytics.com/datasets/semantic/cityscapes8
# Example usage: yolo semantic train data=cityscapes8.yaml model=yolo26n-sem.pt
# parent
# ├── ultralytics
# └── datasets
# └── cityscapes8 ← downloads here (small subset)
# └── images
# └── masks
# Dataset root directory
path: cityscapes8 # dataset root dir
train: images/train # train images (relative to 'path') 4 images
val: images/val # val images (relative to 'path') 4 images
masks_dir: masks # semantic mask directory
# Cityscapes 19-class labels
names:
0: road
1: sidewalk
2: building
3: wall
4: fence
5: pole
6: traffic light
7: traffic sign
8: vegetation
9: terrain
10: sky
11: person
12: rider
13: car
14: truck
15: bus
16: train
17: motorcycle
18: bicycle
# Map source label IDs to train IDs; ignore_label is converted to 255.
label_mapping:
-1: ignore_label
0: ignore_label
1: ignore_label
2: ignore_label
3: ignore_label
4: ignore_label
5: ignore_label
6: ignore_label
7: 0
8: 1
9: ignore_label
10: ignore_label
11: 2
12: 3
13: 4
14: ignore_label
15: ignore_label
16: ignore_label
17: 5
18: ignore_label
19: 6
20: 7
21: 8
22: 9
23: 10
24: 11
25: 12
26: 13
27: 14
28: 15
29: ignore_label
30: ignore_label
31: 16
32: 17
33: 18
# Download URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/cityscapes8.zipCách sử dụng#
Để train model YOLO26n-sem trên tập dữ liệu Cityscapes8 trong 100 epoch với kích thước hình ảnh 1024, hãy sử dụng các ví dụ sau. Để xem đầy đủ các tùy chọn train, hãy tham khảo tài liệu YOLO Training.
from ultralytics import YOLO
# Load a pretrained YOLO26n-sem model
model = YOLO("yolo26n-sem.pt")
# Train the model on Cityscapes8
results = model.train(data="cityscapes8.yaml", epochs=100, imgsz=1024)Bạn cũng có thể quản lý Cityscapes8 và train các model phân đoạn ngữ nghĩa trên cloud bằng Ultralytics Platform.
Trích dẫn, giấy phép và lời cảm ơn#
Cityscapes8 được lấy mẫu từ Cityscapes, tập dữ liệu được phát hành theo giấy phép phi thương mại tùy chỉnh — xem trang tập dữ liệu Cityscapes đầy đủ để biết chi tiết.
Nếu sử dụng tập dữ liệu Cityscapes trong nghiên cứu hoặc phát triển, vui lòng trích dẫn bài báo sau:
@inproceedings{Cordts2016Cityscapes,
title={The Cityscapes Dataset for Semantic Urban Scene Understanding},
author={Cordts, Marius and Omran, Mohamed and Ramos, Sebastian and Rehfeld, Timo and Enzweiler, Markus and Benenson, Rodrigo and Franke, Uwe and Roth, Stefan and Schiele, Bernt},
booktitle={Proc. of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2016}
}Đặc biệt cảm ơn đội ngũ Cityscapes vì những đóng góp liên tục cho cộng đồng lái xe tự động và thị giác máy tính.
FAQ#
Tập dữ liệu Cityscapes8 của Ultralytics được thiết kế để kiểm thử nhanh và debug các model phân đoạn ngữ nghĩa. Với chỉ 8 hình ảnh (4 ảnh train, 4 ảnh validation), tập dữ liệu này phù hợp để xác minh các pipeline phân đoạn ngữ nghĩa YOLO, bao gồm việc tải mask, augmentations, validation và các đường dẫn export, trước khi mở rộng lên toàn bộ tập dữ liệu Cityscapes. Hãy khám phá cấu hình YAML của Cityscapes8 để biết thêm chi tiết.
Cityscapes8 lấy mẫu 8 hình ảnh (4 train, 4 val) từ phân chia 2.975 ảnh train/500 ảnh validation của Cityscapes, sử dụng cùng 19 lớp và
label_mapping, vì vậy pipeline chạy trên Cityscapes8 sẽ chạy không cần chỉnh sửa trên tập dữ liệu đầy đủ — chỉ cần trỏdata=tớicityscapes.yamlthay vìcityscapes8.yaml. Không giống tập dữ liệu đầy đủ, Cityscapes8 không yêu cầu bước tải xuống thủ công và không có splittest.Bạn có thể train model phân đoạn ngữ nghĩa YOLO26 trên Cityscapes8 bằng Python hoặc CLI:
Ví dụ huấn luyệnfrom ultralytics import YOLO # Load a pretrained YOLO26n-sem model model = YOLO("yolo26n-sem.pt") # Train the model on Cityscapes8 results = model.train(data="cityscapes8.yaml", epochs=100, imgsz=1024)Để biết thêm các tùy chọn huấn luyện, hãy tham khảo tài liệu Huấn luyện YOLO.
Không. Cityscapes8 quá nhỏ để so sánh model có ý nghĩa và được dùng cho việc kiểm tra pipeline train và evaluation. Hãy sử dụng tập validation Cityscapes đầy đủ khi cần kết quả benchmark mang tính đại diện cho phân đoạn ngữ nghĩa.



