Датасет PASCAL VOC#
Датасет PASCAL VOC (классы визуальных объектов (VOC)) — это классический бенчмарк для детектирования объектов, содержащий 20 классов повседневных объектов. Конфигурация Ultralytics VOC.yaml объединяет обучающие выборки trainval VOC2007 и VOC2012 в обучающий набор из 16 551 изображения, выполняет валидацию на 4 952 общедоступных размеченных тестовых изображениях VOC2007 и автоматически загружает всё необходимое (2,8 ГБ) при первом использовании.
Watch: How to Train Ultralytics YOLO on the Pascal VOC Dataset | Object Detection | Computer Vision 🚀
Соревнования PASCAL VOC проходили с 2005 по 2012 год и повлияли на то, как оцениваются модели детектирования объектов: бенчмарк охватывает задачи классификации изображений, детектирования и сегментации, а также сделал популярной среднюю точность (mAP) в качестве стандартной метрики детектирования. Конфигурация Ultralytics VOC.yaml использует аннотации для детектирования, преобразуя исходные ограничивающие рамки из XML в формат YOLO во время загрузки.
Ключевые особенности#
- 20 классов повседневных объектов: человек; шесть животных (птица, кошка, корова, собака, лошадь, овца); семь транспортных средств (самолёт, велосипед, лодка, автобус, автомобиль, мотоцикл, поезд); и шесть предметов интерьера (бутылка, стул, обеденный стол, растение в горшке, диван, телевизор).
- Объединение двух поколений соревнований: обучение объединяет trainval VOC2007 (5 011 изображений) и trainval VOC2012 (11 540 изображений).
- Стандартизированная оценка: десятилетия опубликованных базовых результатов VOC делают его удобной точкой отсчёта для сравнения моделей детектирования.
- Готовность к YOLO: скрипт загрузки получает архивы и автоматически преобразует аннотации — ручная подготовка не требуется.
Структура датасета#
Конфигурация Ultralytics VOC.yaml определяет следующие выборки:
| Выборка | Изображения | Источник |
|---|---|---|
| Обучение | 16,551 | VOC2007 trainval (5 011) + VOC2012 trainval (11 540) |
| Валидация | 4,952 | VOC2007 test, используется для оценки во время обучения |
| Тестовая | 4,952 | Те же тестовые изображения VOC2007 — конфигурация не определяет отдельную отложенную выборку |
Аннотации VOC2007 test были опубликованы после соревнования того года, что позволяет использовать эту выборку в качестве размеченного валидационного набора. Аннотации VOC2012 test остаются закрытыми — результаты на них можно оценить только через официальный сервер оценки PASCAL, поэтому они не входят в эту конфигурацию.
Автоматический конвертер пропускает объекты, отмеченные как difficult в исходных XML-аннотациях VOC, поэтому количество экземпляров по классам немного отличается от официальной статистики VOC.
Открой VOC на платформе Ultralytics, чтобы просмотреть изображения с наложенными аннотациями, посмотреть распределение классов и тепловые карты ограничивающих рамок на вкладке Charts, а также клонировать датасет для обучения собственной модели в облаке.
Применения#
PASCAL VOC был основным бенчмарком для исследований в области детектирования объектов в годы до появления более крупного датасета COCO: такие детекторы, как Faster R-CNN и SSD, публиковали на нём свои исходные результаты, а модели Ultralytics YOLO обучаются на нём из коробки. Сегодня он по-прежнему популярен для:
- Сравнения новых архитектур детектирования с многолетней историей опубликованных базовых результатов
- Быстрых экспериментов и учебных работ — с 16 551 обучающим изображением он обучается значительно быстрее COCO
- Исследований переноса обучения на компактном, хорошо изученном наборе повседневных классов
YAML датасета#
Файл VOC.yaml определяет конфигурацию датасета — пути к датасету, названия 20 классов и скрипт автоматической загрузки и преобразования. Он поддерживается в репозитории Ultralytics по адресу https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/VOC.yaml.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# PASCAL VOC dataset https://www.robots.ox.ac.uk/~vgg/projects/pascal/VOC by University of Oxford
# Documentation: https://docs.ultralytics.com/datasets/detect/voc
# Example usage: yolo train data=VOC.yaml
# parent
# ├── ultralytics
# └── datasets
# └── VOC ← downloads here (2.8 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: VOC
train: # train images (relative to 'path') 16551 images
- images/train2012
- images/train2007
- images/val2012
- images/val2007
val: # val images (relative to 'path') 4952 images
- images/test2007
test: # test images (optional)
- images/test2007
# Classes
names:
0: aeroplane
1: bicycle
2: bird
3: boat
4: bottle
5: bus
6: car
7: cat
8: chair
9: cow
10: diningtable
11: dog
12: horse
13: motorbike
14: person
15: pottedplant
16: sheep
17: sofa
18: train
19: tvmonitor
# Download script/URL (optional) ---------------------------------------------------------------------------------------
download: |
import xml.etree.ElementTree as ET
from pathlib import Path
from ultralytics.utils.downloads import download
from ultralytics.utils import ASSETS_URL, TQDM
def convert_label(path, lb_path, year, image_id):
"""Converts XML annotations from VOC format to YOLO format by extracting bounding boxes and class IDs."""
def convert_box(size, box):
dw, dh = 1.0 / size[0], 1.0 / size[1]
x, y, w, h = (box[0] + box[1]) / 2.0 - 1, (box[2] + box[3]) / 2.0 - 1, box[1] - box[0], box[3] - box[2]
return x * dw, y * dh, w * dw, h * dh
with open(path / f"VOC{year}/Annotations/{image_id}.xml") as in_file, open(lb_path, "w", encoding="utf-8") as out_file:
tree = ET.parse(in_file)
root = tree.getroot()
size = root.find("size")
w = int(size.find("width").text)
h = int(size.find("height").text)
names = list(yaml["names"].values()) # names list
for obj in root.iter("object"):
cls = obj.find("name").text
if cls in names and int(obj.find("difficult").text) != 1:
xmlbox = obj.find("bndbox")
bb = convert_box((w, h), [float(xmlbox.find(x).text) for x in ("xmin", "xmax", "ymin", "ymax")])
cls_id = names.index(cls) # class id
out_file.write(" ".join(str(a) for a in (cls_id, *bb)) + "\n")
# Download
dir = Path(yaml["path"]) # dataset root dir
urls = [
f"{ASSETS_URL}/VOCtrainval_06-Nov-2007.zip", # 446MB, 5011 images
f"{ASSETS_URL}/VOCtest_06-Nov-2007.zip", # 438MB, 4952 images
f"{ASSETS_URL}/VOCtrainval_11-May-2012.zip", # 1.95GB, 17125 images
]
download(urls, dir=dir / "images", threads=3, exist_ok=True) # download and unzip over existing (required)
# Convert
path = dir / "images/VOCdevkit"
for year, image_set in ("2012", "train"), ("2012", "val"), ("2007", "train"), ("2007", "val"), ("2007", "test"):
imgs_path = dir / "images" / f"{image_set}{year}"
lbs_path = dir / "labels" / f"{image_set}{year}"
imgs_path.mkdir(exist_ok=True, parents=True)
lbs_path.mkdir(exist_ok=True, parents=True)
with open(path / f"VOC{year}/ImageSets/Main/{image_set}.txt") as f:
image_ids = f.read().strip().split()
for id in TQDM(image_ids, desc=f"{image_set}{year}"):
f = path / f"VOC{year}/JPEGImages/{id}.jpg" # old img path
lb_path = (lbs_path / f.name).with_suffix(".txt") # new label path
f.rename(imgs_path / f.name) # move image
convert_label(path, lb_path, year, id) # convert labels to YOLO formatИспользование#
VOC автоматически загружается при первом запуске обучения — три архива общим объёмом 2,8 ГБ — и требует примерно 6 ГБ свободного места на диске для распаковки и преобразования.
Чтобы обучить модель YOLO26n на датасете VOC в течение 100 эпох с размером изображения 640, можно использовать следующие фрагменты кода. Полный список доступных аргументов см. на странице обучения модели.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n.pt") # load a pretrained model (recommended for training)
# Train the model - dataset will auto-download on first run
results = model.train(data="VOC.yaml", epochs=100, imgsz=640)Примеры изображений и аннотаций#
На изображении ниже показан обучающий батч из датасета VOC, сформированный с помощью мозаичного объединения. Мозаичное объединение сочетает несколько изображений в один обучающий пример, увеличивая разнообразие объектов, масштабов и контекстов сцен, которые модель видит в каждом батче; подробности см. в руководстве по аугментации данных YOLO.

Цитирование и благодарности#
Если ты используешь датасет VOC в исследовательской или практической работе, пожалуйста, процитируй следующую статью:
@article{everingham2010pascal,
author={Everingham, Mark and Van Gool, Luc and Williams, Christopher K. I. and Winn, John and Zisserman, Andrew},
journal={International Journal of Computer Vision},
title={The Pascal Visual Object Classes (VOC) Challenge},
year={2010},
volume={88},
number={2},
pages={303-338},
doi={10.1007/s11263-009-0275-4}}Мы хотели бы поблагодарить консорциум PASCAL VOC за создание и поддержку этого ценного ресурса для сообщества компьютерного зрения. Дополнительную информацию о датасете VOC и его создателях можно найти на веб-сайте датасета PASCAL VOC.
Часто задаваемые вопросы#
PASCAL VOC используется для обучения и оценки моделей детектирования объектов на 20 классах повседневных объектов, таких как человек, автомобиль, собака и стул. Благодаря компактности, полной разметке и многолетней истории опубликованных базовых результатов он часто используется для проверки новых архитектур, учебных экспериментов и быстрых исследований переноса обучения.
Конфигурация VOC в Ultralytics содержит 21 503 изображения: 16 551 для обучения (trainval VOC2007 + trainval VOC2012) и 4 952 для валидации (тестовая выборка VOC2007). Во всех выборках используются одни и те же 20 классов. Полную структуру см. в разделе Структура датасета.
VOC автоматически загружается при первом запуске обучения с
data="VOC.yaml"— ручные действия не требуются. Скрипт получает три архива (2,8 ГБ) из ресурсов релизов Ultralytics на GitHub и преобразует XML-аннотации в формат YOLO.Обучи модель YOLO26n на VOC в течение 100 эпох с размером изображения 640:
Пример обученияfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="VOC.yaml", epochs=100, imgsz=640)Подробные конфигурации смотри на странице обучения и в разделе советов по обучению моделей.
В обоих соревнованиях используются одни и те же 20 классов, но представлены разные изображения. VOC2007 содержит 5 011 обучающих изображений trainval и тестовую выборку из 4 952 изображений с общедоступными аннотациями; VOC2012 содержит 11 540 обучающих изображений trainval, а его тестовые аннотации закрыты и оцениваются только официальным сервером оценки. Конфигурация Ultralytics
VOC.yamlобъединяет обе выборки trainval для обучения и выполняет валидацию на VOC2007 test.VOC меньше и проще: 20 классов и 21 503 изображения против 80 классов и 330 тыс. изображений у COCO. Результаты VOC традиционно представляют как mAP при 0,5 IoU, тогда как COCO усредняет mAP по порогам IoU от 0,5 до 0,95. VOC обучается значительно быстрее и подходит для быстрых экспериментов; датасет COCO является стандартом для бенчмаркинга в производственном масштабе.
Нет —
VOC.yaml— это конфигурация только для детектирования: её конвертер извлекает ограничивающие рамки из XML-аннотаций VOC, а маски сегментации из исходного бенчмарка не преобразуются. Чтобы обучить модель сегментации экземпляров, используй датасет с полигонами, например COCO-Seg, вместе с модельюyolo26n-seg.pt.



