Ultralytics YOLO27:

Датасет PASCAL VOC#

Датасет PASCAL VOC (классы визуальных объектов (VOC)) — это классический бенчмарк для детектирования объектов, содержащий 20 классов повседневных объектов. Конфигурация Ultralytics VOC.yaml объединяет обучающие выборки trainval VOC2007 и VOC2012 в обучающий набор из 16 551 изображения, выполняет валидацию на 4 952 общедоступных размеченных тестовых изображениях VOC2007 и автоматически загружает всё необходимое (2,8 ГБ) при первом использовании.



Watch: How to Train Ultralytics YOLO on the Pascal VOC Dataset | Object Detection | Computer Vision 🚀

Соревнования PASCAL VOC проходили с 2005 по 2012 год и повлияли на то, как оцениваются модели детектирования объектов: бенчмарк охватывает задачи классификации изображений, детектирования и сегментации, а также сделал популярной среднюю точность (mAP) в качестве стандартной метрики детектирования. Конфигурация Ultralytics VOC.yaml использует аннотации для детектирования, преобразуя исходные ограничивающие рамки из XML в формат YOLO во время загрузки.

Ключевые особенности#

  • 20 классов повседневных объектов: человек; шесть животных (птица, кошка, корова, собака, лошадь, овца); семь транспортных средств (самолёт, велосипед, лодка, автобус, автомобиль, мотоцикл, поезд); и шесть предметов интерьера (бутылка, стул, обеденный стол, растение в горшке, диван, телевизор).
  • Объединение двух поколений соревнований: обучение объединяет trainval VOC2007 (5 011 изображений) и trainval VOC2012 (11 540 изображений).
  • Стандартизированная оценка: десятилетия опубликованных базовых результатов VOC делают его удобной точкой отсчёта для сравнения моделей детектирования.
  • Готовность к YOLO: скрипт загрузки получает архивы и автоматически преобразует аннотации — ручная подготовка не требуется.

Структура датасета#

Конфигурация Ultralytics VOC.yaml определяет следующие выборки:

ВыборкаИзображенияИсточник
Обучение16,551VOC2007 trainval (5 011) + VOC2012 trainval (11 540)
Валидация4,952VOC2007 test, используется для оценки во время обучения
Тестовая4,952Те же тестовые изображения VOC2007 — конфигурация не определяет отдельную отложенную выборку

Аннотации VOC2007 test были опубликованы после соревнования того года, что позволяет использовать эту выборку в качестве размеченного валидационного набора. Аннотации VOC2012 test остаются закрытыми — результаты на них можно оценить только через официальный сервер оценки PASCAL, поэтому они не входят в эту конфигурацию.

Исключённые сложные объекты

Автоматический конвертер пропускает объекты, отмеченные как difficult в исходных XML-аннотациях VOC, поэтому количество экземпляров по классам немного отличается от официальной статистики VOC.

Открой VOC на платформе Ultralytics, чтобы просмотреть изображения с наложенными аннотациями, посмотреть распределение классов и тепловые карты ограничивающих рамок на вкладке Charts, а также клонировать датасет для обучения собственной модели в облаке.

Применения#

PASCAL VOC был основным бенчмарком для исследований в области детектирования объектов в годы до появления более крупного датасета COCO: такие детекторы, как Faster R-CNN и SSD, публиковали на нём свои исходные результаты, а модели Ultralytics YOLO обучаются на нём из коробки. Сегодня он по-прежнему популярен для:

  • Сравнения новых архитектур детектирования с многолетней историей опубликованных базовых результатов
  • Быстрых экспериментов и учебных работ — с 16 551 обучающим изображением он обучается значительно быстрее COCO
  • Исследований переноса обучения на компактном, хорошо изученном наборе повседневных классов

YAML датасета#

Файл VOC.yaml определяет конфигурацию датасета — пути к датасету, названия 20 классов и скрипт автоматической загрузки и преобразования. Он поддерживается в репозитории Ultralytics по адресу https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/VOC.yaml.

ultralytics/cfg/datasets/VOC.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# PASCAL VOC dataset https://www.robots.ox.ac.uk/~vgg/projects/pascal/VOC by University of Oxford
# Documentation: https://docs.ultralytics.com/datasets/detect/voc
# Example usage: yolo train data=VOC.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── VOC ← downloads here (2.8 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: VOC
train: # train images (relative to 'path') 16551 images
  - images/train2012
  - images/train2007
  - images/val2012
  - images/val2007
val: # val images (relative to 'path') 4952 images
  - images/test2007
test: # test images (optional)
  - images/test2007

# Classes
names:
  0: aeroplane
  1: bicycle
  2: bird
  3: boat
  4: bottle
  5: bus
  6: car
  7: cat
  8: chair
  9: cow
  10: diningtable
  11: dog
  12: horse
  13: motorbike
  14: person
  15: pottedplant
  16: sheep
  17: sofa
  18: train
  19: tvmonitor

# Download script/URL (optional) ---------------------------------------------------------------------------------------
download: |
  import xml.etree.ElementTree as ET
  from pathlib import Path

  from ultralytics.utils.downloads import download
  from ultralytics.utils import ASSETS_URL, TQDM

  def convert_label(path, lb_path, year, image_id):
      """Converts XML annotations from VOC format to YOLO format by extracting bounding boxes and class IDs."""

      def convert_box(size, box):
          dw, dh = 1.0 / size[0], 1.0 / size[1]
          x, y, w, h = (box[0] + box[1]) / 2.0 - 1, (box[2] + box[3]) / 2.0 - 1, box[1] - box[0], box[3] - box[2]
          return x * dw, y * dh, w * dw, h * dh

      with open(path / f"VOC{year}/Annotations/{image_id}.xml") as in_file, open(lb_path, "w", encoding="utf-8") as out_file:
          tree = ET.parse(in_file)
          root = tree.getroot()
          size = root.find("size")
          w = int(size.find("width").text)
          h = int(size.find("height").text)

          names = list(yaml["names"].values())  # names list
          for obj in root.iter("object"):
              cls = obj.find("name").text
              if cls in names and int(obj.find("difficult").text) != 1:
                  xmlbox = obj.find("bndbox")
                  bb = convert_box((w, h), [float(xmlbox.find(x).text) for x in ("xmin", "xmax", "ymin", "ymax")])
                  cls_id = names.index(cls)  # class id
                  out_file.write(" ".join(str(a) for a in (cls_id, *bb)) + "\n")

  # Download
  dir = Path(yaml["path"])  # dataset root dir
  urls = [
      f"{ASSETS_URL}/VOCtrainval_06-Nov-2007.zip",  # 446MB, 5011 images
      f"{ASSETS_URL}/VOCtest_06-Nov-2007.zip",  # 438MB, 4952 images
      f"{ASSETS_URL}/VOCtrainval_11-May-2012.zip",  # 1.95GB, 17125 images
  ]
  download(urls, dir=dir / "images", threads=3, exist_ok=True)  # download and unzip over existing (required)

  # Convert
  path = dir / "images/VOCdevkit"
  for year, image_set in ("2012", "train"), ("2012", "val"), ("2007", "train"), ("2007", "val"), ("2007", "test"):
      imgs_path = dir / "images" / f"{image_set}{year}"
      lbs_path = dir / "labels" / f"{image_set}{year}"
      imgs_path.mkdir(exist_ok=True, parents=True)
      lbs_path.mkdir(exist_ok=True, parents=True)

      with open(path / f"VOC{year}/ImageSets/Main/{image_set}.txt") as f:
          image_ids = f.read().strip().split()
      for id in TQDM(image_ids, desc=f"{image_set}{year}"):
          f = path / f"VOC{year}/JPEGImages/{id}.jpg"  # old img path
          lb_path = (lbs_path / f.name).with_suffix(".txt")  # new label path
          f.rename(imgs_path / f.name)  # move image
          convert_label(path, lb_path, year, id)  # convert labels to YOLO format

Использование#

Загрузка 2,8 ГБ

VOC автоматически загружается при первом запуске обучения — три архива общим объёмом 2,8 ГБ — и требует примерно 6 ГБ свободного места на диске для распаковки и преобразования.

Чтобы обучить модель YOLO26n на датасете VOC в течение 100 эпох с размером изображения 640, можно использовать следующие фрагменты кода. Полный список доступных аргументов см. на странице обучения модели.

Пример обучения
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n.pt")  # load a pretrained model (recommended for training)

# Train the model - dataset will auto-download on first run
results = model.train(data="VOC.yaml", epochs=100, imgsz=640)

Примеры изображений и аннотаций#

На изображении ниже показан обучающий батч из датасета VOC, сформированный с помощью мозаичного объединения. Мозаичное объединение сочетает несколько изображений в один обучающий пример, увеличивая разнообразие объектов, масштабов и контекстов сцен, которые модель видит в каждом батче; подробности см. в руководстве по аугментации данных YOLO.

Мозаичный обучающий батч датасета Pascal VOC

Цитирование и благодарности#

Если ты используешь датасет VOC в исследовательской или практической работе, пожалуйста, процитируй следующую статью:

Цитата
@article{everingham2010pascal,
  author={Everingham, Mark and Van Gool, Luc and Williams, Christopher K. I. and Winn, John and Zisserman, Andrew},
  journal={International Journal of Computer Vision},
  title={The Pascal Visual Object Classes (VOC) Challenge},
  year={2010},
  volume={88},
  number={2},
  pages={303-338},
  doi={10.1007/s11263-009-0275-4}}

Мы хотели бы поблагодарить консорциум PASCAL VOC за создание и поддержку этого ценного ресурса для сообщества компьютерного зрения. Дополнительную информацию о датасете VOC и его создателях можно найти на веб-сайте датасета PASCAL VOC.

Часто задаваемые вопросы#

  • PASCAL VOC используется для обучения и оценки моделей детектирования объектов на 20 классах повседневных объектов, таких как человек, автомобиль, собака и стул. Благодаря компактности, полной разметке и многолетней истории опубликованных базовых результатов он часто используется для проверки новых архитектур, учебных экспериментов и быстрых исследований переноса обучения.

  • Конфигурация VOC в Ultralytics содержит 21 503 изображения: 16 551 для обучения (trainval VOC2007 + trainval VOC2012) и 4 952 для валидации (тестовая выборка VOC2007). Во всех выборках используются одни и те же 20 классов. Полную структуру см. в разделе Структура датасета.

  • VOC автоматически загружается при первом запуске обучения с data="VOC.yaml" — ручные действия не требуются. Скрипт получает три архива (2,8 ГБ) из ресурсов релизов Ultralytics на GitHub и преобразует XML-аннотации в формат YOLO.

  • Обучи модель YOLO26n на VOC в течение 100 эпох с размером изображения 640:

    Пример обучения
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="VOC.yaml", epochs=100, imgsz=640)

    Подробные конфигурации смотри на странице обучения и в разделе советов по обучению моделей.

  • В обоих соревнованиях используются одни и те же 20 классов, но представлены разные изображения. VOC2007 содержит 5 011 обучающих изображений trainval и тестовую выборку из 4 952 изображений с общедоступными аннотациями; VOC2012 содержит 11 540 обучающих изображений trainval, а его тестовые аннотации закрыты и оцениваются только официальным сервером оценки. Конфигурация Ultralytics VOC.yaml объединяет обе выборки trainval для обучения и выполняет валидацию на VOC2007 test.

  • VOC меньше и проще: 20 классов и 21 503 изображения против 80 классов и 330 тыс. изображений у COCO. Результаты VOC традиционно представляют как mAP при 0,5 IoU, тогда как COCO усредняет mAP по порогам IoU от 0,5 до 0,95. VOC обучается значительно быстрее и подходит для быстрых экспериментов; датасет COCO является стандартом для бенчмаркинга в производственном масштабе.

  • Нет — VOC.yaml — это конфигурация только для детектирования: её конвертер извлекает ограничивающие рамки из XML-аннотаций VOC, а маски сегментации из исходного бенчмарка не преобразуются. Чтобы обучить модель сегментации экземпляров, используй датасет с полигонами, например COCO-Seg, вместе с моделью yolo26n-seg.pt.

Комментарии