YOLO Vision 2026:

Обзор наборов данных для оценки позы#

Поддерживаемые форматы наборов данных#

Формат Ultralytics YOLO#

Формат меток набора данных, используемый для обучения моделей оценки позы YOLO, выглядит следующим образом:

  1. Один текстовый файл на изображение: каждое изображение в наборе данных имеет соответствующий текстовый файл с тем же именем, что и файл изображения, и расширением ".txt".
  2. Одна строка на объект: каждая строка в текстовом файле соответствует одному экземпляру объекта на изображении.
  3. Информация об объекте в каждой строке: каждая строка содержит следующую информацию об экземпляре объекта:
    • Индекс класса объекта: целое число, представляющее класс объекта (например, 0 для человека, 1 для автомобиля и т. д.).
    • Координаты центра объекта: координаты x и y центра объекта, нормализованные в диапазоне от 0 до 1.
    • Ширина и высота объекта: ширина и высота объекта, нормализованные в диапазоне от 0 до 1.
    • Координаты ключевых точек объекта: ключевые точки объекта, нормализованные в диапазоне от 0 до 1.

Вот пример формата меток для задачи оценки позы:

Формат с 2D-ключевыми точками

<class-index> <x> <y> <width> <height> <px1> <py1> <px2> <py2> ... <pxn> <pyn>

Формат с видимостью ключевых точек (включает видимость для каждой точки)

<class-index> <x> <y> <width> <height> <px1> <py1> <p1-visibility> <px2> <py2> <p2-visibility> <pxn> <pyn> <pn-visibility>

В этом формате <class-index> — это индекс класса объекта, <x> <y> <width> <height> — нормализованные координаты bounding box, а <px1> <py1> <px2> <py2> ... <pxn> <pyn> — нормализованные координаты ключевых точек. Канал видимости необязателен, но полезен для датасетов, в которых аннотируется окклюзия.

Формат YAML для набора данных#

Фреймворк Ultralytics использует формат файла YAML для определения конфигурации набора данных и модели при обучении моделей оценки позы. Вот пример формата YAML, используемого для определения набора данных позы:

ultralytics/cfg/datasets/coco8-pose.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# COCO8-pose dataset (first 8 images from COCO train2017) by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/coco8-pose
# Example usage: yolo train data=coco8-pose.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── coco8-pose ← downloads here (1 MB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco8-pose # dataset root dir
train: images/train # train images (relative to 'path') 4 images
val: images/val # val images (relative to 'path') 4 images
test: # test images (optional)

# Keypoints
kpt_shape: [17, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 2, 1, 4, 3, 6, 5, 8, 7, 10, 9, 12, 11, 14, 13, 16, 15]

# Classes
names:
  0: person

# Keypoint names per class
kpt_names:
  0:
    - nose
    - left_eye
    - right_eye
    - left_ear
    - right_ear
    - left_shoulder
    - right_shoulder
    - left_elbow
    - right_elbow
    - left_wrist
    - right_wrist
    - left_hip
    - right_hip
    - left_knee
    - right_knee
    - left_ankle
    - right_ankle

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/coco8-pose.zip

Поля train, val и test указывают на изображения для обучения, валидации и тестирования. Каждое принимает директорию, список директорий или файл *.txt, в котором указан один путь к изображению на строку (пути, начинающиеся с ./, разрешаются относительно файла *.txt). Файл *.txt полезен для обучения на подмножестве директории, пропуском изображений без разметки или объединения изображений из нескольких источников в один сплит.

Пути к изображениям в виде `*.txt` файла
path: datasets/coco8-pose # dataset root
train: train.txt # a directory, a list e.g. [images/a, images/b], or a *.txt file
val: val.txt
names:
  0: person

names — это словарь имен классов. Порядок имен должен соответствовать порядку индексов классов объектов в файлах датасета YOLO.

(Необязательно) flip_idx сопоставляет каждую ключевую точку с ее зеркальным отражением, поэтому аугментация горизонтальным отражением сохраняет левую и правую стороны согласованными на симметричных скелетах, таких как человеческое тело или лицо. Для пяти ключевых точек лица, проиндексированных как [left eye, right eye, nose, left mouth, right mouth] = [0, 1, 2, 3, 4], flip_idx имеет вид [1, 0, 2, 4, 3]: лево-правые пары 0-1 и 3-4 меняются местами, а нос сохраняет собственный индекс.

(Необязательно) kpt_oks_sigmas задает пользовательские сигмы OKS для каждой ключевой точки, используемые при обучении и валидации, например [0.26, 0.25, 0.25, ...]. Длина списка должна быть равна количеству ключевых точек N из kpt_shape, и каждое значение должно быть положительным. Если опущено, для kpt_shape: [17, 3] используются сигмы COCO для 17 ключевых точек, а в противном случае — однородное значение 1/N.

Использование#

Пример
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-pose.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="coco8-pose.yaml", epochs=100, imgsz=640)

Поддерживаемые наборы данных#

В этом разделе описаны датасеты, совместимые с форматом Ultralytics YOLO и которые можно использовать для обучения моделей оценки позы:

COCO-Pose#

  • Описание: COCO-Pose — это крупномасштабный набор данных для оценки позы человека, включающий изображения COCO 2017, на которых размечены люди с ключевыми точками.
  • Формат меток: Такой же, как формат Ultralytics YOLO, описанный выше, с ключевыми точками для поз человека.
  • Количество классов: 1 (человек).
  • Ключевые точки: 17 типов ключевых точек, включая нос, глаза, уши, плечи, локти, запястья, бедра, колени и лодыжки, каждая с измерением видимости.
  • Использование: Подходит для обучения моделей оценки позы человека.
  • Дополнительные примечания: Датасет базируется на соревновании COCO Keypoints 2017: 58 945 изображений с аннотациями для 156 165 людей.
  • Подробнее о COCO-Pose

COCO8-Pose#

  • Описание: Ultralytics COCO8-Pose — это небольшой, но универсальный датасет для оценки позы, состоящий из первых 8 изображений обучающей выборки COCO train 2017, 4 из которых предназначены для обучения и 4 для валидации.
  • Формат меток: Такой же, как формат Ultralytics YOLO, описанный выше, с ключевыми точками для поз человека.
  • Количество классов: 1 (человек).
  • Ключевые точки: 17 типов ключевых точек, включая нос, глаза, уши, плечи, локти, запястья, бедра, колени и лодыжки, каждая с измерением видимости.
  • Использование: Подходит для тестирования и отладки моделей оценки позы или для экспериментов с новыми подходами к обнаружению ключевых точек.
  • Дополнительные примечания: COCO8-Pose идеально подходит для проверок на работоспособность и проверок CI.
  • Подробнее о COCO8-Pose

Dog-Pose#

  • Описание: Датасет Ultralytics Dog-Pose содержит 6773 изображения для обучения и 1703 изображения для валидации для оценки ключевых точек собак.
  • Формат меток: Следует формату Ultralytics YOLO с аннотациями для нескольких ключевых точек, специфичных для анатомии собаки.
  • Количество классов: 1 (собака).
  • Ключевые точки: 24 ключевые точки, каждая с измерением видимости, адаптированные для поз собак, таких как конечности, суставы и положение головы.
  • Использование: Идеально подходит для обучения моделей оценке поз собак в различных сценариях: от исследований до реальных приложений.
  • Дополнительные примечания: Исходные изображения взяты из Stanford Dogs Dataset.
  • Подробнее о Dog-Pose

Hand Keypoints#

  • Описание: Датасет Ultralytics Hand Keypoints содержит 26 768 изображений, из которых 18 776 выделены для обучения и 7992 для валидации.
  • Формат меток: Такой же, как формат Ultralytics YOLO, описанный выше, но с 21 ключевой точкой для человеческой руки и параметром видимости.
  • Количество классов: 1 (рука).
  • Ключевые точки: 21 ключевая точка.
  • Использование: Отлично подходит для оценки позы человеческой руки и распознавания жестов.
  • Дополнительные примечания: Аннотации ключевых точек генерируются с помощью Google MediaPipe для обеспечения единообразной разметки.
  • Подробнее о Hand Keypoints

Tiger-Pose#

  • Описание: Датасет Ultralytics Tiger-Pose включает 263 изображения из видео на YouTube, причем 210 изображений выделены для обучения и 53 для валидации.
  • Формат меток: Такой же, как у Ultralytics YOLO, описанный выше, с 12 ключевыми точками для поз животных и без измерения видимости.
  • Количество классов: 1 (тигр).
  • Ключевые точки: 12 ключевых точек.
  • Использование: Отлично подходит для позы животного или любой другой позы, не основанной на человеке.
  • Дополнительные примечания: Выпущено под лицензией AGPL-3.0.
  • Подробнее о Tiger-Pose

Добавление собственного набора данных#

Если у тебя есть собственный набор данных, и ты хочешь использовать его для обучения моделей оценки позы в формате Ultralytics YOLO, убедись, что он соответствует формату, указанному выше в разделе «Формат Ultralytics YOLO». Преобразуй свои аннотации в требуемый формат и укажи пути, количество классов и имена классов в файле конфигурации YAML.

Чтобы полностью пропустить этап конвертации, Ultralytics Platform позволяет загружать исходные изображения, размечать ключевые точки в браузере и сразу обучать модель на полученном датасете.

Инструмент преобразования#

Ultralytics предоставляет удобный инструмент конвертации для перевода меток из популярного формата датасета COCO в формат YOLO:

Пример
from ultralytics.data.converter import convert_coco

convert_coco(labels_dir="path/to/coco/annotations/", use_keypoints=True)

Этот инструмент конвертации можно использовать для преобразования датасета COCO или любого датасета в формате COCO в формат Ultralytics YOLO. Параметр use_keypoints определяет, нужно ли включать ключевые точки (для оценки позы) в преобразованные метки.

FAQ#

  • Формат Ultralytics YOLO для наборов данных оценки позы предполагает наличие текстового файла для каждого изображения. Каждая строка текстового файла содержит информацию об экземпляре объекта:

    • Индекс класса объекта
    • Координаты центра объекта (нормализованные x и y)
    • Ширина и высота объекта (нормализованные)
    • Координаты ключевых точек объекта (нормализованные pxn и pyn)

    Для 2D-поз ключевые точки включают нормализованные координаты x и y. При наличии измерения видимости каждая ключевая точка также имеет флаг видимости. Для получения дополнительной информации см. формат Ultralytics YOLO.

  • coco-pose.yaml поставляется вместе с пакетом и загружает изображения и метки при первом использовании, поэтому предварительная ручная подготовка не требуется:

    from ultralytics import YOLO
    
    model = YOLO("yolo26n-pose.pt")  # load pretrained model
    results = model.train(data="coco-pose.yaml", epochs=100, imgsz=640)

    Сведения о датасете см. в разделе COCO-Pose, а полный список аргументов — на странице Train.

  • Чтобы добавить свой набор данных:

    1. Преобразуй свои аннотации в формат Ultralytics YOLO.

    2. Создай файл конфигурации YAML, указав пути к набору данных, количество классов и имена классов.

    3. Используй файл конфигурации для обучения своей модели:

      from ultralytics import YOLO
      
      model = YOLO("yolo26n-pose.pt")
      results = model.train(data="your-dataset.yaml", epochs=100, imgsz=640)

      Для выполнения всех шагов ознакомьтесь с разделом Добавление собственного датасета.

  • Файл YAML набора данных в Ultralytics YOLO определяет конфигурацию набора данных и модели для обучения. Он указывает пути к изображениям для обучения, валидации и тестирования, формы ключевых точек, имена классов и другие параметры конфигурации. Этот структурированный формат помогает упростить управление наборами данных и обучение моделей. Вот пример формата YAML:

    # Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
    
    # COCO8-pose dataset (first 8 images from COCO train2017) by Ultralytics
    # Documentation: https://docs.ultralytics.com/datasets/pose/coco8-pose
    # Example usage: yolo train data=coco8-pose.yaml
    # parent
    # ├── ultralytics
    # └── datasets
    #     └── coco8-pose ← downloads here (1 MB)
    
    # Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
    path: coco8-pose # dataset root dir
    train: images/train # train images (relative to 'path') 4 images
    val: images/val # val images (relative to 'path') 4 images
    test: # test images (optional)
    
    # Keypoints
    kpt_shape: [17, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
    flip_idx: [0, 2, 1, 4, 3, 6, 5, 8, 7, 10, 9, 12, 11, 14, 13, 16, 15]
    
    # Classes
    names:
      0: person
    
    # Keypoint names per class
    kpt_names:
      0:
        - nose
        - left_eye
        - right_eye
        - left_ear
        - right_ear
        - left_shoulder
        - right_shoulder
        - left_elbow
        - right_elbow
        - left_wrist
        - right_wrist
        - left_hip
        - right_hip
        - left_knee
        - right_knee
        - left_ankle
        - right_ankle
    
    # Download script/URL (optional)
    download: https://github.com/ultralytics/assets/releases/download/v0.0.0/coco8-pose.zip

    Подробнее о создании YAML-файлов конфигурации читайте в разделе Формат YAML датасета.

  • Ultralytics предоставляет инструмент для преобразования меток набора данных COCO в формат YOLO, включая информацию о ключевых точках:

    from ultralytics.data.converter import convert_coco
    
    convert_coco(labels_dir="path/to/coco/annotations/", use_keypoints=True)

    Этот инструмент помогает легко интегрировать датасеты COCO в проекты YOLO. Подробности см. в разделе Инструмент конвертации и руководстве по предобработке данных.

Комментарии