Обзор наборов данных для оценки позы#
Поддерживаемые форматы наборов данных#
Формат Ultralytics YOLO#
Формат меток набора данных, используемый для обучения моделей оценки позы YOLO, выглядит следующим образом:
- Один текстовый файл на изображение: каждое изображение в наборе данных имеет соответствующий текстовый файл с тем же именем, что и файл изображения, и расширением ".txt".
- Одна строка на объект: каждая строка в текстовом файле соответствует одному экземпляру объекта на изображении.
- Информация об объекте в каждой строке: каждая строка содержит следующую информацию об экземпляре объекта:
- Индекс класса объекта: целое число, представляющее класс объекта (например, 0 для человека, 1 для автомобиля и т. д.).
- Координаты центра объекта: координаты x и y центра объекта, нормализованные в диапазоне от 0 до 1.
- Ширина и высота объекта: ширина и высота объекта, нормализованные в диапазоне от 0 до 1.
- Координаты ключевых точек объекта: ключевые точки объекта, нормализованные в диапазоне от 0 до 1.
Вот пример формата меток для задачи оценки позы:
Формат с 2D-ключевыми точками
<class-index> <x> <y> <width> <height> <px1> <py1> <px2> <py2> ... <pxn> <pyn>Формат с видимостью ключевых точек (включает видимость для каждой точки)
<class-index> <x> <y> <width> <height> <px1> <py1> <p1-visibility> <px2> <py2> <p2-visibility> <pxn> <pyn> <pn-visibility>В этом формате <class-index> — это индекс класса объекта, <x> <y> <width> <height> — нормализованные координаты bounding box, а <px1> <py1> <px2> <py2> ... <pxn> <pyn> — нормализованные координаты ключевых точек. Канал видимости необязателен, но полезен для датасетов, в которых аннотируется окклюзия.
Формат YAML для набора данных#
Фреймворк Ultralytics использует формат файла YAML для определения конфигурации набора данных и модели при обучении моделей оценки позы. Вот пример формата YAML, используемого для определения набора данных позы:
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# COCO8-pose dataset (first 8 images from COCO train2017) by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/coco8-pose
# Example usage: yolo train data=coco8-pose.yaml
# parent
# ├── ultralytics
# └── datasets
# └── coco8-pose ← downloads here (1 MB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco8-pose # dataset root dir
train: images/train # train images (relative to 'path') 4 images
val: images/val # val images (relative to 'path') 4 images
test: # test images (optional)
# Keypoints
kpt_shape: [17, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 2, 1, 4, 3, 6, 5, 8, 7, 10, 9, 12, 11, 14, 13, 16, 15]
# Classes
names:
0: person
# Keypoint names per class
kpt_names:
0:
- nose
- left_eye
- right_eye
- left_ear
- right_ear
- left_shoulder
- right_shoulder
- left_elbow
- right_elbow
- left_wrist
- right_wrist
- left_hip
- right_hip
- left_knee
- right_knee
- left_ankle
- right_ankle
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/coco8-pose.zipПоля train, val и test указывают на изображения для обучения, валидации и тестирования. Каждое принимает директорию, список директорий или файл *.txt, в котором указан один путь к изображению на строку (пути, начинающиеся с ./, разрешаются относительно файла *.txt). Файл *.txt полезен для обучения на подмножестве директории, пропуском изображений без разметки или объединения изображений из нескольких источников в один сплит.
path: datasets/coco8-pose # dataset root
train: train.txt # a directory, a list e.g. [images/a, images/b], or a *.txt file
val: val.txt
names:
0: personnames — это словарь имен классов. Порядок имен должен соответствовать порядку индексов классов объектов в файлах датасета YOLO.
(Необязательно) flip_idx сопоставляет каждую ключевую точку с ее зеркальным отражением, поэтому аугментация горизонтальным отражением сохраняет левую и правую стороны согласованными на симметричных скелетах, таких как человеческое тело или лицо. Для пяти ключевых точек лица, проиндексированных как [left eye, right eye, nose, left mouth, right mouth] = [0, 1, 2, 3, 4], flip_idx имеет вид [1, 0, 2, 4, 3]: лево-правые пары 0-1 и 3-4 меняются местами, а нос сохраняет собственный индекс.
(Необязательно) kpt_oks_sigmas задает пользовательские сигмы OKS для каждой ключевой точки, используемые при обучении и валидации, например [0.26, 0.25, 0.25, ...]. Длина списка должна быть равна количеству ключевых точек N из kpt_shape, и каждое значение должно быть положительным. Если опущено, для kpt_shape: [17, 3] используются сигмы COCO для 17 ключевых точек, а в противном случае — однородное значение 1/N.
Использование#
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="coco8-pose.yaml", epochs=100, imgsz=640)Поддерживаемые наборы данных#
В этом разделе описаны датасеты, совместимые с форматом Ultralytics YOLO и которые можно использовать для обучения моделей оценки позы:
COCO-Pose#
- Описание: COCO-Pose — это крупномасштабный набор данных для оценки позы человека, включающий изображения COCO 2017, на которых размечены люди с ключевыми точками.
- Формат меток: Такой же, как формат Ultralytics YOLO, описанный выше, с ключевыми точками для поз человека.
- Количество классов: 1 (человек).
- Ключевые точки: 17 типов ключевых точек, включая нос, глаза, уши, плечи, локти, запястья, бедра, колени и лодыжки, каждая с измерением видимости.
- Использование: Подходит для обучения моделей оценки позы человека.
- Дополнительные примечания: Датасет базируется на соревновании COCO Keypoints 2017: 58 945 изображений с аннотациями для 156 165 людей.
- Подробнее о COCO-Pose
COCO8-Pose#
- Описание: Ultralytics COCO8-Pose — это небольшой, но универсальный датасет для оценки позы, состоящий из первых 8 изображений обучающей выборки COCO train 2017, 4 из которых предназначены для обучения и 4 для валидации.
- Формат меток: Такой же, как формат Ultralytics YOLO, описанный выше, с ключевыми точками для поз человека.
- Количество классов: 1 (человек).
- Ключевые точки: 17 типов ключевых точек, включая нос, глаза, уши, плечи, локти, запястья, бедра, колени и лодыжки, каждая с измерением видимости.
- Использование: Подходит для тестирования и отладки моделей оценки позы или для экспериментов с новыми подходами к обнаружению ключевых точек.
- Дополнительные примечания: COCO8-Pose идеально подходит для проверок на работоспособность и проверок CI.
- Подробнее о COCO8-Pose
Dog-Pose#
- Описание: Датасет Ultralytics Dog-Pose содержит 6773 изображения для обучения и 1703 изображения для валидации для оценки ключевых точек собак.
- Формат меток: Следует формату Ultralytics YOLO с аннотациями для нескольких ключевых точек, специфичных для анатомии собаки.
- Количество классов: 1 (собака).
- Ключевые точки: 24 ключевые точки, каждая с измерением видимости, адаптированные для поз собак, таких как конечности, суставы и положение головы.
- Использование: Идеально подходит для обучения моделей оценке поз собак в различных сценариях: от исследований до реальных приложений.
- Дополнительные примечания: Исходные изображения взяты из Stanford Dogs Dataset.
- Подробнее о Dog-Pose
Hand Keypoints#
- Описание: Датасет Ultralytics Hand Keypoints содержит 26 768 изображений, из которых 18 776 выделены для обучения и 7992 для валидации.
- Формат меток: Такой же, как формат Ultralytics YOLO, описанный выше, но с 21 ключевой точкой для человеческой руки и параметром видимости.
- Количество классов: 1 (рука).
- Ключевые точки: 21 ключевая точка.
- Использование: Отлично подходит для оценки позы человеческой руки и распознавания жестов.
- Дополнительные примечания: Аннотации ключевых точек генерируются с помощью Google MediaPipe для обеспечения единообразной разметки.
- Подробнее о Hand Keypoints
Tiger-Pose#
- Описание: Датасет Ultralytics Tiger-Pose включает 263 изображения из видео на YouTube, причем 210 изображений выделены для обучения и 53 для валидации.
- Формат меток: Такой же, как у Ultralytics YOLO, описанный выше, с 12 ключевыми точками для поз животных и без измерения видимости.
- Количество классов: 1 (тигр).
- Ключевые точки: 12 ключевых точек.
- Использование: Отлично подходит для позы животного или любой другой позы, не основанной на человеке.
- Дополнительные примечания: Выпущено под лицензией AGPL-3.0.
- Подробнее о Tiger-Pose
Добавление собственного набора данных#
Если у тебя есть собственный набор данных, и ты хочешь использовать его для обучения моделей оценки позы в формате Ultralytics YOLO, убедись, что он соответствует формату, указанному выше в разделе «Формат Ultralytics YOLO». Преобразуй свои аннотации в требуемый формат и укажи пути, количество классов и имена классов в файле конфигурации YAML.
Чтобы полностью пропустить этап конвертации, Ultralytics Platform позволяет загружать исходные изображения, размечать ключевые точки в браузере и сразу обучать модель на полученном датасете.
Инструмент преобразования#
Ultralytics предоставляет удобный инструмент конвертации для перевода меток из популярного формата датасета COCO в формат YOLO:
from ultralytics.data.converter import convert_coco
convert_coco(labels_dir="path/to/coco/annotations/", use_keypoints=True)Этот инструмент конвертации можно использовать для преобразования датасета COCO или любого датасета в формате COCO в формат Ultralytics YOLO. Параметр use_keypoints определяет, нужно ли включать ключевые точки (для оценки позы) в преобразованные метки.
FAQ#
Формат Ultralytics YOLO для наборов данных оценки позы предполагает наличие текстового файла для каждого изображения. Каждая строка текстового файла содержит информацию об экземпляре объекта:
- Индекс класса объекта
- Координаты центра объекта (нормализованные x и y)
- Ширина и высота объекта (нормализованные)
- Координаты ключевых точек объекта (нормализованные pxn и pyn)
Для 2D-поз ключевые точки включают нормализованные координаты x и y. При наличии измерения видимости каждая ключевая точка также имеет флаг видимости. Для получения дополнительной информации см. формат Ultralytics YOLO.
coco-pose.yamlпоставляется вместе с пакетом и загружает изображения и метки при первом использовании, поэтому предварительная ручная подготовка не требуется:from ultralytics import YOLO model = YOLO("yolo26n-pose.pt") # load pretrained model results = model.train(data="coco-pose.yaml", epochs=100, imgsz=640)Сведения о датасете см. в разделе COCO-Pose, а полный список аргументов — на странице Train.
Чтобы добавить свой набор данных:
-
Преобразуй свои аннотации в формат Ultralytics YOLO.
-
Создай файл конфигурации YAML, указав пути к набору данных, количество классов и имена классов.
-
Используй файл конфигурации для обучения своей модели:
from ultralytics import YOLO model = YOLO("yolo26n-pose.pt") results = model.train(data="your-dataset.yaml", epochs=100, imgsz=640)Для выполнения всех шагов ознакомьтесь с разделом Добавление собственного датасета.
-
Файл YAML набора данных в Ultralytics YOLO определяет конфигурацию набора данных и модели для обучения. Он указывает пути к изображениям для обучения, валидации и тестирования, формы ключевых точек, имена классов и другие параметры конфигурации. Этот структурированный формат помогает упростить управление наборами данных и обучение моделей. Вот пример формата YAML:
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license # COCO8-pose dataset (first 8 images from COCO train2017) by Ultralytics # Documentation: https://docs.ultralytics.com/datasets/pose/coco8-pose # Example usage: yolo train data=coco8-pose.yaml # parent # ├── ultralytics # └── datasets # └── coco8-pose ← downloads here (1 MB) # Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..] path: coco8-pose # dataset root dir train: images/train # train images (relative to 'path') 4 images val: images/val # val images (relative to 'path') 4 images test: # test images (optional) # Keypoints kpt_shape: [17, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible) flip_idx: [0, 2, 1, 4, 3, 6, 5, 8, 7, 10, 9, 12, 11, 14, 13, 16, 15] # Classes names: 0: person # Keypoint names per class kpt_names: 0: - nose - left_eye - right_eye - left_ear - right_ear - left_shoulder - right_shoulder - left_elbow - right_elbow - left_wrist - right_wrist - left_hip - right_hip - left_knee - right_knee - left_ankle - right_ankle # Download script/URL (optional) download: https://github.com/ultralytics/assets/releases/download/v0.0.0/coco8-pose.zipПодробнее о создании YAML-файлов конфигурации читайте в разделе Формат YAML датасета.
Ultralytics предоставляет инструмент для преобразования меток набора данных COCO в формат YOLO, включая информацию о ключевых точках:
from ultralytics.data.converter import convert_coco convert_coco(labels_dir="path/to/coco/annotations/", use_keypoints=True)Этот инструмент помогает легко интегрировать датасеты COCO в проекты YOLO. Подробности см. в разделе Инструмент конвертации и руководстве по предобработке данных.