Набор данных Tiger-Pose#
Введение#
Ultralytics представляет датасет Tiger-Pose — универсальный набор данных, предназначенный для задач оценки позы. Этот датасет включает 263 изображения из YouTube-видео, из которых 210 изображений выделены для обучения, а 53 — для валидации. Он служит отличным ресурсом для тестирования и отладки алгоритмов оценки позы.
Несмотря на небольшой тренировочный объем в 210 изображений, датасет Tiger-Pose отличается разнообразием, что делает его подходящим для оценки обучающих пайплайнов, выявления потенциальных ошибок и в качестве ценного подготовительного шага перед работой с более крупными датасетами для оценки позы.
Как только твой пайплайн успешно обучится на этом небольшом наборе, замени его своими ключевыми точками животных или объектов и масштабируй обучение на Ultralytics Platform, не покидая браузер.
Структура набора данных#
- Общее количество изображений: 263 (210 для обучения / 53 для валидации).
- Ключевые точки: 12 на тигра (без флага видимости).
- Размер загрузки: ~49.8 МБ.
- Структура директорий: ключевые точки в формате YOLO хранятся в
labels/{train,val}рядом с директориямиimages/{train,val}.
Watch: Train an Ultralytics YOLO Pose Model on the Tiger-Pose Dataset
YAML набора данных#
YAML-файл используется для указания деталей конфигурации датасета. Он содержит важнейшие данные, такие как пути к файлам, определения классов и другую сопутствующую информацию. В частности, для файла tiger-pose.yaml ты можешь ознакомиться с файлом конфигурации датасета Ultralytics Tiger-Pose.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Tiger Pose dataset by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/tiger-pose
# Example usage: yolo train data=tiger-pose.yaml
# parent
# ├── ultralytics
# └── datasets
# └── tiger-pose ← downloads here (49.8 MB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: tiger-pose # dataset root dir
train: images/train # train images (relative to 'path') 210 images
val: images/val # val images (relative to 'path') 53 images
# Keypoints
kpt_shape: [12, 2] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11]
# Classes
names:
0: tiger
# Keypoint names per class
kpt_names:
0:
- nose
- head
- withers
- tail_base
- right_hind_hock
- right_hind_paw
- left_hind_paw
- left_hind_hock
- right_front_wrist
- right_front_paw
- left_front_wrist
- left_front_paw
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/tiger-pose.zipИспользование#
Чтобы обучить модель YOLO26n-pose на датасете Tiger-Pose в течение 100 эпох с размером изображения 640, ты можешь использовать следующие фрагменты кода. Полный список доступных аргументов см. на странице модели Обучение.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="tiger-pose.yaml", epochs=100, imgsz=640)Примеры изображений и аннотации#
Вот несколько примеров изображений из набора данных Tiger-Pose вместе с соответствующими аннотациями:
- Мозаичное изображение: это изображение демонстрирует обучающий пакет, составленный из мозаично собранных изображений. Мозаика — это техника, используемая во время обучения, которая объединяет несколько изображений в одно, чтобы увеличить разнообразие объектов и сцен в каждом обучающем пакете. Это помогает улучшить способность модели к обобщению при работе с объектами различных размеров, соотношений сторон и контекстов.
Этот пример показывает разнообразие и сложность изображений в наборе данных Tiger-Pose, а также преимущества использования мозаики в процессе обучения.
Пример вывода (Inference)#
После обучения загрузи лучшую контрольную точку и запусти инференс на новых изображениях или видео — полный список аргументов см. на странице Предсказание.
from ultralytics import YOLO
# Load a model
model = YOLO("path/to/best.pt") # load a tiger-pose trained model
# Run inference
results = model.predict(source="https://youtu.be/Gc6K5eKrTNQ", show=True)Цитирование и благодарности#
Ultralytics выпускает аннотации датасета Tiger-Pose под лицензией AGPL-3.0. Исходное видео остается предметом его оригинальных условий, с которыми следует ознакомиться перед использованием или распространением извлеченных кадров.
FAQ#
Датасет Ultralytics Tiger-Pose предназначен для задач оценки позы и состоит из 263 изображений, полученных из YouTube-видео. Датасет разделен на 210 изображений для обучения и 53 изображения для валидации, что делает его отлично подходящим для тестирования, обучения и доработки алгоритмов оценки позы.
Загрузи
yolo26n-pose.ptи вызовиmodel.train(data="tiger-pose.yaml", epochs=100, imgsz=640)— полные фрагменты кода на Python и для CLI см. в примере обучения выше, а исчерпывающий список аргументов — на странице Обучение.Файл
tiger-pose.yamlопределяет путь к датасету, директории изображений обучения и валидации, единственный класс (tiger) иkpt_shape: [12, 2]— 12 ключевых точек на экземпляр без флага видимости. Точную конфигурацию см. в файле конфигурации датасета Ultralytics Tiger-Pose.Загрузи свою обученную контрольную точку (например,
path/to/best.pt) и вызовиmodel.predict(source=..., show=True)— полные фрагменты кода на Python и для CLI см. в примере инференса выше, а исчерпывающий список аргументов — на странице Предсказание.С 263 изображениями (210 для train / 53 для val), 1 классом, 12 ключевыми точками на экземпляр и размером загрузки ~49.8 МБ, Tiger-Pose достаточно мал для быстрого управления и в то же время достаточно разнообразен для проверки работоспособности конвейера обучения позе и выявления ошибок перед работой с более крупными датасетами.