YOLO Vision 2026:

Набор данных Tiger-Pose#

Введение#

Ultralytics представляет датасет Tiger-Pose — универсальный набор данных, предназначенный для задач оценки позы. Этот датасет включает 263 изображения из YouTube-видео, из которых 210 изображений выделены для обучения, а 53 — для валидации. Он служит отличным ресурсом для тестирования и отладки алгоритмов оценки позы.

Несмотря на небольшой тренировочный объем в 210 изображений, датасет Tiger-Pose отличается разнообразием, что делает его подходящим для оценки обучающих пайплайнов, выявления потенциальных ошибок и в качестве ценного подготовительного шага перед работой с более крупными датасетами для оценки позы.

Как только твой пайплайн успешно обучится на этом небольшом наборе, замени его своими ключевыми точками животных или объектов и масштабируй обучение на Ultralytics Platform, не покидая браузер.

Структура набора данных#

  • Общее количество изображений: 263 (210 для обучения / 53 для валидации).
  • Ключевые точки: 12 на тигра (без флага видимости).
  • Размер загрузки: ~49.8 МБ.
  • Структура директорий: ключевые точки в формате YOLO хранятся в labels/{train,val} рядом с директориями images/{train,val}.


Watch: Train an Ultralytics YOLO Pose Model on the Tiger-Pose Dataset

YAML набора данных#

YAML-файл используется для указания деталей конфигурации датасета. Он содержит важнейшие данные, такие как пути к файлам, определения классов и другую сопутствующую информацию. В частности, для файла tiger-pose.yaml ты можешь ознакомиться с файлом конфигурации датасета Ultralytics Tiger-Pose.

ultralytics/cfg/datasets/tiger-pose.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# Tiger Pose dataset by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/tiger-pose
# Example usage: yolo train data=tiger-pose.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── tiger-pose ← downloads here (49.8 MB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: tiger-pose # dataset root dir
train: images/train # train images (relative to 'path') 210 images
val: images/val # val images (relative to 'path') 53 images

# Keypoints
kpt_shape: [12, 2] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11]

# Classes
names:
  0: tiger

# Keypoint names per class
kpt_names:
  0:
    - nose
    - head
    - withers
    - tail_base
    - right_hind_hock
    - right_hind_paw
    - left_hind_paw
    - left_hind_hock
    - right_front_wrist
    - right_front_paw
    - left_front_wrist
    - left_front_paw

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/tiger-pose.zip

Использование#

Чтобы обучить модель YOLO26n-pose на датасете Tiger-Pose в течение 100 эпох с размером изображения 640, ты можешь использовать следующие фрагменты кода. Полный список доступных аргументов см. на странице модели Обучение.

Пример обучения
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-pose.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="tiger-pose.yaml", epochs=100, imgsz=640)

Примеры изображений и аннотации#

Вот несколько примеров изображений из набора данных Tiger-Pose вместе с соответствующими аннотациями:

Tiger pose estimation dataset mosaic training batch
  • Мозаичное изображение: это изображение демонстрирует обучающий пакет, составленный из мозаично собранных изображений. Мозаика — это техника, используемая во время обучения, которая объединяет несколько изображений в одно, чтобы увеличить разнообразие объектов и сцен в каждом обучающем пакете. Это помогает улучшить способность модели к обобщению при работе с объектами различных размеров, соотношений сторон и контекстов.

Этот пример показывает разнообразие и сложность изображений в наборе данных Tiger-Pose, а также преимущества использования мозаики в процессе обучения.

Пример вывода (Inference)#

После обучения загрузи лучшую контрольную точку и запусти инференс на новых изображениях или видео — полный список аргументов см. на странице Предсказание.

Пример вывода (Inference)
from ultralytics import YOLO

# Load a model
model = YOLO("path/to/best.pt")  # load a tiger-pose trained model

# Run inference
results = model.predict(source="https://youtu.be/Gc6K5eKrTNQ", show=True)

Цитирование и благодарности#

Ultralytics выпускает аннотации датасета Tiger-Pose под лицензией AGPL-3.0. Исходное видео остается предметом его оригинальных условий, с которыми следует ознакомиться перед использованием или распространением извлеченных кадров.

FAQ#

  • Датасет Ultralytics Tiger-Pose предназначен для задач оценки позы и состоит из 263 изображений, полученных из YouTube-видео. Датасет разделен на 210 изображений для обучения и 53 изображения для валидации, что делает его отлично подходящим для тестирования, обучения и доработки алгоритмов оценки позы.

  • Загрузи yolo26n-pose.pt и вызови model.train(data="tiger-pose.yaml", epochs=100, imgsz=640) — полные фрагменты кода на Python и для CLI см. в примере обучения выше, а исчерпывающий список аргументов — на странице Обучение.

  • Файл tiger-pose.yaml определяет путь к датасету, директории изображений обучения и валидации, единственный класс (tiger) и kpt_shape: [12, 2] — 12 ключевых точек на экземпляр без флага видимости. Точную конфигурацию см. в файле конфигурации датасета Ultralytics Tiger-Pose.

  • Загрузи свою обученную контрольную точку (например, path/to/best.pt) и вызови model.predict(source=..., show=True) — полные фрагменты кода на Python и для CLI см. в примере инференса выше, а исчерпывающий список аргументов — на странице Предсказание.

  • С 263 изображениями (210 для train / 53 для val), 1 классом, 12 ключевыми точками на экземпляр и размером загрузки ~49.8 МБ, Tiger-Pose достаточно мал для быстрого управления и в то же время достаточно разнообразен для проверки работоспособности конвейера обучения позе и выявления ошибок перед работой с более крупными датасетами.

Комментарии