YOLO Vision 2026:

Датасет Tiger-Pose#

Введение#

Ultralytics представляет датасет Tiger-Pose — универсальную коллекцию, предназначенную для задач оценки позы. Этот датасет включает 263 изображения, полученные из видео на YouTube: 210 изображений выделено для обучения, а 53 — для валидации. Это отличный ресурс для тестирования и отладки алгоритмов оценки позы.

Несмотря на относительно небольшой обучающий набор из 210 изображений, датасет Tiger-Pose отличается разнообразием, поэтому подходит для оценки пайплайнов обучения, выявления потенциальных ошибок и служит полезным предварительным этапом перед работой с более крупными датасетами для оценки позы.

После того как твой пайплайн успешно обучится на этом небольшом наборе, замени ключевые точки животных или объектов на свои и масштабируй обучение на Ultralytics Platform, не выходя из браузера.

Структура датасета#

  • Всего изображений: 263 (210 для обучения / 53 для валидации).
  • Ключевые точки: 12 на каждого тигра (без флага видимости).
  • Размер загрузки: ~49.8 МБ.
  • Структура каталогов: ключевые точки в формате YOLO хранятся в labels/{train,val} вместе с каталогами images/{train,val}.


Watch: Train an Ultralytics YOLO Pose Model on the Tiger-Pose Dataset

YAML датасета#

Файл YAML используется для указания конфигурации датасета. Он содержит такие важные данные, как пути к файлам, определения классов и другую необходимую информацию. В частности, для файла tiger-pose.yaml ты можешь открыть файл конфигурации датасета Ultralytics Tiger-Pose.

ultralytics/cfg/datasets/tiger-pose.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# Tiger Pose dataset by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/tiger-pose
# Example usage: yolo train data=tiger-pose.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── tiger-pose ← downloads here (49.8 MB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: tiger-pose # dataset root dir
train: images/train # train images (relative to 'path') 210 images
val: images/val # val images (relative to 'path') 53 images

# Keypoints
kpt_shape: [12, 2] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11]

# Classes
names:
  0: tiger

# Keypoint names per class
kpt_names:
  0:
    - nose
    - head
    - withers
    - tail_base
    - right_hind_hock
    - right_hind_paw
    - left_hind_paw
    - left_hind_hock
    - right_front_wrist
    - right_front_paw
    - left_front_wrist
    - left_front_paw

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/tiger-pose.zip

Использование#

Чтобы обучить модель YOLO26n-pose на датасете Tiger-Pose в течение 100 эпох с размером изображения 640, можно использовать следующие фрагменты кода. Полный список доступных аргументов приведён на странице Обучение модели.

Пример обучения
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-pose.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="tiger-pose.yaml", epochs=100, imgsz=640)

Примеры изображений и аннотаций#

Ниже приведены примеры изображений из датасета Tiger-Pose вместе с соответствующими аннотациями:

Tiger pose estimation dataset mosaic training batch
  • Мозаичное изображение: на этом изображении показан обучающий батч, составленный из мозаичных изображений датасета. Мозаицирование — это применяемая во время обучения техника, которая объединяет несколько изображений в одно, чтобы увеличить разнообразие объектов и сцен в каждом обучающем батче. Это помогает улучшить способность модели обобщать данные для объектов разных размеров, с разными соотношениями сторон и в разных контекстах.

Этот пример демонстрирует разнообразие и сложность изображений в датасете Tiger-Pose, а также преимущества использования мозаичного объединения в процессе обучения.

Пример инференса#

После обучения загрузи лучший чекпоинт и запусти инференс на новых изображениях или видео — полный список аргументов см. на странице Предсказание.

Пример инференса
from ultralytics import YOLO

# Load a model
model = YOLO("path/to/best.pt")  # load a tiger-pose trained model

# Run inference
results = model.predict(source="https://youtu.be/Gc6K5eKrTNQ", show=True)

Цитирование и благодарности#

Ultralytics публикует аннотации датасета Tiger-Pose на условиях лицензии AGPL-3.0. На исходное видео по-прежнему распространяются его первоначальные условия, с которыми следует ознакомиться перед использованием или распространением извлечённых кадров.

Часто задаваемые вопросы#

  • Датасет Ultralytics Tiger-Pose предназначен для задач оценки позы и состоит из 263 изображений, полученных из видео на YouTube. Датасет разделён на 210 обучающих и 53 валидационных изображения, поэтому хорошо подходит для тестирования, обучения и улучшения алгоритмов оценки позы.

  • Загрузи yolo26n-pose.pt и вызови model.train(data="tiger-pose.yaml", epochs=100, imgsz=640) — полный пример с фрагментами кода на Python и CLI см. выше в разделе Пример обучения, а полный список аргументов — на странице Обучение.

  • Файл tiger-pose.yaml определяет путь к датасету, каталоги изображений для обучения и валидации, один класс (tiger) и kpt_shape: [12, 2] — 12 ключевых точек на каждый экземпляр без флага видимости. Точную конфигурацию см. в файле конфигурации датасета Ultralytics Tiger-Pose.

  • Загрузи обученный чекпоинт (например, path/to/best.pt) и вызови model.predict(source=..., show=True) — полный пример с фрагментами кода на Python и CLI см. выше в разделе Пример инференса, а полный список аргументов — на странице Предсказание.

  • При 263 изображениях всего (210 для обучения / 53 для валидации), 1 классе, 12 ключевых точках на каждый экземпляр и размере загрузки ~49.8 МБ датасет Tiger-Pose достаточно мал, чтобы быстро с ним работать, но при этом достаточно разнообразен для быстрой проверки пайплайна обучения позы и выявления ошибок перед переходом к более крупным датасетам.

Комментарии