Ultralytics YOLO27:

Conjunto de datos Tiger-Pose#

Introducción#

Ultralytics presenta el conjunto de datos Tiger-Pose, una colección versátil diseñada para tareas de estimación de poses. Este conjunto de datos consta de 263 imágenes obtenidas de un vídeo de YouTube, de las cuales 210 se destinan al entrenamiento y 53 a la validación. Es un recurso excelente para probar y solucionar problemas en algoritmos de estimación de poses.

A pesar de contar con un conjunto de entrenamiento manejable de 210 imágenes, el conjunto de datos Tiger-Pose ofrece diversidad, por lo que resulta adecuado para evaluar pipelines de entrenamiento, identificar posibles errores y servir como paso preliminar útil antes de trabajar con conjuntos de datos más grandes para la estimación de poses.

Cuando tu pipeline entrene correctamente con este conjunto pequeño, sustituye los puntos clave por los de tus propios animales u objetos y amplía el entrenamiento en Ultralytics Platform sin salir del navegador.

Estructura del dataset#

  • Imágenes totales: 263 (210 para entrenamiento / 53 para validación).
  • Puntos clave: 12 por tigre (sin indicador de visibilidad).
  • Tamaño de la descarga: ~49.8 MB.
  • Estructura de directorios: puntos clave en formato YOLO almacenados en labels/{train,val}, junto a los directorios images/{train,val}.


Watch: Train an Ultralytics YOLO Pose Model on the Tiger-Pose Dataset

YAML del dataset#

Un archivo YAML permite especificar los detalles de configuración de un conjunto de datos. Incluye datos esenciales como rutas de archivos, definiciones de clases y otra información pertinente. En concreto, para el archivo tiger-pose.yaml, puedes consultar el archivo de configuración del conjunto de datos Tiger-Pose de Ultralytics.

ultralytics/cfg/datasets/tiger-pose.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# Tiger Pose dataset by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/tiger-pose
# Example usage: yolo train data=tiger-pose.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── tiger-pose ← downloads here (49.8 MB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: tiger-pose # dataset root dir
train: images/train # train images (relative to 'path') 210 images
val: images/val # val images (relative to 'path') 53 images

# Keypoints
kpt_shape: [12, 2] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11]

# Classes
names:
  0: tiger

# Keypoint names per class
kpt_names:
  0:
    - nose
    - head
    - withers
    - tail_base
    - right_hind_hock
    - right_hind_paw
    - left_hind_paw
    - left_hind_hock
    - right_front_wrist
    - right_front_paw
    - left_front_wrist
    - left_front_paw

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/tiger-pose.zip

Uso#

Para entrenar un modelo YOLO26n-pose con el conjunto de datos Tiger-Pose durante 100 épocas y con un tamaño de imagen de 640, puedes usar los siguientes fragmentos de código. Para consultar la lista completa de argumentos disponibles, visita la página de entrenamiento del modelo.

Ejemplo de entrenamiento
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-pose.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="tiger-pose.yaml", epochs=100, imgsz=640)

Imágenes de ejemplo y anotaciones#

Estos son algunos ejemplos de imágenes del conjunto de datos Tiger-Pose, junto con sus anotaciones correspondientes:

Tiger pose estimation dataset mosaic training batch
  • Imagen con mosaico: Esta imagen muestra un lote de entrenamiento compuesto por imágenes del conjunto de datos combinadas mediante mosaico. El mosaico es una técnica utilizada durante el entrenamiento que combina varias imágenes en una sola para aumentar la variedad de objetos y escenas de cada lote de entrenamiento. Esto ayuda a mejorar la capacidad del modelo para generalizar a distintos tamaños de objetos, relaciones de aspecto y contextos.

El ejemplo muestra la variedad y complejidad de las imágenes del conjunto de datos Tiger-Pose, así como las ventajas de usar el mosaico durante el proceso de entrenamiento.

Ejemplo de inferencia#

Después del entrenamiento, carga tu mejor checkpoint y ejecuta la inferencia en imágenes o vídeos nuevos; consulta la página de predicción para ver la lista completa de argumentos.

Ejemplo de inferencia
from ultralytics import YOLO

# Load a model
model = YOLO("path/to/best.pt")  # load a tiger-pose trained model

# Run inference
results = model.predict(source="https://youtu.be/Gc6K5eKrTNQ", show=True)

Citas y agradecimientos#

Ultralytics publica las anotaciones del conjunto de datos Tiger-Pose bajo la Licencia AGPL-3.0. El vídeo de origen sigue estando sujeto a sus condiciones originales, que debes revisar antes de usar o redistribuir los fotogramas extraídos.

Preguntas frecuentes#

  • El conjunto de datos Tiger-Pose de Ultralytics está diseñado para tareas de estimación de poses y consta de 263 imágenes obtenidas de un vídeo de YouTube. El conjunto de datos se divide en 210 imágenes de entrenamiento y 53 imágenes de validación, por lo que resulta adecuado para probar, entrenar y perfeccionar algoritmos de estimación de poses.

  • Carga yolo26n-pose.pt y llama a model.train(data="tiger-pose.yaml", epochs=100, imgsz=640); consulta el ejemplo de entrenamiento anterior para ver los fragmentos completos de Python y CLI, y la página de entrenamiento para consultar la lista completa de argumentos.

  • El archivo tiger-pose.yaml define la ruta del conjunto de datos, los directorios de imágenes de entrenamiento y validación, una única clase (tiger) y kpt_shape: [12, 2]: 12 puntos clave por instancia sin indicador de visibilidad. Consulta el archivo de configuración del conjunto de datos Tiger-Pose de Ultralytics para ver la configuración exacta.

  • Carga tu checkpoint entrenado (por ejemplo, path/to/best.pt) y llama a model.predict(source=..., show=True); consulta el ejemplo de inferencia anterior para ver los fragmentos completos de Python y CLI, y la página de predicción para consultar la lista completa de argumentos.

  • Con 263 imágenes en total (210 para entrenamiento / 53 para validación), 1 clase, 12 puntos clave por instancia y una descarga de ~49.8 MB, Tiger-Pose es lo bastante pequeño como para gestionarlo rápidamente, pero también lo bastante diverso como para comprobar la coherencia de un pipeline de entrenamiento de poses e identificar errores antes de trabajar con conjuntos de datos más grandes.

Comentarios