Dataset Dog-Pose#
Introducción#
El dataset Dog-Pose de Ultralytics es un dataset extenso y de alta calidad, seleccionado específicamente para la estimación de puntos clave en perros, con 6.773 imágenes de entrenamiento y 1.703 de validación.
Watch: How to Train an Ultralytics YOLO Model on the Stanford Dog Pose Estimation Dataset | Step-by-Step Tutorial
Cada imagen anotada incluye 24 puntos clave con 3 dimensiones por punto clave (x, y, visibilidad), lo que lo convierte en un recurso valioso para la investigación y el desarrollo avanzados en visión artificial.
Para una raza concreta o incluso para un animal diferente, Ultralytics Platform se encarga de cargar, etiquetar y entrenar un modelo de puntos clave personalizado con tus propios datos, sin que tengas que gestionar la infraestructura.
Estructura del dataset#
-
Imágenes totales: 8.476 (6.773 de entrenamiento / 1.703 de validación), con archivos de etiquetas correspondientes en formato YOLO.
-
Puntos clave: 24 por perro, con tripletas de
(x, y, visibility). -
Tamaño de descarga: ~337 MB.
-
Estructura:
datasets/dog-pose/ ├── images/{train,val} └── labels/{train,val}
YAML del dataset#
Se utiliza un archivo YAML para definir la configuración del dataset. Incluye rutas, detalles de los puntos clave y otra información relevante. En el caso del dataset Dog-Pose, el archivo dog-pose.yaml está disponible en https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/dog-pose.yaml.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Dogs dataset http://vision.stanford.edu/aditya86/ImageNetDogs/ by Stanford
# Documentation: https://docs.ultralytics.com/datasets/pose/dog-pose
# Example usage: yolo train data=dog-pose.yaml
# parent
# ├── ultralytics
# └── datasets
# └── dog-pose ← downloads here (337 MB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: dog-pose # dataset root dir
train: images/train # train images (relative to 'path') 6773 images
val: images/val # val images (relative to 'path') 1703 images
# Keypoints
kpt_shape: [24, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
# Classes
names:
0: dog
# Keypoint names per class
kpt_names:
0:
- front_left_paw
- front_left_knee
- front_left_elbow
- rear_left_paw
- rear_left_knee
- rear_left_elbow
- front_right_paw
- front_right_knee
- front_right_elbow
- rear_right_paw
- rear_right_knee
- rear_right_elbow
- tail_start
- tail_end
- left_ear_base
- right_ear_base
- nose
- chin
- left_ear_tip
- right_ear_tip
- left_eye
- right_eye
- withers
- throat
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/dog-pose.zipUso#
Para entrenar un modelo YOLO26n-pose con el dataset Dog-Pose durante 100 épocas y con un tamaño de imagen de 640, puedes utilizar los siguientes fragmentos de código. Para consultar una lista completa de los argumentos disponibles, visita la página de Entrenamiento del modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="dog-pose.yaml", epochs=100, imgsz=640)Imágenes de ejemplo y anotaciones#
Estos son algunos ejemplos de imágenes del dataset Dog-Pose, junto con sus anotaciones correspondientes:
- Imagen con mosaico: Esta imagen muestra un lote de entrenamiento compuesto por imágenes del conjunto de datos combinadas mediante mosaico. El mosaico es una técnica utilizada durante el entrenamiento que combina varias imágenes en una sola para aumentar la variedad de objetos y escenas de cada lote de entrenamiento. Esto ayuda a mejorar la capacidad del modelo para generalizar a distintos tamaños de objetos, relaciones de aspecto y contextos.
El ejemplo muestra la variedad y complejidad de las imágenes del dataset Dog-Pose, así como las ventajas de utilizar mosaicos durante el proceso de entrenamiento.
Citas y agradecimientos#
Si utilizas el dataset Dog-Pose en tu trabajo de investigación o desarrollo, cita el siguiente artículo:
@inproceedings{khosla2011fgvc,
title={Novel dataset for Fine-Grained Image Categorization},
author={Aditya Khosla and Nityananda Jayadevaprakash and Bangpeng Yao and Li Fei-Fei},
booktitle={First Workshop on Fine-Grained Visual Categorization (FGVC), IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2011}
}
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Jia Deng and Wei Dong and Richard Socher and Li-Jia Li and Kai Li and Li Fei-Fei},
booktitle={IEEE Computer Vision and Pattern Recognition (CVPR)},
year={2009}
}Nos gustaría reconocer al equipo de Stanford por crear y mantener este valioso recurso para la comunidad de visión artificial. Para obtener más información sobre el dataset Dog-Pose y sus creadores, visita el sitio web del Stanford Dogs Dataset.
Preguntas frecuentes#
El dataset Dog-Pose contiene 6.773 imágenes de entrenamiento y 1.703 de validación, anotadas con 24 puntos clave para la estimación de la pose de perros. Está diseñado para entrenar y validar modelos con Ultralytics YOLO26, y permite aplicaciones como el análisis del comportamiento animal, la supervisión de mascotas y los estudios veterinarios. Sus completas anotaciones lo convierten en un dataset ideal para desarrollar modelos precisos de estimación de pose para perros.
Carga
yolo26n-pose.pty llama amodel.train(data="dog-pose.yaml", epochs=100, imgsz=640); consulta el Ejemplo de entrenamiento anterior para ver los fragmentos completos de Python y CLI, y la página de Entrenamiento del modelo para consultar una lista completa de los argumentos.Con 8.476 imágenes totales (6.773 de entrenamiento / 1.703 de validación) que cubren una amplia variedad de razas y poses de perros, y 24 puntos clave en 3 dimensiones (x, y, visibilidad) por anotación, el dataset Dog-Pose proporciona a los modelos la cobertura de escenarios del mundo real necesaria para aplicaciones como la supervisión de mascotas y el análisis del comportamiento. Para obtener más información sobre sus características y uso, consulta la sección Introducción a los datasets.
El mosaico combina varias imágenes de Dog-Pose en una sola imagen de entrenamiento, lo que aumenta la variedad de poses, tamaños y fondos de perros que el modelo ve en cada paso. Esto mejora la generalización a nuevos contextos y escalas y reduce el sobreajuste. Para ver ejemplos de imágenes, consulta la sección Imágenes y anotaciones de ejemplo.
El archivo YAML del dataset Dog-Pose se encuentra en https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/dog-pose.yaml. Este archivo define la configuración del dataset, incluidas las rutas, las clases, los detalles de los puntos clave y otra información relevante. El YAML especifica 24 puntos clave con 3 dimensiones por punto clave, por lo que es adecuado para tareas detalladas de estimación de pose.
Para utilizar este archivo con los scripts de entrenamiento de YOLO26, solo tienes que referenciarlo en tu comando de entrenamiento, como se muestra en la sección Uso. El dataset se descargará automáticamente la primera vez que lo utilices, lo que simplifica la configuración.
Para obtener más información sobre los modelos de puntos clave, consulta la documentación de la tarea Estimación de pose.



