Tập dữ liệu Dog-Pose#
Giới thiệu#
Dataset Dog-Pose của Ultralytics là một tập dữ liệu chất lượng cao và phong phú được tuyển chọn đặc biệt cho bài toán ước lượng điểm đặc trưng của chó, cung cấp 6.773 ảnh huấn luyện và 1.703 ảnh kiểm định.
Watch: How to Train an Ultralytics YOLO Model on the Stanford Dog Pose Estimation Dataset | Step-by-Step Tutorial
Mỗi ảnh được gán nhãn bao gồm 24 điểm khóa với 3 chiều cho mỗi điểm khóa (x, y, độ hiển thị), biến nó thành một nguồn tài nguyên giá trị cho nghiên cứu và phát triển nâng cao trong thị giác máy tính.
Đối với một giống chó cụ thể hoặc một loài động vật khác, Ultralytics Platform hỗ trợ tải lên, gán nhãn và huấn luyện một model keypoint tùy chỉnh trên dữ liệu của riêng bạn mà không cần quản lý hạ tầng.
Cấu trúc tập dữ liệu#
-
Tổng số ảnh: 8.476 (6.773 huấn luyện / 1.703 kiểm thử) cùng các tệp nhãn định dạng YOLO tương ứng.
-
Keypoints: 24 điểm trên mỗi con chó với các bộ ba
(x, y, visibility). -
Dung lượng tải xuống: ~337 MB.
-
Bố cục:
datasets/dog-pose/ ├── images/{train,val} └── labels/{train,val}
YAML tập dữ liệu#
Một tệp YAML được sử dụng để định nghĩa cấu hình dataset. Nó bao gồm các đường dẫn, thông tin chi tiết về keypoint và các thông tin liên quan khác. Đối với dataset Dog-Pose, tệp dog-pose.yaml có sẵn tại https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/dog-pose.yaml.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Dogs dataset http://vision.stanford.edu/aditya86/ImageNetDogs/ by Stanford
# Documentation: https://docs.ultralytics.com/datasets/pose/dog-pose
# Example usage: yolo train data=dog-pose.yaml
# parent
# ├── ultralytics
# └── datasets
# └── dog-pose ← downloads here (337 MB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: dog-pose # dataset root dir
train: images/train # train images (relative to 'path') 6773 images
val: images/val # val images (relative to 'path') 1703 images
# Keypoints
kpt_shape: [24, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
# Classes
names:
0: dog
# Keypoint names per class
kpt_names:
0:
- front_left_paw
- front_left_knee
- front_left_elbow
- rear_left_paw
- rear_left_knee
- rear_left_elbow
- front_right_paw
- front_right_knee
- front_right_elbow
- rear_right_paw
- rear_right_knee
- rear_right_elbow
- tail_start
- tail_end
- left_ear_base
- right_ear_base
- nose
- chin
- left_ear_tip
- right_ear_tip
- left_eye
- right_eye
- withers
- throat
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/dog-pose.zipCách sử dụng#
Để huấn luyện model YOLO26n-pose trên dataset Dog-Pose trong 100 epochs với kích thước ảnh là 640, bạn có thể sử dụng các đoạn code sau. Để có danh sách đầy đủ các tham số khả dụng, hãy tham khảo trang Training của model.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="dog-pose.yaml", epochs=100, imgsz=640)Hình ảnh mẫu và chú thích#
Dưới đây là một số ví dụ về ảnh từ tập dữ liệu Dog-Pose, cùng với các chú thích tương ứng của chúng:
- Hình ảnh Mosaiced: Hình ảnh này minh họa một batch huấn luyện bao gồm các hình ảnh từ tập dữ liệu đã được áp dụng kỹ thuật Mosaic. Mosaic là một kỹ thuật được sử dụng trong quá trình huấn luyện nhằm kết hợp nhiều hình ảnh thành một hình ảnh duy nhất để tăng sự đa dạng của các đối tượng và bối cảnh trong mỗi batch huấn luyện. Điều này giúp cải thiện khả năng tổng quát hóa của model đối với các kích thước đối tượng, tỷ lệ khung hình và bối cảnh khác nhau.
Ví dụ này minh họa sự đa dạng và phức tạp của các hình ảnh trong tập dữ liệu Dog-Pose và lợi ích của việc sử dụng kỹ thuật mosaicing trong quá trình huấn luyện.
Trích dẫn và Ghi nhận#
Nếu bạn sử dụng tập dữ liệu Dog-Pose trong nghiên cứu hoặc công việc phát triển của mình, vui lòng trích dẫn bài báo sau:
@inproceedings{khosla2011fgvc,
title={Novel dataset for Fine-Grained Image Categorization},
author={Aditya Khosla and Nityananda Jayadevaprakash and Bangpeng Yao and Li Fei-Fei},
booktitle={First Workshop on Fine-Grained Visual Categorization (FGVC), IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2011}
}
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Jia Deng and Wei Dong and Richard Socher and Li-Jia Li and Kai Li and Li Fei-Fei},
booktitle={IEEE Computer Vision and Pattern Recognition (CVPR)},
year={2009}
}Chúng tôi xin gửi lời cảm ơn đến nhóm nghiên cứu Stanford vì đã tạo ra và duy trì tài nguyên giá trị này cho cộng đồng computer vision. Để biết thêm thông tin về dataset Dog-Pose và các tác giả, hãy truy cập trang web Stanford Dogs Dataset.
Câu hỏi thường gặp#
Dataset Dog-Pose bao gồm 6.773 ảnh huấn luyện và 1.703 ảnh kiểm định được gán nhãn với 24 keypoint dành cho bài toán ước lượng tư thế chó. Dataset này được thiết kế để huấn luyện và kiểm định các model với Ultralytics YOLO26, hỗ trợ các ứng dụng như phân tích hành vi động vật, giám sát thú cưng và nghiên cứu thú y. Các nhãn toàn diện của dataset làm cho nó trở nên lý tưởng để phát triển các model ước lượng tư thế chính xác cho loài chó.
Tải
yolo26n-pose.ptvà gọimodel.train(data="dog-pose.yaml", epochs=100, imgsz=640)— hãy xem phần Train Example ở trên để có các đoạn mã Python và CLI đầy đủ, và trang Training của model để có danh sách toàn diện các tham số.Với tổng cộng 8.476 ảnh (6.773 train / 1.703 val) bao gồm nhiều giống chó và tư thế khác nhau, cùng với 24 keypoint ở 3 chiều (x, y, độ hiển thị) trên mỗi nhãn, dataset Dog-Pose cung cấp cho các model khả năng bao quát tình huống thực tế cần thiết cho các ứng dụng như pet monitoring và phân tích hành vi. Để tìm hiểu thêm về các tính năng và cách sử dụng, hãy xem phần Dataset Introduction.
Mosaicing kết hợp nhiều ảnh Dog-Pose thành một ảnh huấn luyện duy nhất, làm tăng sự đa dạng về tư thế, kích thước và nền của chó mà model nhìn thấy trong mỗi bước, từ đó cải thiện khả năng tổng quát hóa sang các bối cảnh và tỷ lệ mới đồng thời giảm thiểu tình trạng overfitting. Để xem các ảnh mẫu, hãy tham khảo phần Sample Images and Annotations.
Tệp YAML của dataset Dog-Pose có thể được tìm thấy tại https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/dog-pose.yaml. Tệp này xác định cấu hình của dataset, bao gồm các đường dẫn, các lớp, thông tin chi tiết về keypoint và các thông tin liên quan khác. Tệp YAML chỉ định 24 keypoint với 3 chiều cho mỗi keypoint, làm cho nó phù hợp với các tác vụ ước lượng tư thế chi tiết.
Để sử dụng tệp này với các script huấn luyện YOLO26, chỉ cần tham chiếu đến nó trong lệnh huấn luyện của bạn như được hiển thị trong phần Usage. Dataset sẽ tự động được tải xuống khi sử dụng lần đầu, giúp quá trình thiết lập trở nên đơn giản.
Để biết thêm thông tin về các model keypoint, hãy xem tài liệu tác vụ Pose Estimation.



