Bộ dữ liệu Tiger-Pose#
Giới thiệu#
Ultralytics giới thiệu bộ dữ liệu Tiger-Pose, một tập hợp đa năng được thiết kế cho các tác vụ ước tính pose. Bộ dữ liệu này gồm 263 hình ảnh được lấy từ một video YouTube, trong đó 210 hình ảnh được phân bổ cho việc huấn luyện và 53 hình ảnh cho việc validation. Đây là một tài nguyên xuất sắc để kiểm thử và khắc phục sự cố cho các thuật toán ước tính pose.
Mặc dù có tập huấn luyện dễ quản lý chỉ gồm 210 hình ảnh, bộ dữ liệu Tiger-Pose vẫn mang lại tính đa dạng, phù hợp để đánh giá các pipeline huấn luyện, xác định các lỗi tiềm ẩn và làm bước khởi đầu hữu ích trước khi làm việc với các bộ dữ liệu lớn hơn cho ước tính pose.
Sau khi pipeline của bạn huấn luyện ổn định trên tập dữ liệu nhỏ này, hãy thay bằng các keypoint của động vật hoặc đối tượng riêng và mở rộng quy mô huấn luyện trên Ultralytics Platform mà không cần rời khỏi trình duyệt.
Cấu trúc bộ dữ liệu#
- Tổng số hình ảnh: 263 (210 train / 53 val).
- Keypoint: 12 trên mỗi hổ (không có cờ visibility).
- Kích thước tải xuống: ~49.8 MB.
- Bố cục thư mục: Các keypoint ở định dạng YOLO được lưu trong
labels/{train,val}, cùng với các thư mụcimages/{train,val}.
Watch: Train an Ultralytics YOLO Pose Model on the Tiger-Pose Dataset
YAML của bộ dữ liệu#
Một tệp YAML được dùng để chỉ định các chi tiết cấu hình của bộ dữ liệu. Tệp này bao gồm những dữ liệu quan trọng như đường dẫn tệp, định nghĩa class và các thông tin liên quan khác. Cụ thể, đối với tệp tiger-pose.yaml, bạn có thể xem Tệp cấu hình bộ dữ liệu Tiger-Pose của Ultralytics.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Tiger Pose dataset by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/tiger-pose
# Example usage: yolo train data=tiger-pose.yaml
# parent
# ├── ultralytics
# └── datasets
# └── tiger-pose ← downloads here (49.8 MB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: tiger-pose # dataset root dir
train: images/train # train images (relative to 'path') 210 images
val: images/val # val images (relative to 'path') 53 images
# Keypoints
kpt_shape: [12, 2] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11]
# Classes
names:
0: tiger
# Keypoint names per class
kpt_names:
0:
- nose
- head
- withers
- tail_base
- right_hind_hock
- right_hind_paw
- left_hind_paw
- left_hind_hock
- right_front_wrist
- right_front_paw
- left_front_wrist
- left_front_paw
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/tiger-pose.zipCách sử dụng#
Để huấn luyện model YOLO26n-pose trên bộ dữ liệu Tiger-Pose trong 100 epoch với kích thước hình ảnh là 640, bạn có thể sử dụng các đoạn code sau. Để xem danh sách đầy đủ các argument hiện có, hãy tham khảo trang Huấn luyện model.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="tiger-pose.yaml", epochs=100, imgsz=640)Hình ảnh mẫu và annotation#
Dưới đây là một số ví dụ về hình ảnh từ bộ dữ liệu Tiger-Pose cùng với các annotation tương ứng:
- Hình ảnh dạng mosaic: Hình ảnh này minh họa một batch train được tạo từ các hình ảnh dataset dạng mosaic. Mosaicing là một kỹ thuật được sử dụng trong quá trình train, kết hợp nhiều hình ảnh thành một hình ảnh duy nhất để tăng tính đa dạng của đối tượng và cảnh trong mỗi batch train. Điều này giúp cải thiện khả năng tổng quát hóa của model đối với các kích thước đối tượng, tỷ lệ khung hình và ngữ cảnh khác nhau.
Ví dụ này minh họa sự đa dạng và phức tạp của các hình ảnh trong bộ dữ liệu Tiger-Pose, cũng như lợi ích của việc sử dụng kỹ thuật mosaic trong quá trình huấn luyện.
Ví dụ inference#
Sau khi huấn luyện, hãy tải checkpoint tốt nhất của bạn và chạy inference trên hình ảnh hoặc video mới — xem trang Prediction để biết danh sách đầy đủ các argument.
from ultralytics import YOLO
# Load a model
model = YOLO("path/to/best.pt") # load a tiger-pose trained model
# Run inference
results = model.predict(source="https://youtu.be/Gc6K5eKrTNQ", show=True)Trích dẫn và ghi nhận đóng góp#
Ultralytics phát hành các annotation của bộ dữ liệu Tiger-Pose theo Giấy phép AGPL-3.0. Video nguồn vẫn tuân theo các điều khoản ban đầu, và bạn nên xem xét các điều khoản này trước khi sử dụng hoặc phân phối lại các frame được trích xuất.
FAQ#
Bộ dữ liệu Tiger-Pose của Ultralytics được thiết kế cho các tác vụ ước tính pose, gồm 263 hình ảnh được lấy từ một video YouTube. Bộ dữ liệu được chia thành 210 hình ảnh huấn luyện và 53 hình ảnh validation, rất phù hợp để kiểm thử, huấn luyện và tinh chỉnh các thuật toán ước tính pose.
Tải
yolo26n-pose.ptvà gọimodel.train(data="tiger-pose.yaml", epochs=100, imgsz=640)— xem Ví dụ huấn luyện ở trên để biết đầy đủ các đoạn code Python và CLI, cũng như trang Huấn luyện để xem danh sách đầy đủ các argument.Tệp
tiger-pose.yamlđịnh nghĩa đường dẫn bộ dữ liệu, các thư mục hình ảnh train/val, một class duy nhất (tiger) vàkpt_shape: [12, 2]— 12 keypoint trên mỗi instance, không có cờ visibility. Xem Tệp cấu hình bộ dữ liệu Tiger-Pose của Ultralytics để biết cấu hình chính xác.Tải checkpoint đã huấn luyện của bạn (ví dụ:
path/to/best.pt) và gọimodel.predict(source=..., show=True)— xem Ví dụ inference ở trên để biết đầy đủ các đoạn code Python và CLI, cũng như trang Prediction để xem danh sách đầy đủ các argument.Với tổng cộng 263 hình ảnh (210 train / 53 val), 1 class, 12 keypoint trên mỗi instance và kích thước tải xuống ~49.8 MB, Tiger-Pose đủ nhỏ để nhanh chóng quản lý nhưng vẫn đủ đa dạng để kiểm tra tính hợp lệ của pipeline huấn luyện pose và xác định lỗi trước khi làm việc với các bộ dữ liệu lớn hơn.



