Bộ dữ liệu Tiger-Pose#
Giới thiệu#
Ultralytics giới thiệu bộ dữ liệu Tiger-Pose, một tập hợp đa năng được thiết kế cho các tác vụ ước tính tư thế. Bộ dữ liệu này gồm 263 hình ảnh lấy từ một video YouTube, trong đó 210 hình ảnh dùng cho huấn luyện và 53 hình ảnh dùng để xác thực. Đây là tài nguyên hữu ích để kiểm thử và khắc phục sự cố cho các thuật toán ước tính tư thế.
Dù tập huấn luyện chỉ có 210 hình ảnh, bộ dữ liệu Tiger-Pose vẫn đa dạng, phù hợp để đánh giá pipeline huấn luyện, xác định lỗi tiềm ẩn và làm bước sơ bộ hữu ích trước khi làm việc với các bộ dữ liệu lớn hơn cho ước tính tư thế.
Khi pipeline của bạn huấn luyện ổn định trên tập dữ liệu nhỏ này, hãy thay bằng keypoint của động vật hoặc đối tượng riêng rồi mở rộng quy mô huấn luyện trên Ultralytics Platform ngay trong trình duyệt.
Cấu trúc dataset#
- Tổng số hình ảnh: 263 (210 train / 53 val).
- Keypoint: 12 trên mỗi con hổ (không có cờ khả kiến).
- Dung lượng tải xuống: ~49.8 MB.
- Bố cục thư mục: Keypoint định dạng YOLO được lưu trong
labels/{train,val}cùng với các thư mụcimages/{train,val}.
Xem: Huấn luyện model tư thế Ultralytics YOLO trên dataset Tiger-Pose
YAML của dataset#
File YAML dùng để chỉ định thông tin cấu hình của bộ dữ liệu. File này bao gồm dữ liệu quan trọng như đường dẫn file, định nghĩa class và thông tin liên quan khác. Cụ thể, bạn có thể xem file tiger-pose.yaml tại File cấu hình bộ dữ liệu Tiger-Pose của Ultralytics.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# Tiger Pose dataset by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/tiger-pose
# Example usage: yolo train data=tiger-pose.yaml
# parent
# ├── ultralytics
# └── datasets
# └── tiger-pose ← downloads here (49.8 MB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: tiger-pose # dataset root dir
train: images/train # train images (relative to 'path') 210 images
val: images/val # val images (relative to 'path') 53 images
# Keypoints
kpt_shape: [12, 2] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11]
# Classes
names:
0: tiger
# Keypoint names per class
kpt_names:
0:
- nose
- head
- withers
- tail_base
- right_hind_hock
- right_hind_paw
- left_hind_paw
- left_hind_hock
- right_front_wrist
- right_front_paw
- left_front_wrist
- left_front_paw
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/tiger-pose.zipCách sử dụng#
Để huấn luyện model YOLO26n-pose trên bộ dữ liệu Tiger-Pose trong 100 epoch với kích thước ảnh 640, bạn có thể sử dụng các đoạn mã sau. Để xem danh sách đầy đủ các tham số hiện có, hãy tham khảo trang Huấn luyện model.
from ultralytics import YOLO
# Tải model
model = YOLO("yolo26n-pose.pt") # tải model đã huấn luyện trước (được khuyến nghị khi huấn luyện)
# Huấn luyện model
results = model.train(data="tiger-pose.yaml", epochs=100, imgsz=640)Hình ảnh mẫu và annotation#
Sau đây là một số hình ảnh từ bộ dữ liệu Tiger-Pose cùng với các chú thích tương ứng:
- Ảnh ghép Mosaic: Hình ảnh này minh họa một batch huấn luyện được tạo từ các ảnh mosaic của bộ dữ liệu. Mosaic là kỹ thuật được sử dụng trong quá trình huấn luyện, kết hợp nhiều hình ảnh thành một hình ảnh duy nhất để tăng sự đa dạng của đối tượng và bối cảnh trong mỗi batch huấn luyện. Kỹ thuật này giúp cải thiện khả năng tổng quát hóa của model đối với các kích thước đối tượng, tỷ lệ khung hình và ngữ cảnh khác nhau.
Ví dụ này minh họa sự đa dạng và độ phức tạp của hình ảnh trong bộ dữ liệu Tiger-Pose, cũng như lợi ích của việc sử dụng ghép mosaic trong quá trình huấn luyện.
Ví dụ suy luận#
Sau khi huấn luyện, hãy tải checkpoint tốt nhất và chạy suy luận trên hình ảnh hoặc video mới — xem trang Dự đoán để biết danh sách đầy đủ các tham số.
from ultralytics import YOLO
# Tải model
model = YOLO("path/to/best.pt") # tải model đã huấn luyện bằng tiger-pose
# Chạy suy luận
results = model.predict(source="https://youtu.be/Gc6K5eKrTNQ", show=True)Trích dẫn và lời cảm ơn#
Ultralytics phát hành các chú thích của bộ dữ liệu Tiger-Pose theo Giấy phép AGPL-3.0. Video nguồn vẫn chịu sự điều chỉnh của điều khoản ban đầu; cần xem xét các điều khoản này trước khi sử dụng hoặc phân phối lại các khung hình đã trích xuất.
Câu hỏi thường gặp#
Bộ dữ liệu Tiger-Pose của Ultralytics được thiết kế cho các tác vụ ước tính tư thế, gồm 263 hình ảnh lấy từ một video YouTube. Bộ dữ liệu được chia thành 210 hình ảnh huấn luyện và 53 hình ảnh xác thực, phù hợp để kiểm thử, huấn luyện và tinh chỉnh các thuật toán ước tính tư thế.
Tải
yolo26n-pose.ptvà gọimodel.train(data="tiger-pose.yaml", epochs=100, imgsz=640)— xem Ví dụ huấn luyện ở trên để tham khảo đầy đủ các đoạn mã Python và CLI, đồng thời xem trang Huấn luyện để biết danh sách tham số toàn diện.File
tiger-pose.yamlđịnh nghĩa đường dẫn bộ dữ liệu, thư mục ảnh train/val, một class duy nhất (tiger) vàkpt_shape: [12, 2]— 12 keypoint trên mỗi đối tượng, không có cờ khả kiến. Xem File cấu hình bộ dữ liệu Tiger-Pose của Ultralytics để biết cấu hình chính xác.Tải checkpoint đã huấn luyện (ví dụ:
path/to/best.pt) và gọimodel.predict(source=..., show=True)— xem Ví dụ suy luận ở trên để tham khảo đầy đủ các đoạn mã Python và CLI, đồng thời xem trang Dự đoán để biết danh sách tham số toàn diện.Với tổng cộng 263 hình ảnh (210 train / 53 val), 1 class, 12 keypoint trên mỗi đối tượng và dung lượng tải xuống ~49.8 MB, Tiger-Pose đủ nhỏ để xử lý nhanh nhưng cũng đủ đa dạng để kiểm tra nhanh pipeline huấn luyện tư thế và xác định lỗi trước khi làm việc với các bộ dữ liệu lớn hơn.



