YOLO Vision 2026:

Tập dữ liệu COCO8-Pose#

Giới thiệu#

Ultralytics COCO8-Pose là một tập dữ liệu ước lượng pose nhỏ nhưng linh hoạt, bao gồm 8 hình ảnh đầu tiên của tập COCO train 2017 (4 cho huấn luyện, 4 cho kiểm định), sử dụng sơ đồ 17 keypoint cho một class "person" duy nhất. Tập dữ liệu này lý tưởng cho việc kiểm thử và gỡ lỗi các model pose estimation, hoặc để thử nghiệm các phương pháp phát hiện keypoint mới. Với 8 hình ảnh, nó đủ nhỏ để dễ dàng quản lý, nhưng vẫn đủ đa dạng để kiểm tra lỗi trong các pipeline huấn luyện và đóng vai trò như một bước kiểm tra sanity trước khi huấn luyện trên tập dữ liệu COCO-Pose đầy đủ.

Cấu trúc tập dữ liệu#

  • Tổng số hình ảnh: 8 (4 train / 4 val).
  • Các lớp: 1 (person) với 17 loại điểm chính (keypoint) cho mỗi chú thích (annotation).
  • Dung lượng tải xuống: ~1 MB.
  • Bố cục thư mục được khuyến nghị: datasets/coco8-pose/images/{train,val}datasets/coco8-pose/labels/{train,val} với các keypoint định dạng YOLO được lưu trữ dưới dạng các file .txt.

Khám phá COCO8-Pose trên Ultralytics Platform để duyệt qua mọi hình ảnh cùng với các bộ xương keypoint của nó, xem phân phối keypoint và class trong tab Charts, đồng thời nhân bản nó để huấn luyện model của riêng bạn trên đám mây.

YAML tập dữ liệu#

Một file YAML được sử dụng để định nghĩa cấu hình tập dữ liệu. Nó chứa thông tin về đường dẫn, class và các thông tin liên quan khác của tập dữ liệu. Trong trường hợp của tập dữ liệu COCO8-Pose, file coco8-pose.yaml được duy trì tại https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco8-pose.yaml.

ultralytics/cfg/datasets/coco8-pose.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# COCO8-pose dataset (first 8 images from COCO train2017) by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/pose/coco8-pose
# Example usage: yolo train data=coco8-pose.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── coco8-pose ← downloads here (1 MB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco8-pose # dataset root dir
train: images/train # train images (relative to 'path') 4 images
val: images/val # val images (relative to 'path') 4 images
test: # test images (optional)

# Keypoints
kpt_shape: [17, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 2, 1, 4, 3, 6, 5, 8, 7, 10, 9, 12, 11, 14, 13, 16, 15]

# Classes
names:
  0: person

# Keypoint names per class
kpt_names:
  0:
    - nose
    - left_eye
    - right_eye
    - left_ear
    - right_ear
    - left_shoulder
    - right_shoulder
    - left_elbow
    - right_elbow
    - left_wrist
    - right_wrist
    - left_hip
    - right_hip
    - left_knee
    - right_knee
    - left_ankle
    - right_ankle

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/coco8-pose.zip

Cách sử dụng#

Để huấn luyện model YOLO26n-pose trên tập dữ liệu COCO8-Pose trong 100 epochs với kích thước ảnh là 640, bạn có thể sử dụng các đoạn mã sau. Để có danh sách toàn diện các tham số khả dụng, hãy tham khảo trang Training của model.

Ví dụ về Training
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-pose.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="coco8-pose.yaml", epochs=100, imgsz=640)

Hình ảnh mẫu và chú thích#

Dưới đây là một số ví dụ về các hình ảnh từ tập dữ liệu COCO8-Pose, cùng với các chú thích tương ứng của chúng:

COCO8-pose keypoint estimation dataset mosaic
  • Hình ảnh Mosaiced: Hình ảnh này minh họa một batch huấn luyện bao gồm các hình ảnh từ tập dữ liệu đã được áp dụng kỹ thuật Mosaic. Mosaic là một kỹ thuật được sử dụng trong quá trình huấn luyện nhằm kết hợp nhiều hình ảnh thành một hình ảnh duy nhất để tăng sự đa dạng của các đối tượng và bối cảnh trong mỗi batch huấn luyện. Điều này giúp cải thiện khả năng tổng quát hóa của model đối với các kích thước đối tượng, tỷ lệ khung hình và bối cảnh khác nhau.

Trích dẫn và Ghi nhận#

Nếu bạn sử dụng bộ dữ liệu COCO trong công việc nghiên cứu hoặc phát triển của mình, vui lòng trích dẫn bài báo sau:

Trích dẫn
@misc{lin2015microsoft,
      title={Microsoft COCO: Common Objects in Context},
      author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
      year={2015},
      eprint={1405.0312},
      archivePrefix={arXiv},
      primaryClass={cs.CV}
}

Chúng tôi xin gửi lời cảm ơn đến COCO Consortium vì đã tạo và duy trì nguồn tài nguyên có giá trị này cho cộng đồng computer vision. Để biết thêm thông tin về tập dữ liệu COCO và những người tạo ra nó, hãy truy cập trang web tập dữ liệu COCO.

Câu hỏi thường gặp#

  • Tập dữ liệu COCO8-Pose là một tập dữ liệu ước lượng pose nhỏ, linh hoạt, bao gồm 8 hình ảnh đầu tiên từ tập COCO train 2017, với 4 hình ảnh để huấn luyện và 4 để kiểm định. Nó được thiết kế để kiểm thử và gỡ lỗi các model ước lượng pose cũng như thử nghiệm các phương pháp phát hiện keypoint mới. Tập dữ liệu này lý tưởng cho các thử nghiệm nhanh với Ultralytics YOLO26. Để biết thêm chi tiết về cấu hình tập dữ liệu, hãy xem dataset YAML file.

  • Tải yolo26n-pose.pt và gọi model.train(data="coco8-pose.yaml", epochs=100, imgsz=640) — hãy xem phần Train Example ở trên để có các đoạn mã Python và CLI đầy đủ, và trang Training của model để có danh sách toàn diện các tham số.

  • Với tổng cộng 8 hình ảnh (4 train / 4 val), 1 class, sơ đồ 17 keypoint và kích thước tải xuống ~1 MB, COCO8-Pose đủ nhỏ để quản lý trong vài giây nhưng lại đủ đa dạng để kiểm tra sanity cho một pipeline huấn luyện pose nhằm tìm lỗi trước khi mở rộng quy mô lên toàn bộ tập dữ liệu COCO-Pose. Để biết thêm về các tính năng và cách sử dụng của nó, hãy xem phần Dataset Introduction.

  • Mosaicing kết hợp nhiều hình ảnh thành một, làm tăng sự đa dạng của các đối tượng và bối cảnh trong mỗi batch huấn luyện, giúp model tổng quát hóa tốt hơn trên các kích thước đối tượng, tỷ lệ khung hình và bối cảnh khác nhau. Hãy xem phần Sample Images and Annotations để biết ví dụ.

  • File YAML của tập dữ liệu COCO8-Pose có thể được tìm thấy tại https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco8-pose.yaml. File này định nghĩa cấu hình tập dữ liệu, bao gồm các đường dẫn, class và các thông tin liên quan khác. Sử dụng file này với các tập lệnh huấn luyện YOLO26 như đã đề cập trong phần Train Example.

    Để biết thêm thông tin về các model keypoint, hãy xem tài liệu tác vụ Pose Estimation.

Bình luận