COCO-Pose 데이터셋#
COCO-Pose 데이터셋은 COCO(문맥 속 객체)를 포즈 추정용으로 변환한 것으로, COCO Keypoints 2017의 이미지 58,945개에 17개 키포인트 스키마를 사용하여 사람 156,165명이 주석 처리되어 있습니다. Ultralytics YOLO26과 같은 키포인트 모델의 학습 및 벤치마킹을 위한 표준 세트이며, 8개 이미지로 구성된 COCO8-Pose 서브셋은 빠른 정상성 검사를 위해 동일한 형식을 사용합니다.

COCO-Pose 사전 학습 모델#
| 모델 | 크기 (픽셀) | mAP포즈 50-95(e2e) | mAP포즈 50(e2e) | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n-pose | 640 | 57.2 | 83.3 | 40.3 ± 0.5 | 1.8 ± 0.0 | 2.9 | 7.6 |
| YOLO26s-pose | 640 | 63.0 | 86.6 | 85.3 ± 0.9 | 2.7 ± 0.0 | 10.4 | 24.1 |
| YOLO26m-pose | 640 | 68.8 | 89.6 | 218.0 ± 1.5 | 5.0 ± 0.1 | 21.5 | 73.3 |
| YOLO26l-pose | 640 | 70.4 | 90.5 | 275.4 ± 2.4 | 6.5 ± 0.1 | 25.9 | 91.7 |
| YOLO26x-pose | 640 | 71.6 | 91.6 | 565.4 ± 3.0 | 12.2 ± 0.2 | 57.6 | 202.3 |
주요 기능#
- COCO-Pose는 COCO Keypoints 2017 챌린지를 기반으로 하며, 주석 처리된 사람 156,165명에 대해 개별 키포인트 1,710,498개를 라벨링합니다.
- 각 사람 주석은 코, 눈, 귀, 어깨, 팔꿈치, 손목, 엉덩이, 무릎, 발목으로 구성된 17가지 키포인트 유형을 사용하며,
(x, y, visibility)트리플릿으로 저장됩니다. - COCO와 마찬가지로 포즈 추정 작업을 위한 Object Keypoint Similarity(OKS)를 비롯한 표준화된 평가 지표를 제공하므로 모델 성능을 비교하는 데 적합합니다.
- 다운로드 크기: 처음 사용할 때 ~20.2 GB(
train2017.zip+val2017.zip+ 라벨)입니다. 7 GB 크기의test2017.zip는 해당 이미지에 ground truth가 제공되지 않으며 test-dev2017 제출에만 필요하므로 자동으로 가져오지 않습니다.
데이터셋 구조#
학습 및 검증을 위해 COCO-Pose에는 키포인트가 주석 처리된 사람이 포함된 COCO 2017 이미지만 포함되므로, 라벨이 지정된 분할은 전체 COCO보다 작습니다. YAML은 세 가지 서브셋을 정의합니다.
- Train2017: 이 서브셋에는 포즈 추정 모델 학습을 위해 주석 처리된 COCO 데이터셋 이미지 56,599개가 포함되어 있습니다.
- Val2017: 이 서브셋에는 모델 학습 중 검증에 사용되는 이미지 2,346개가 포함되어 있습니다.
- Test-dev2017: 전체 40,670개 test2017 세트 중 ground truth가 제공되지 않은 이미지 20,288개로 구성된 서브셋입니다. 데이터셋 YAML은 이 분할을 COCO test-dev 키포인트 평가 서버에 연결합니다.
이 규모의 학습에서 Ultralytics Platform이 가장 큰 도움을 제공합니다. 자체 GPU를 프로비저닝하지 않고도 실행을 시작하고 모니터링할 수 있도록 컴퓨팅 리소스를 관리합니다.
응용 분야#
COCO-Pose 데이터셋은 키포인트 검출 및 포즈 추정을 위한 딥 러닝 모델의 학습과 평가에 사용됩니다. 주석 처리된 이미지가 많고 표준화된 평가 지표를 제공하므로, 사람 포즈를 연구하는 컴퓨터 비전 연구자와 실무자에게 필수적인 리소스입니다.
데이터셋 YAML#
YAML 파일은 데이터셋 구성을 정의하는 데 사용됩니다. 여기에는 데이터셋의 경로, 클래스 및 기타 관련 정보가 포함됩니다. COCO-Pose 데이터셋의 경우 coco-pose.yaml 파일이 https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco-pose.yaml에 유지 관리됩니다.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# COCO 2017 Keypoints dataset https://cocodataset.org by Microsoft
# Documentation: https://docs.ultralytics.com/datasets/pose/coco
# Example usage: yolo train data=coco-pose.yaml
# parent
# ├── ultralytics
# └── datasets
# └── coco-pose ← downloads here (20.2 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco-pose # dataset root dir
train: train2017.txt # train images (relative to 'path') 56599 images
val: val2017.txt # val images (relative to 'path') 2346 images
test: test-dev2017.txt # 20288 of 40670 images, submit to https://codalab.lisn.upsaclay.fr/competitions/7403
# Keypoints
kpt_shape: [17, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 2, 1, 4, 3, 6, 5, 8, 7, 10, 9, 12, 11, 14, 13, 16, 15]
# Classes
names:
0: person
# Keypoint names per class
kpt_names:
0:
- nose
- left_eye
- right_eye
- left_ear
- right_ear
- left_shoulder
- right_shoulder
- left_elbow
- right_elbow
- left_wrist
- right_wrist
- left_hip
- right_hip
- left_knee
- right_knee
- left_ankle
- right_ankle
# Download script/URL (optional)
download: |
from pathlib import Path
from ultralytics.utils import ASSETS_URL
from ultralytics.utils.downloads import download
# Download labels
dir = Path(yaml["path"]) # dataset root dir
urls = [f"{ASSETS_URL}/coco2017labels-pose.zip"]
download(urls, dir=dir.parent)
# Download data (test2017.zip excluded: ground truth is withheld, only used for the CodaLab test-dev split)
urls = [
"http://images.cocodataset.org/zips/train2017.zip", # 19G, 118k images
"http://images.cocodataset.org/zips/val2017.zip", # 1G, 5k images
]
download(urls, dir=dir / "images", threads=3)사용법#
이미지 크기 640으로 COCO-Pose 데이터셋에서 YOLO26n-pose 모델을 100개 에포크 동안 학습하려면 다음 코드 스니펫을 사용할 수 있습니다. 사용 가능한 인수의 전체 목록은 모델 학습 페이지를 참조하십시오.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="coco-pose.yaml", epochs=100, imgsz=640)샘플 이미지 및 주석#
COCO-Pose 데이터셋에는 키포인트가 주석 처리된 사람 형상의 다양한 이미지가 포함되어 있습니다. 다음은 해당 주석과 함께 데이터셋 이미지의 몇 가지 예시입니다.

- 모자이크 처리된 이미지: 이 이미지는 모자이크 처리된 데이터셋 이미지로 구성된 학습 배치를 보여줍니다. 모자이크 처리는 학습 중 여러 이미지를 하나의 이미지로 결합하여 각 학습 배치에 포함되는 객체와 장면의 다양성을 높이는 기법입니다. 이를 통해 다양한 객체 크기, 종횡비 및 컨텍스트에 대한 모델의 일반화 성능을 향상할 수 있습니다.
이 예시는 COCO-Pose 데이터셋 이미지의 다양성과 복잡성, 그리고 학습 과정에서 모자이킹을 사용하는 이점을 보여줍니다.
인용 및 감사의 글#
연구 또는 개발 작업에서 COCO-Pose 데이터셋을 사용하는 경우 다음 논문을 인용하십시오.
@misc{lin2015microsoft,
title={Microsoft COCO: Common Objects in Context},
author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
year={2015},
eprint={1405.0312},
archivePrefix={arXiv},
primaryClass={cs.CV}
}컴퓨터 비전 커뮤니티를 위해 이 귀중한 리소스를 제작하고 유지 관리한 COCO Consortium에 감사드립니다. COCO-Pose 데이터셋과 제작자에 대한 자세한 내용은 COCO 데이터셋 웹사이트를 방문하십시오.
FAQ#
COCO-Pose는 COCO Keypoints 2017 이미지와 주석을 YOLO 키포인트 형식으로 변환하여 제공하며, 58,945개 이미지 전체에 17개 키포인트 스키마를 사용합니다.
data=coco-pose.yaml을 사용하여 모든 Ultralytics YOLO 포즈 모델에서 이를 지정할 수 있으며, 이후 조정할 수 있는 모든 인수는 학습 페이지에 문서화되어 있습니다.COCO-Pose 데이터셋은 원본 COCO 데이터셋과 유사하게 포즈 추정 작업을 위한 여러 표준화된 평가 지표를 제공합니다. 주요 지표로는 예측된 키포인트와 ground truth 주석 간의 정확도를 평가하는 Object Keypoint Similarity(OKS)가 있습니다. 이러한 지표를 사용하면 서로 다른 모델의 성능을 철저하게 비교할 수 있습니다. 예를 들어 YOLO26n-pose, YOLO26s-pose 등의 COCO-Pose 사전 학습 모델에는 mAP포즈50-95 및 mAP포즈50과 같은 특정 성능 지표가 문서에 나열되어 있습니다.
COCO-Pose에는 라벨이 지정된 두 개의 분할이 포함되어 있습니다. train2017 이미지 56,599개와 val2017 이미지 2,346개입니다. 세 번째 분할인 test-dev2017은 전체 40,670개 test2017 이미지 중 20,288개의 ground truth를 비공개로 유지하며, 데이터셋 YAML은 이를 COCO test-dev 키포인트 평가 서버에 연결합니다. 정확한 분할 경로는 데이터셋 구조 섹션 또는 GitHub의
coco-pose.yaml파일을 참조하십시오.COCO-Pose는 17가지 사람 키포인트 유형을 사용하고 Object Keypoint Similarity(OKS)를 비롯한 COCO의 표준화된 지표를 상속하여 모델을 비교합니다. 이러한 조합은 스포츠 분석, 헬스케어, 인간-컴퓨터 상호작용과 같은 사람 포즈 애플리케이션에 적합합니다. 사전 학습된 YOLO26-pose 가중치는 COCO-Pose 사전 학습 모델에 나열되어 있습니다.
키포인트 모델에 대한 자세한 내용은 포즈 추정 작업 문서를 참조하십시오.



