مجموعة بيانات COCO-Pose#
تكيّف مجموعة بيانات COCO-Pose مجموعة COCO (الأجسام الشائعة في السياق) لتناسب تقدير الوضعية: إذ تضم 58,945 صورة من COCO Keypoints 2017، مع تعليقات توضيحية لـ156,165 شخصًا باستخدام مخطط يتكون من 17 نقطة مفتاحية. وهي المجموعة القياسية لتدريب نماذج النقاط المفتاحية وقياس أدائها، مثل Ultralytics YOLO26، بينما تحاكي المجموعة الفرعية COCO8-Pose المكونة من 8 صور تنسيقها لإجراء فحوصات سلامة سريعة.

النماذج المدرَّبة مسبقًا لـCOCO-Pose#
| النموذج | الحجم (بكسل) | mAPالوضعية 50-95(e2e) | mAPالوضعية 50(e2e) | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n-pose | 640 | 57.2 | 83.3 | 40.3 ± 0.5 | 1.8 ± 0.0 | 2.9 | 7.6 |
| YOLO26s-pose | 640 | 63.0 | 86.6 | 85.3 ± 0.9 | 2.7 ± 0.0 | 10.4 | 24.1 |
| YOLO26m-pose | 640 | 68.8 | 89.6 | 218.0 ± 1.5 | 5.0 ± 0.1 | 21.5 | 73.3 |
| YOLO26l-pose | 640 | 70.4 | 90.5 | 275.4 ± 2.4 | 6.5 ± 0.1 | 25.9 | 91.7 |
| YOLO26x-pose | 640 | 71.6 | 91.6 | 565.4 ± 3.0 | 12.2 ± 0.2 | 57.6 | 202.3 |
الميزات الرئيسية#
- تستند COCO-Pose إلى تحدي COCO Keypoints 2017، الذي يضع تسميات توضيحية لـ1,710,498 نقطة مفتاحية فردية عبر 156,165 شخصًا مشروحًا.
- يستخدم كل تعليق توضيحي لشخص 17 نوعًا من النقاط المفتاحية — الأنف والعينان والأذنان والكتفان والمرفقان والمعصمان والوركان والركبتان والكاحلان — وتُخزَّن على شكل ثلاثيات
(x, y, visibility). - وكما هو الحال في COCO، توفر المجموعة مقاييس تقييم موحّدة، بما في ذلك تشابه النقاط المفتاحية للأجسام (OKS) لمهام تقدير الوضعية، مما يجعلها مناسبة لمقارنة أداء النماذج.
- حجم التنزيل: ~20.2 GB عند الاستخدام لأول مرة (
train2017.zip+val2017.zip+ التسميات). ولا يتم جلبtest2017.zipبحجم 7 GB تلقائيًا، لأن تلك الصور تحجب الحقيقة الأساسية ولا تكون مطلوبة إلا لإرسال test-dev2017.
بنية مجموعة البيانات#
بالنسبة إلى التدريب والتحقق، تتضمن COCO-Pose صور COCO 2017 التي تحتوي فقط على أشخاص مشروحة نقاطهم المفتاحية، ولذلك فإن أجزائها الموسومة أصغر من أجزاء COCO الكاملة. ويعرّف ملف YAML ثلاث مجموعات فرعية:
- Train2017: تحتوي هذه المجموعة الفرعية على 56,599 صورة من مجموعة بيانات COCO، مع تعليقات توضيحية مخصصة لتدريب نماذج تقدير الوضعية.
- Val2017: تحتوي هذه المجموعة الفرعية على 2,346 صورة تُستخدم لأغراض التحقق أثناء تدريب النموذج.
- Test-dev2017: مجموعة فرعية تضم 20,288 صورة من مجموعة test2017 الكاملة البالغ عددها 40,670 صورة، مع حجب الحقيقة الأساسية. ويربط YAML مجموعة البيانات هذا الجزء بخادم تقييم النقاط المفتاحية COCO test-dev.
يظهر أثر التدريب بهذا الحجم بوضوح عند استخدام Ultralytics Platform — إذ يدير موارد الحوسبة، بحيث يمكنك تشغيل عمليات التدريب ومراقبتها دون توفير وحدات GPU الخاصة بك.
التطبيقات#
تُستخدم مجموعة بيانات COCO-Pose تحديدًا لتدريب نماذج التعلم العميق وتقييمها في اكتشاف النقاط المفتاحية وتقدير الوضعية. ويجعل العدد الكبير من الصور المشروحة ومقاييس التقييم الموحّدة منها موردًا أساسيًا لباحثي وممارسي الرؤية الحاسوبية العاملين على وضعية الإنسان.
YAML مجموعة البيانات#
يُستخدم ملف YAML لتعريف إعدادات مجموعة البيانات. ويحتوي على معلومات حول مسارات مجموعة البيانات وفئاتها وغيرها من المعلومات ذات الصلة. وفي حالة مجموعة بيانات COCO-Pose، يُحتفظ بالملف coco-pose.yaml في https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco-pose.yaml.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# COCO 2017 Keypoints dataset https://cocodataset.org by Microsoft
# Documentation: https://docs.ultralytics.com/datasets/pose/coco
# Example usage: yolo train data=coco-pose.yaml
# parent
# ├── ultralytics
# └── datasets
# └── coco-pose ← downloads here (20.2 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco-pose # dataset root dir
train: train2017.txt # train images (relative to 'path') 56599 images
val: val2017.txt # val images (relative to 'path') 2346 images
test: test-dev2017.txt # 20288 of 40670 images, submit to https://codalab.lisn.upsaclay.fr/competitions/7403
# Keypoints
kpt_shape: [17, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 2, 1, 4, 3, 6, 5, 8, 7, 10, 9, 12, 11, 14, 13, 16, 15]
# Classes
names:
0: person
# Keypoint names per class
kpt_names:
0:
- nose
- left_eye
- right_eye
- left_ear
- right_ear
- left_shoulder
- right_shoulder
- left_elbow
- right_elbow
- left_wrist
- right_wrist
- left_hip
- right_hip
- left_knee
- right_knee
- left_ankle
- right_ankle
# Download script/URL (optional)
download: |
from pathlib import Path
from ultralytics.utils import ASSETS_URL
from ultralytics.utils.downloads import download
# Download labels
dir = Path(yaml["path"]) # dataset root dir
urls = [f"{ASSETS_URL}/coco2017labels-pose.zip"]
download(urls, dir=dir.parent)
# Download data (test2017.zip excluded: ground truth is withheld, only used for the CodaLab test-dev split)
urls = [
"http://images.cocodataset.org/zips/train2017.zip", # 19G, 118k images
"http://images.cocodataset.org/zips/val2017.zip", # 1G, 5k images
]
download(urls, dir=dir / "images", threads=3)الاستخدام#
لتدريب نموذج YOLO26n-pose على مجموعة بيانات COCO-Pose لمدة 100 حقبة وبحجم صورة قدره 640، يمكنك استخدام مقتطفات التعليمات البرمجية التالية. للحصول على قائمة شاملة بالوسائط المتاحة، راجع صفحة التدريب الخاصة بالنموذج.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="coco-pose.yaml", epochs=100, imgsz=640)الصور والتعليقات التوضيحية النموذجية#
تحتوي مجموعة بيانات COCO-Pose على مجموعة متنوعة من الصور التي تضم أشخاصًا مشروحة نقاطهم المفتاحية. فيما يلي بعض الأمثلة على الصور من مجموعة البيانات، إلى جانب التعليقات التوضيحية المطابقة لها:

- الصورة الموزاييكية: توضح هذه الصورة دفعة تدريب مكوّنة من صور موزاييكية من مجموعة البيانات. والموزاييك تقنية تُستخدم أثناء التدريب وتجمع صورًا متعددة في صورة واحدة لزيادة تنوع الأجسام والمشاهد ضمن كل دفعة تدريب. ويساعد ذلك على تحسين قدرة النموذج على التعميم على أحجام الأجسام ونِسَب العرض إلى الارتفاع والسياقات المختلفة.
يوضح المثال تنوع وتعقيد الصور في مجموعة بيانات COCO-Pose وفوائد استخدام الفسيفساء أثناء عملية التدريب.
الاقتباسات والشكر والتقدير#
إذا استخدمت مجموعة بيانات COCO-Pose في أعمالك البحثية أو التطويرية، فيُرجى الاستشهاد بالورقة التالية:
@misc{lin2015microsoft,
title={Microsoft COCO: Common Objects in Context},
author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
year={2015},
eprint={1405.0312},
archivePrefix={arXiv},
primaryClass={cs.CV}
}نود أن نتوجه بالشكر إلى اتحاد COCO لإنشاء هذا المورد القيّم لمجتمع الرؤية الحاسوبية وصيانته. لمزيد من المعلومات حول مجموعة بيانات COCO-Pose ومنشئيها، يُرجى زيارة موقع مجموعة بيانات COCO.
الأسئلة الشائعة#
توفر COCO-Pose صور وتعليقات COCO Keypoints 2017 التوضيحية المحوّلة إلى تنسيق نقاط YOLO المفتاحية، باستخدام مخطط من 17 نقطة مفتاحية عبر 58,945 صورة. وجّه أي نموذج وضعية من Ultralytics YOLO إليها باستخدام
data=coco-pose.yaml، وتوثّق صفحة التدريب كل وسيط يمكنك ضبطه انطلاقًا من هناك.حمّل
yolo26n-pose.ptواستدعِmodel.train(data="coco-pose.yaml", epochs=100, imgsz=640)— راجع مثال التدريب أعلاه للاطلاع على مقتطفات Python وCLI الكاملة، وصفحة التدريب للحصول على قائمة شاملة بالوسائط.توفر مجموعة بيانات COCO-Pose عدة مقاييس تقييم موحّدة لمهام تقدير الوضعية، على غرار مجموعة بيانات COCO الأصلية. وتشمل المقاييس الرئيسية تشابه النقاط المفتاحية للأجسام (OKS)، الذي يقيّم دقة النقاط المفتاحية المتوقعة مقارنةً بالتعليقات التوضيحية للحقيقة الأساسية. وتتيح هذه المقاييس إجراء مقارنات شاملة للأداء بين النماذج المختلفة. فعلى سبيل المثال، تمتلك النماذج المدرَّبة مسبقًا لـCOCO-Pose، مثل YOLO26n-pose وYOLO26s-pose وغيرها، مقاييس أداء محددة مدرجة في الوثائق، مثل mAPالوضعية50-95 وmAPالوضعية50.
تأتي COCO-Pose مع جزأين موسومين: 56,599 صورة من train2017 و2,346 صورة من val2017. أما الجزء الثالث، test-dev2017، فيضم 20,288 صورة من أصل 40,670 صورة كاملة في test2017، وتظل الحقيقة الأساسية فيه خاصة؛ ويربط YAML مجموعة البيانات هذا الجزء بخادم تقييم النقاط المفتاحية COCO test-dev. راجع قسم بنية مجموعة البيانات، أو الملف
coco-pose.yamlعلى GitHub لمعرفة مسارات الأجزاء الدقيقة.تستخدم COCO-Pose 17 نوعًا من النقاط المفتاحية البشرية، وترث مقاييس COCO الموحّدة، بما في ذلك تشابه النقاط المفتاحية للأجسام (OKS)، لمقارنة النماذج. ويناسب هذا الجمع تطبيقات وضعية الإنسان، مثل تحليلات الرياضة والرعاية الصحية والتفاعل بين الإنسان والحاسوب. وتُدرج أوزان YOLO26-pose المدرَّبة مسبقًا ضمن النماذج المدرَّبة مسبقًا لـCOCO-Pose.
لمزيد من المعلومات حول نماذج النقاط المفتاحية، راجع مستندات مهمة تقدير الوضعية.



