YOLO Vision 2026:

مجموعة بيانات COCO-Pose#

يقوم مجموعة بيانات COCO-Pose بتكييف COCO (الأجسام الشائعة في السياق) لـ تقدير الوضعيات: 58,945 صورة من COCO Keypoints 2017، مع تعليقات توضيحية لـ 156,165 شخصاً باستخدام مخطط مكون من 17 نقطة أساسية. إنه المجموعة القياسية لتدريب وتقييم نماذج النقاط الأساسية مثل Ultralytics YOLO26، وتعكس مجموعة COCO8-Pose المكونة من 8 صور تنسيقها لإجراء فحوصات السلامة السريعة.

تقدير وضعيات COCO مع النقاط الأساسية البشرية

نماذج COCO-Pose المدربة مسبقًا#

النموذجالحجم
(بكسل)
mAPpose
50-95(e2e)
mAPpose
50(e2e)
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
YOLO26n-pose64057.283.340.3 ± 0.51.8 ± 0.02.97.5
YOLO26s-pose64063.086.685.3 ± 0.92.7 ± 0.010.423.9
YOLO26m-pose64068.889.6218.0 ± 1.55.0 ± 0.121.573.1
YOLO26l-pose64070.490.5275.4 ± 2.46.5 ± 0.125.991.3
YOLO26x-pose64071.691.6565.4 ± 3.012.2 ± 0.257.6201.7

الميزات الرئيسية#

  • يستند COCO-Pose إلى تحدي COCO Keypoints 2017، والذي يصنف 1,710,498 نقطة أساسية فردية عبر 156,165 شخصاً معلقاً.
  • يستخدم كل تعليق توضيحي لشخص 17 نوعاً من النقاط الأساسية — الأنف، العيون، الأذنين، الكتفين، المرفقين، المعاصم، الوركين، الركبتين، والكاحلين — مخزنة كـ ثلاثيات (x, y, visibility).
  • مثل COCO، توفر مقاييس تقييم موحدة، بما في ذلك تشابه النقاط الرئيسية للكائنات (OKS) لمهام تقدير الوضعية، مما يجعلها مناسبة لمقارنة أداء النماذج.
  • حجم التنزيل: ~20.2 جيجابايت عند الاستخدام الأول (train2017.zip + val2017.zip + التسميات). لا يتم جلب test2017.zip بحجم 7 جيجابايت تلقائياً، نظراً لأن تلك الصور تحتوي على حقيقة أرضية محجوبة ولا تكون مطلوبة إلا لـ تقديم test-dev2017.

هيكل مجموعة البيانات#

لأغراض التدريب والتحقق من الصحة، تشتمل COCO-Pose فقط على صور COCO 2017 التي تحتوي على أشخاص محددين بنقاط مفصلية، لذا فإن تقسيماتها المصنفة أصغر من مجموعة COCO الكاملة. يحدد ملف YAML الخاص بها ثلاث مجموعات فرعية:

  1. Train2017: تحتوي هذه المجموعة الفرعية على 56,599 صورة من مجموعة بيانات COCO، وموضحة لتدريب نماذج تقدير الوضعية.
  2. Val2017: تحتوي هذه المجموعة الفرعية على 2,346 صورة تُستخدم لأغراض التحقق من الصحة أثناء تدريب النموذج.
  3. Test-dev2017: مجموعة فرعية من 20,288 صورة من إجمالي مجموعة test2017 البالغة 40,670 صورة مع حقيقة أرضية محجوبة. تربط ملفات YAML لمجموعة البيانات هذا التقسيم بـ خادم تقييم النقاط الأساسية لـ COCO test-dev.

التدريب بهذا الحجم هو المكان الذي تكون فيه Ultralytics Platform أكثر فائدة — فهي تدير الحوسبة حتى تتمكن من إطلاق عمليات التشغيل ومراقبتها دون توفير وحدات معالجة الرسومات الخاصة بك.

التطبيقات#

يُستخدم مجموعة بيانات COCO-Pose خصيصاً لتدريب وتقييم نماذج التعلم العميق على اكتشاف النقاط الأساسية وتقدير الوضعيات. العدد الكبير من الصور المعلقة ومقاييس التقييم القياسية لمجموعة البيانات تجعلها مورداً أساسياً لباحثي وممارسي رؤية الحاسوب الذين يعملون على وضعيات البشر.

YAML مجموعة البيانات#

يُستخدم ملف YAML لتحديد تكوين مجموعة البيانات. وهو يحتوي على معلومات حول مسارات مجموعة البيانات، والفئات، ومعلومات أخرى ذات صلة. في حالة مجموعة بيانات COCO-Pose، يتم الاحتفاظ بملف coco-pose.yaml على https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco-pose.yaml.

ultralytics/cfg/datasets/coco-pose.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# COCO 2017 Keypoints dataset https://cocodataset.org by Microsoft
# Documentation: https://docs.ultralytics.com/datasets/pose/coco
# Example usage: yolo train data=coco-pose.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── coco-pose ← downloads here (20.2 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco-pose # dataset root dir
train: train2017.txt # train images (relative to 'path') 56599 images
val: val2017.txt # val images (relative to 'path') 2346 images
test: test-dev2017.txt # 20288 of 40670 images, submit to https://codalab.lisn.upsaclay.fr/competitions/7403

# Keypoints
kpt_shape: [17, 3] # number of keypoints, number of dims (2 for x,y or 3 for x,y,visible)
flip_idx: [0, 2, 1, 4, 3, 6, 5, 8, 7, 10, 9, 12, 11, 14, 13, 16, 15]

# Classes
names:
  0: person

# Keypoint names per class
kpt_names:
  0:
    - nose
    - left_eye
    - right_eye
    - left_ear
    - right_ear
    - left_shoulder
    - right_shoulder
    - left_elbow
    - right_elbow
    - left_wrist
    - right_wrist
    - left_hip
    - right_hip
    - left_knee
    - right_knee
    - left_ankle
    - right_ankle

# Download script/URL (optional)
download: |
  from pathlib import Path

  from ultralytics.utils import ASSETS_URL
  from ultralytics.utils.downloads import download

  # Download labels
  dir = Path(yaml["path"])  # dataset root dir

  urls = [f"{ASSETS_URL}/coco2017labels-pose.zip"]
  download(urls, dir=dir.parent)

  # Download data (test2017.zip excluded: ground truth is withheld, only used for the CodaLab test-dev split)
  urls = [
      "http://images.cocodataset.org/zips/train2017.zip",  # 19G, 118k images
      "http://images.cocodataset.org/zips/val2017.zip",  # 1G, 5k images
  ]
  download(urls, dir=dir / "images", threads=3)

الاستخدام#

لتدريب نموذج YOLO26n-pose على مجموعة بيانات COCO-Pose لمدة 100 حقبة تدريبية بحجم صورة 640، يمكنك استخدام مقاطع الكود التالية. للحصول على قائمة شاملة بالوسائط المتاحة، راجع صفحة التدريب الخاصة بالنموذج.

مثال على التدريب
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-pose.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="coco-pose.yaml", epochs=100, imgsz=640)

صور وشروحات توضيحية عينة#

تحتوي مجموعة بيانات COCO-Pose على مجموعة متنوعة من الصور مع شخصيات بشرية موسومة بنقاط رئيسية. إليك بعض الأمثلة على الصور من مجموعة البيانات، جنبًا إلى جنب مع التعليقات التوضيحية المقابلة لها:

دفعة تدريب الفسيفساء لمجموعة بيانات تقدير وضعيات COCO

  • صورة مجمعة (Mosaiced Image): توضح هذه الصورة دفعة تدريب تتكون من صور مجموعة بيانات مجمعة. الفسيفساء (Mosaicing) هي تقنية تُستخدم أثناء التدريب تدمج صورًا متعددة في صورة واحدة لزيادة تنوع الكائنات والمشاهد داخل كل دفعة تدريب. يساعد هذا في تحسين قدرة النموذج على التعميم على أحجام كائنات ونسب عرض إلى ارتفاع وسياقات مختلفة.

يعرض المثال تنوع وتعقيد الصور في مجموعة بيانات COCO-Pose وفوائد استخدام الموزاييك أثناء عملية التدريب.

الاقتباسات والشكر#

إذا كنت تستخدم مجموعة بيانات COCO-Pose في بحثك أو عملك التطويري، فيرجى الاستشهاد بالورقة التالية:

اقتباس
@misc{lin2015microsoft,
      title={Microsoft COCO: Common Objects in Context},
      author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
      year={2015},
      eprint={1405.0312},
      archivePrefix={arXiv},
      primaryClass={cs.CV}
}

نود أن نشكر اتحاد COCO لإنشاء وصيانة هذا المورد القيم لمجتمع رؤية الحاسوب. لمزيد من المعلومات حول مجموعة بيانات COCO-Pose ومبتكريها، تفضل بزيارة موقع مجموعة بيانات COCO.

الأسئلة الشائعة#

  • يوفر COCO-Pose صور وتعليقات توضيحية لـ COCO Keypoints 2017 محولة إلى تنسيق نقاط أساسية لـ YOLO، باستخدام مخطط من 17 نقطة أساسية عبر 58,945 صورة. قم بتوجيه أي نموذج وضعيات Ultralytics YOLO إليه باستخدام data=coco-pose.yaml، وتوثق صفحة التدريب كل وسيط يمكنك ضبطه منที่ناك.

  • قم بتحميل yolo26n-pose.pt واستدعاء model.train(data="coco-pose.yaml", epochs=100, imgsz=640) — راجع مثال التدريب أعلاه للحصول على مقاطع Python وCLI الكاملة، وصفحة التدريب للحصول على قائمة شاملة بالوسائط.

  • توفّر مجموعة بيانات COCO-Pose العديد من مقاييس التقييم القياسية لمهام تقدير الوضعيات، على غرار مجموعة بيانات COCO الأصلية. تشمل المقاييس الرئيسية تشابه نقاط أساسية للجسم (OKS)، والذي يقيم دقة النقاط الأساسية المتوقعة مقابل التعليقات التوضيحية للحقيقة الأرضية. تتيح هذه المقاييس إجراء مقارنات أداء شاملة بين النماذج المختلفة. على سبيل المثال، النماذج المدربة مسبقاً لـ COCO-Pose مثل YOLO26n-pose وYOLO26s-pose وغيرها لديها مقاييس أداء محددة مدرجة في الوثائق، مثل mAPpose50-95 وmAPpose50.

  • يشحن COCO-Pose تقسيمين مُصنفين: 56,599 صورة train2017 و2,346 صورة val2017. يحتفظ التقسيم الثالث، test-dev2017 (20,288 من إجمالي صور test2017 البالغة 40,670)، بحقيقته الأرضية الخاصة؛ وتربط ملفات YAML لمجموعة البيانات هذا التقسيم بـ خادم تقييم النقاط الأساسية لـ COCO test-dev. راجع قسم هيكل مجموعة البيانات، أو ملف coco-pose.yaml على GitHub لمعرفة مسارات التقسيم الدقيقة.

  • يستخدم COCO-Pose 17 نوعاً من النقاط الأساسية البشرية ويرث مقاييس COCO القياسية، بما في ذلك تشابه نقاط أساسية للجسم (OKS)، لمقارنة النماذج. تناسب هذا المزيج تطبيقات وضعيات البشر مثل تحليل الرياضات، والرعاية الصحية، والتفاعل بين الإنسان والحاسوب. يتم سرد الأوزان المدربة مسبقاً لـ YOLO26-pose ضمن النماذج المدربة مسبقاً لـ COCO-Pose.

    لمزيد من المعلومات حول نماذج النقاط الأساسية، راجع مستندات مهمة تقدير الوضعيات.

التعليقات