Ultralytics YOLO27:
Get Started

نظرة عامة على مجموعات البيانات#

توفر Ultralytics دعمًا لمجموعات بيانات متنوعة لتسهيل مهام الرؤية الحاسوبية، مثل الكشف وتجزئة المثيلات والتجزئة الدلالية وتقدير العمق والتصنيف وتقدير الوضعية ومربعات الإحاطة الموجّهة (OBB). فيما يلي قائمة بمجموعات بيانات Ultralytics الرئيسية، يليها ملخص لكل مهمة من مهام الرؤية الحاسوبية ومجموعات البيانات المرتبطة بها. يعمل وضع التتبع باستخدام نماذج الكشف والتجزئة والوضعية وOBB من دون تدريب خاص بأداة التتبع؛ راجع مجموعات بيانات التتبع.



شاهد: نظرة عامة على مجموعات بيانات Ultralytics

كشف الكائنات#

اكتشاف الأجسام بمربعات الإحاطة تقنية في الرؤية الحاسوبية تتضمن اكتشاف الأجسام في الصورة وتحديد مواقعها برسم مربع إحاطة حول كل جسم.

  • African-wildlife: مجموعة بيانات تضم صورًا للحياة البرية الأفريقية، بما في ذلك الجاموس والفيلة ووحيد القرن والحُمُر الوحشية.
  • Argoverse: مجموعة بيانات تتضمن بيانات تتبع ثلاثية الأبعاد والتنبؤ بالحركة في بيئات حضرية، مع تعليقات توضيحية غنية.
  • Brain-tumor: مجموعة بيانات لاكتشاف أورام الدماغ، تضم صورًا للتصوير بالرنين المغناطيسي أو التصوير المقطعي المحوسب، مع تفاصيل عن وجود الورم وموقعه وخصائصه.
  • COCO: مجموعة بيانات الأجسام الشائعة في السياقات (COCO) واسعة النطاق، مخصصة لاكتشاف الأجسام وتجزئتها وإنشاء التسميات التوضيحية، وتضم 80 فئة من الأجسام.
  • COCO8: مجموعة فرعية أصغر تضم أول 8 صور من COCO train2017، منها 4 للتدريب و4 للتحقق، وهي مناسبة للاختبارات السريعة.
  • COCO8-Grayscale: إصدار بتدرج الرمادي من COCO8 أُنشئ بتحويل RGB إلى تدرج الرمادي، وهو مفيد لتقييم النماذج أحادية القناة.
  • COCO8-Multispectral: إصدار متعدد الأطياف من COCO8 ذي 10 قنوات، أُنشئ بالاستيفاء بين أطوال موجات RGB، وهو مفيد لتقييم النماذج المراعية للطيف.
  • COCO12-Formats: مجموعة اختبار من 12 صورة تغطي تنسيقات الصور الـ12 المدعومة (AVIF وBMP وDNG وHEIC وJP2 وJPEG وJPG وMPO وPNG وTIF وTIFF وWebP)، للتحقق من صحة خطوط أنابيب تحميل الصور.
  • COCO128: مجموعة فرعية أصغر تضم أول 128 صورة من COCO train2017، وهي مناسبة للاختبارات.
  • Construction-PPE: مجموعة بيانات لصور مواقع الإنشاءات، موضّح فيها بملاحظات عناصر السلامة الأساسية مثل الخوذ والسترات والقفازات والأحذية الواقية والنظارات، إلى جانب تسميات المعدات المفقودة. وتدعم تطوير نماذج الذكاء الاصطناعي للتحقق من الامتثال وحماية العاملين.
  • Global Wheat 2020: مجموعة بيانات تتضمن صورًا لسنابل القمح، أُعدّت لتحدي القمح العالمي لعام 2020.
  • HomeObjects-3K: مجموعة بيانات لمشاهد داخلية موضّح فيها 12 عنصرًا منزليًا شائعًا، وهي مثالية لتطوير نماذج الرؤية الحاسوبية واختبارها في أنظمة المنازل الذكية والروبوتات والواقع المعزز.
  • KITTI: مجموعة بيانات معروفة للقيادة الذاتية، تتضمن مدخلات استريو وLiDAR وGPS/IMU، وتُستخدم لاكتشاف الأجسام ثنائي الأبعاد في مشاهد طرق متنوعة.
  • LVIS: مجموعة بيانات واسعة النطاق لاكتشاف الأجسام وتجزئة المثيلات، تضم 1,203 فئة من الأجسام.
  • Medical-pills: مجموعة بيانات تضم صورًا موسومة لحبوب الأدوية، صُممت للمساعدة في مهام مثل مراقبة جودة الأدوية وفرزها وضمان الامتثال لمعايير الصناعة.
  • Objects365: مجموعة بيانات عالية الجودة وواسعة النطاق لاكتشاف الأجسام، تضم 365 فئة من الأجسام وأكثر من 1.7 مليون صورة مشروحة.
  • OpenImagesV7: مجموعة بيانات شاملة من Google تضم 1.7 مليون صورة تدريب و42 ألف صورة تحقق.
  • RF100: معيار متنوع لاكتشاف الأجسام يضم 100 مجموعة بيانات تغطي سبعة نطاقات تصوير، لإجراء تقييم شامل للنماذج.
  • Signature: مجموعة بيانات تضم صورًا لوثائق متنوعة مع توقيعات موضّح عليها، وتدعم أبحاث التحقق من الوثائق واكتشاف الاحتيال.
  • SKU-110K: مجموعة بيانات للكشف الكثيف عن الأجسام في بيئات البيع بالتجزئة، تضم أكثر من 11 ألف صورة و1.7 مليون مربع إحاطة.
  • TT100K: مجموعة بيانات إشارات المرور Tsinghua-Tencent 100K، تضم 16,817 صورة من منظور الشارع موزعة على 221 فئة من الإشارات.
  • VisDrone: مجموعة بيانات تتضمن بيانات اكتشاف الأجسام وتتبع الأجسام المتعددة في صور التقطتها طائرات مسيّرة، وتضم أكثر من 10 آلاف صورة ومقاطع فيديو.
  • VOC: مجموعة بيانات فئات الأجسام المرئية من Pascal (VOC) لاكتشاف الأجسام وتجزئتها، تضم 20 فئة من الأجسام وأكثر من 21 ألف صورة.
  • xView: مجموعة بيانات لاكتشاف الأجسام في الصور الملتقطة من الأعلى، تضم 60 فئة من الأجسام وأكثر من مليون جسم مشروح.

تجزئة الكائنات#

تجزئة المثيلات تقنية في الرؤية الحاسوبية تتضمن تحديد الأجسام في الصورة وتعيين مواقعها على مستوى البكسل. وعلى خلاف التجزئة الدلالية التي تصنّف كل بكسل فحسب، تميّز تجزئة المثيلات بين المثيلات المختلفة للفئة نفسها.

  • Carparts-seg: مجموعة بيانات مصممة خصيصًا لتحديد أجزاء المركبات، وتلبي احتياجات التصميم والتصنيع والبحث. وهي مناسبة لمهام اكتشاف الأجسام وتجزئتها على حد سواء.
  • COCO: مجموعة بيانات واسعة النطاق مصممة لمهام اكتشاف الأجسام وتجزئتها وإنشاء التسميات التوضيحية، وتضم أكثر من 200 ألف صورة موسومة.
  • COCO8-seg: مجموعة بيانات أصغر لمهام تجزئة المثيلات، تضم مجموعة فرعية من 8 صور من COCO مع تعليقات توضيحية للتجزئة.
  • COCO128-seg: مجموعة بيانات أصغر لمهام تجزئة المثيلات، تضم مجموعة فرعية من 128 صورة من COCO مع تعليقات توضيحية للتجزئة.
  • Crack-seg: مجموعة بيانات أُعدّت خصيصًا لاكتشاف الشقوق في الطرق والجدران، وتناسب مهام اكتشاف الأجسام وتجزئتها على حد سواء.
  • Package-seg: مجموعة بيانات مصممة لتحديد الطرود في المستودعات أو البيئات الصناعية، وتناسب تطبيقات اكتشاف الأجسام وتجزئتها على حد سواء.

التجزئة الدلالية#

تُسند التجزئة الدلالية تسمية فئة إلى كل بكسل في الصورة، ما ينتج خرائط كثيفة للمشهد لتطبيقات مثل القيادة الذاتية وتحليل المشاهد ورسم خرائط الغطاء الأرضي.

  • Cityscapes: مجموعة بيانات للتجزئة الدلالية لمشاهد شوارع المدن، تضم 19 فئة تدريب.
  • Cityscapes8: مجموعة فرعية مدمجة من Cityscapes تضم 8 صور، لإجراء فحوصات سريعة لخط أنابيب التجزئة الدلالية.
  • ADE20K: مجموعة بيانات لتحليل المشاهد تضم 150 فئة دلالية.

تقدير العمق#

يقدّر تقدير العمق أحادي العين خريطة عمق لكل بكسل بوحدة المتر انطلاقًا من صورة RGB واحدة، ما يدعم إعادة بناء المشاهد ثلاثية الأبعاد وملاحة الروبوتات وتطبيقات الواقع المعزز والواقع الافتراضي.

  • Depth8: مجموعة فرعية مدمجة من SUN RGB-D تضم 8 صور، لإجراء فحوصات سريعة لخط الأنابيب.
  • ARKitScenes: بيانات RGB-D داخلية واقعية التُقطت باستخدام LiDAR في Apple ARKit، وهي أكبر مصدر واقعي للتدريب.
  • SUN RGB-D: مشاهد داخلية واقعية التُقطت باستخدام أربعة مستشعرات RGB-D مختلفة.
  • DIODE: بيانات عمق كثيفة داخلية وخارجية جُمعت باستخدام ماسح ليزري بمستوى مساحي.
  • Hypersim: مشاهد داخلية اصطناعية واقعية بصريًا، ذات عمق دقيق لكل بكسل.
  • TartanAir: بيئات AirSim اصطناعية ذات بيانات عمق كثيفة حتى نحو ~80 m.
  • Virtual KITTI 2: إعادة إنشاء اصطناعية لمشاهد القيادة في KITTI، ببيانات عمق كثيفة.
  • KITTI: مشاهد قيادة ذاتية خارجية من العالم الحقيقي، ببيانات عمق من LiDAR Velodyne، وهي أيضًا معيار KITTI Eigen.
  • ImageNet (pseudo-labeled): صور ImageNet-1K مزودة بتسميات زائفة من Depth Anything 3 لاستخدامها في التقطير.
  • NYU Depth V2: معيار قياسي للعمق الداخلي، التُقط باستخدام Microsoft Kinect v1.
  • ETH3D: معيار ماسح ليزري عالي الدقة للمشاهد الداخلية والخارجية.
  • Make3D: معيار للحرم الجامعي الخارجي لا ينتمي إلى توزيع البيانات.
  • iBims-1: معيار داخلي عالي الجودة لحواف العمق والأسطح المستوية.

التصنيف#

تصنيف الصور مهمة في الرؤية الحاسوبية تتضمن تصنيف الصورة ضمن فئة أو أكثر من الفئات المحددة مسبقًا، استنادًا إلى محتواها المرئي.

  • Caltech 101: مجموعة بيانات تضم صورًا لـ101 فئة من الأجسام، لمهام تصنيف الصور.
  • Caltech 256: إصدار موسّع من Caltech 101 يضم 256 فئة من الأجسام وصورًا أكثر صعوبة.
  • CIFAR-10: مجموعة بيانات تضم 60 ألف صورة ملونة بدقة 32x32 موزعة على 10 فئات، بواقع 6 آلاف صورة لكل فئة.
  • CIFAR-100: إصدار موسّع من CIFAR-10 يضم 100 فئة من الأجسام و600 صورة لكل فئة.
  • Fashion-MNIST: مجموعة بيانات تتألف من 70,000 صورة بتدرج الرمادي لعشر فئات من الأزياء، لمهام تصنيف الصور.
  • ImageNet: مجموعة بيانات واسعة النطاق لاكتشاف الأجسام وتصنيف الصور، تضم أكثر من 14 مليون صورة و20,000 فئة.
  • ImageNet-10: مجموعة فرعية أصغر من ImageNet تضم 10 فئات لتسريع التجارب والاختبارات.
  • Imagenette: مجموعة فرعية أصغر من ImageNet تضم 10 فئات يسهل التمييز بينها، لتسريع التدريب والاختبار.
  • Imagewoof: مجموعة فرعية أكثر صعوبة من ImageNet، تضم 10 فئات من سلالات الكلاب لمهام تصنيف الصور.
  • MNIST: مجموعة بيانات تضم 70,000 صورة بتدرج الرمادي لأرقام مكتوبة بخط اليد، لمهام تصنيف الصور.
  • MNIST160: أول 8 صور لكل رقم (0-9) من مجموعتي التدريب والاختبار في MNIST. تضم مجموعة البيانات 160 صورة إجمالًا.

تقدير الوضعية#

تقدير الوضعية تقنية تُستخدم لتحديد وضعية الجسم بالنسبة إلى الكاميرا أو نظام الإحداثيات العالمي. ويتضمن ذلك تحديد النقاط الرئيسية أو المفاصل على الأجسام، ولا سيما البشر أو الحيوانات.

  • COCO: مجموعة بيانات واسعة النطاق تضم تعليقات توضيحية لوضعيات البشر، وقد صُممت لمهام تقدير الوضعية.
  • COCO8-pose: مجموعة بيانات أصغر لمهام تقدير الوضعية، تضم مجموعة فرعية من 8 صور من COCO مع تعليقات توضيحية لوضعيات البشر.
  • Dog-pose: مجموعة بيانات شاملة تضم نحو 8,500 صورة للكلاب، مع 24 نقطة رئيسية موضّحة لكل كلب، ومصممة لمهام تقدير الوضعية.
  • Hand-Keypoints: مجموعة بيانات موجزة تضم أكثر من 26,000 صورة تتمحور حول أيدي البشر، مع 21 نقطة رئيسية موضّحة لكل يد، ومصممة لمهام تقدير الوضعية.
  • Tiger-pose: مجموعة بيانات مدمجة تتألف من 263 صورة للنمور، مع 12 نقطة رئيسية موضّحة لكل نمر لمهام تقدير الوضعية.

مربعات الإحاطة الموجّهة (OBB)#

مربعات الإحاطة الموجّهة (OBB) أسلوب في الرؤية الحاسوبية لاكتشاف الأجسام المائلة في الصور باستخدام مربعات إحاطة مدوّرة، ويُطبّق غالبًا على الصور الجوية وصور الأقمار الصناعية. وعلى خلاف مربعات الإحاطة التقليدية، تلائم OBB الأجسام بمختلف اتجاهاتها على نحو أفضل.

  • DOTA-v2: مجموعة بيانات شائعة للصور الجوية باستخدام OBB، تضم 1.7 مليون مثيل و11,268 صورة.
  • DOTA8: مجموعة فرعية أصغر تضم أول 8 صور من مجموعة التقسيم DOTAv1، منها 4 للتدريب و4 للتحقق، وهي مناسبة للاختبارات السريعة.
  • DOTA128: مجموعة فرعية من DOTA تضم 128 صورة للتدريب والتحقق، وتوفر توازنًا جيدًا بين الحجم والتنوع لاختبار نماذج OBB.

المساهمة بمجموعات بيانات جديدة#

تتضمن المساهمة بمجموعة بيانات جديدة عدة خطوات لضمان توافقها جيدًا مع البنية التحتية الحالية. فيما يلي الخطوات اللازمة:



شاهد: كيفية المساهمة في مجموعات بيانات Ultralytics

خطوات المساهمة بمجموعة بيانات جديدة#

  1. جمع الصور: اجمع الصور التي تنتمي إلى مجموعة البيانات. ويمكن جمعها من مصادر مختلفة، مثل قواعد البيانات العامة أو مجموعتك الخاصة.

  2. إضافة التعليقات التوضيحية إلى الصور: أضف إلى هذه الصور تعليقات توضيحية تتضمن مربعات إحاطة أو مقاطع أو نقاطًا رئيسية، حسب المهمة.

  3. تصدير التعليقات التوضيحية: حوّل هذه التعليقات التوضيحية إلى تنسيق ملفات YOLO *.txt الذي تدعمه Ultralytics.

  4. تنظيم مجموعة البيانات: رتّب مجموعة البيانات ضمن بنية المجلدات الصحيحة. ينبغي أن يتوفر لديك الدليلان images/ وlabels/ في المستوى الأعلى، وداخل كل منهما دليلان فرعيان هما train/ وval/.

    dataset/
    ├── images/
    │   ├── train/
    │   └── val/
    └── labels/
        ├── train/
        └── val/
  5. إنشاء ملف data.yaml: أنشئ في الدليل الجذر لمجموعة البيانات ملفًا باسم data.yaml يصف مجموعة البيانات وفئاتها وغيرها من المعلومات اللازمة.

  6. تحسين الصور (اختياري): إذا أردت تقليل حجم مجموعة البيانات لمعالجتها بكفاءة أكبر، فيمكنك تحسين الصور باستخدام التعليمات البرمجية أدناه. هذا الإجراء غير مطلوب، لكنه موصى به لتقليل حجم مجموعة البيانات وتسريع التنزيل.

  7. ضغط مجموعة البيانات: اضغط مجلد مجموعة البيانات بالكامل في ملف zip.

  8. التوثيق وPR: أنشئ صفحة توثيق تصف مجموعة البيانات وكيفية توافقها مع إطار العمل الحالي. بعد ذلك، أرسل طلب دمج (PR). راجع إرشادات المساهمة في Ultralytics لمزيد من التفاصيل حول كيفية إرسال PR.

مثال على التعليمات البرمجية لتحسين مجموعة بيانات وضغطها#

تحسين مجموعة بيانات وضغطها
from pathlib import Path

from ultralytics.data.utils import compress_one_image
from ultralytics.utils.downloads import zip_directory

# ⁨تحديد دليل مجموعة البيانات⁩
path = Path("path/to/dataset")

# ⁨تحسين الصور في مجموعة البيانات (اختياري)⁩
for f in path.rglob("*.jpg"):
    compress_one_image(f)

# ⁨ضغط مجموعة البيانات في 'path/to/dataset.zip'⁩
zip_directory(path)

باتباع هذه الخطوات، يمكنك المساهمة بمجموعة بيانات جديدة تتكامل جيدًا مع البنية الحالية في Ultralytics.

الأسئلة الشائعة#

  • تدعم Ultralytics مجموعة كبيرة ومتنوعة من مجموعات البيانات الخاصة بـكشف الكائنات، ومنها:

    • COCO: مجموعة بيانات واسعة النطاق لكشف الكائنات وتجزئتها وإضافة التعليقات التوضيحية إلى الصور، تضم 80 فئة من الكائنات.
    • LVIS: مجموعة بيانات واسعة تضم 1,203 فئة من الكائنات، ومصممة لكشف الكائنات وتجزئتها بمستوى أدق من التفاصيل.
    • Argoverse: مجموعة بيانات تتضمن بيانات تتبع ثلاثية الأبعاد والتنبؤ بالحركة في بيئات حضرية، مع تعليقات توضيحية غنية.
    • VisDrone: مجموعة بيانات تضم بيانات كشف الكائنات وتتبع الكائنات المتعددة من صور ملتقطة بطائرات مسيّرة.
    • SKU-110K: تضم صورًا لكشف الكائنات الكثيفة في بيئات البيع بالتجزئة، مع أكثر من 11 ألف صورة.

    تُسهّل مجموعات البيانات هذه تدريب نماذج Ultralytics YOLO متينة لمختلف تطبيقات كشف الكائنات.

  • يتضمن الإسهام بمجموعة بيانات جديدة عدة خطوات:

    1. جمع الصور: اجمع الصور من قواعد بيانات عامة أو مجموعاتك الشخصية.
    2. تعليق الصور: أضف مربعات إحاطة أو مقاطع أو نقاطًا مفتاحية، حسب المهمة.
    3. تصدير التعليقات التوضيحية: حوّل التعليقات التوضيحية إلى تنسيق YOLO *.txt.
    4. تنظيم مجموعة البيانات: استخدم بنية المجلدات التي تضم الدليلين images/ وlabels/، ويحتوي كل منهما على الدليلين الفرعيين train/ وval/.
    5. إنشاء ملف data.yaml: أدرج أوصاف مجموعة البيانات والفئات وغيرها من المعلومات ذات الصلة.
    6. تحسين الصور (اختياري): قلّل حجم مجموعة البيانات لزيادة الكفاءة.
    7. ضغط مجموعة البيانات: اضغط مجموعة البيانات في ملف zip.
    8. التوثيق وPR: صِف مجموعة البيانات وأرسل طلب دمج باتباع إرشادات المساهمة في Ultralytics.

    اطّلع على المساهمة بمجموعات بيانات جديدة للحصول على دليل شامل.

  • تقدم منصة Ultralytics ميزات قوية لإدارة مجموعات البيانات وتحليلها، ومنها:

    • إدارة سلسة لمجموعات البيانات: ارفع مجموعات البيانات ونظّمها وأدرها من مكان واحد.
    • تكامل فوري مع التدريب: استخدم مجموعات البيانات المرفوعة مباشرةً لتدريب النماذج دون إعداد إضافي.
    • أدوات التصور: استكشف صور مجموعة البيانات وتعليقاتها التوضيحية واعرضها بصريًا.
    • تحليل مجموعة البيانات: احصل على رؤى حول توزيع مجموعة البيانات وخصائصها.

    تُسهّل المنصة الانتقال من إدارة مجموعة البيانات إلى تدريب النموذج، ما يجعل العملية بأكملها أكثر كفاءة. تعرّف على المزيد حول مجموعات بيانات منصة Ultralytics.

  • توفر نماذج Ultralytics YOLO عدة ميزات فريدة لمهام الرؤية الحاسوبية:

    • الأداء في الزمن الحقيقي: إمكانات استدلال وتدريب عالية السرعة للتطبيقات الحساسة للوقت.
    • تعدد الاستخدامات: دعم الكشف، وتجزئة الكائنات، والتجزئة الدلالية، وتقدير العمق، والتصنيف، وتقدير الوضعية، ومهام مربعات الإحاطة الموجّهة (OBB) ضمن إطار عمل موحد.
    • النماذج المدربة مسبقًا: إمكانية الوصول إلى نماذج مدربة مسبقًا وعالية الأداء لمختلف التطبيقات، ما يقلل زمن التدريب.
    • دعم مجتمعي واسع: مجتمع نشط ووثائق شاملة لاستكشاف الأخطاء وإصلاحها والتطوير.
    • سهولة التكامل: API بسيطة للتكامل مع المشاريع وسير العمل الحالية.

    اكتشف المزيد عن نماذج YOLO في صفحة نماذج Ultralytics.

  • لتحسين مجموعة بيانات وضغطها باستخدام أدوات Ultralytics، اتبع مثال التعليمات البرمجية هذا:

    تحسين مجموعة بيانات وضغطها
    from pathlib import Path
    
    from ultralytics.data.utils import compress_one_image
    from ultralytics.utils.downloads import zip_directory
    
    # ⁨تحديد دليل مجموعة البيانات⁩
    path = Path("path/to/dataset")
    
    # ⁨تحسين الصور في مجموعة البيانات (اختياري)⁩
    for f in path.rglob("*.jpg"):
        compress_one_image(f)
    
    # ⁨ضغط مجموعة البيانات في 'path/to/dataset.zip'⁩
    zip_directory(path)

    تساعد هذه العملية على تقليل حجم مجموعة البيانات لتخزين أكثر كفاءة وسرعات تنزيل أعلى. تعرّف على المزيد حول تحسين مجموعة بيانات وضغطها.

التعليقات