Ultralytics YOLO27:

نظرة عامة على مجموعات البيانات#

توفر Ultralytics دعمًا لمجموعات بيانات متنوعة لتسهيل مهام الرؤية الحاسوبية، مثل اكتشاف الكائنات، وتجزئة المثيلات، والتجزئة الدلالية، وتقدير العمق، والتصنيف، وتقدير الوضعية، والمربعات المحيطة الموجّهة (OBB). فيما يلي قائمة بمجموعات بيانات Ultralytics الرئيسية، يتبعها ملخص لكل مهمة من مهام الرؤية الحاسوبية ومجموعات البيانات الخاصة بها. تعمل وضعية التتبع فوق نماذج الاكتشاف والتجزئة والوضعية وOBB من دون تدريب خاص بأداة التتبع؛ راجع مجموعات بيانات التتبع.



Watch: Ultralytics Datasets Overview

اكتشاف الأجسام#

يُعد اكتشاف الكائنات باستخدام المربع المحيط تقنيةً في الرؤية الحاسوبية تتضمن اكتشاف الكائنات وتحديد مواقعها في الصورة من خلال رسم مربع محيط حول كل كائن.

  • African-wildlife: مجموعة بيانات تتضمن صورًا للحياة البرية الإفريقية، بما في ذلك الجواميس والفيلة ووحيد القرن والحُمُر الوحشية.
  • Argoverse: مجموعة بيانات تحتوي على بيانات التتبع ثلاثي الأبعاد والتنبؤ بالحركة من البيئات الحضرية، مع تعليقات توضيحية غنية.
  • Brain-tumor: مجموعة بيانات لاكتشاف أورام الدماغ، تتضمن صورًا لفحوصات MRI أو CT مع تفاصيل حول وجود الورم وموقعه وخصائصه.
  • COCO: مجموعة بيانات الأجسام الشائعة في السياق (COCO) واسعة النطاق لاكتشاف الكائنات وتجزئتها وإنشاء أوصاف لها، وتضم 80 فئة من الكائنات.
  • COCO8: مجموعة فرعية أصغر تضم أول 8 صور من مجموعة بيانات التدريب لـ COCO train2017، 4 منها للتدريب و4 للتحقق من الصحة، وهي مناسبة للاختبارات السريعة.
  • COCO8-Grayscale: إصدار بتدرج الرمادي من COCO8 أُنشئ بتحويل RGB إلى تدرج رمادي، وهو مفيد لتقييم النماذج أحادية القناة.
  • COCO8-Multispectral: إصدار متعدد الأطياف من COCO8، مكوّن من 10 قنوات أُنشئت باستيفاء أطوال موجية RGB، وهو مفيد لتقييم النماذج المدركة للطيف.
  • COCO12-Formats: مجموعة بيانات اختبار تضم 12 صورة وتغطي تنسيقات الصور الـ 12 المدعومة (AVIF، وBMP، وDNG، وHEIC، وJP2، وJPEG، وJPG، وMPO، وPNG، وTIF، وTIFF، وWebP) للتحقق من صحة خطوط أنابيب تحميل الصور.
  • COCO128: مجموعة فرعية أصغر من أول 128 صورة من COCO train2017، ومناسبة للاختبارات.
  • Construction-PPE: مجموعة بيانات لصور مواقع البناء، مشروحة بمعدات السلامة الأساسية مثل الخوذ والسترات والقفازات والأحذية ونظارات الوقاية، إلى جانب تسميات للمعدات المفقودة، مما يدعم تطوير نماذج الذكاء الاصطناعي للامتثال وحماية العمال.
  • Global Wheat 2020: مجموعة بيانات تحتوي على صور لسنابل القمح من أجل تحدي القمح العالمي لعام 2020.
  • HomeObjects-3K: مجموعة بيانات لمشاهد داخلية مشروحة تتضمن 12 عنصرًا منزليًا شائعًا، وهي مثالية لتطوير واختبار نماذج الرؤية الحاسوبية في أنظمة المنازل الذكية والروبوتات والواقع المعزز.
  • KITTI: مجموعة بيانات شهيرة للقيادة الذاتية تتضمن مدخلات الاستريو، وليدار، ونظام تحديد المواقع العالمي ووحدة القياس بالقصور الذاتي (GPS/IMU)، وتُستخدم للكشف عن الكائنات ثنائية الأبعاد في مشاهد الطرق المتنوعة.
  • LVIS: مجموعة بيانات واسعة النطاق لاكتشاف الكائنات وتجزئتها وإنشاء أوصاف لها، وتضم 1203 فئات من الكائنات.
  • Medical-pills: مجموعة بيانات تحتوي على صور معنونة للأقراص الطبية، صُممت للمساعدة في مهام مثل مراقبة جودة المستحضرات الدوائية والفرز وضمان الامتثال لمعايير الصناعة.
  • Objects365: مجموعة بيانات عالية الجودة وواسعة النطاق لاكتشاف الكائنات، تضم 365 فئة من الكائنات وأكثر من 600 ألف صورة مشروحة.
  • OpenImagesV7: مجموعة بيانات شاملة من Google، تضم 1.7 مليون صورة تدريب و42 ألف صورة تحقق.
  • RF100: معيار متنوع لاكتشاف الكائنات يضم 100 مجموعة بيانات تغطي سبعة مجالات للصور، لإجراء تقييم شامل للنماذج.
  • Signature: مجموعة بيانات تتضمن صورًا لوثائق متنوعة مع توقيعات مشروحة، وتدعم أبحاث التحقق من الوثائق واكتشاف الاحتيال.
  • SKU-110K: مجموعة بيانات تتضمن اكتشافًا كثيفًا للكائنات في بيئات البيع بالتجزئة، مع أكثر من 11 ألف صورة و1.7 مليون مربع محيط.
  • TT100K: مجموعة بيانات إشارات المرور الصادرة عن جامعة تسينغهوا وتنسنت والتي تضم 100 ألف (TT100K) إشارة مرورية، وتتضمن 16817 صورة لشارع في منظومة مرئية عبر 221 فئة إشارة.
  • VisDrone: مجموعة بيانات تحتوي على بيانات اكتشاف الكائنات وتتبع الكائنات المتعددة من صور التقطتها الطائرات المسيّرة، مع أكثر من 10 آلاف صورة وتسلسل فيديو.
  • VOC: مجموعة بيانات فئات الكائنات المرئية Pascal (VOC) لاكتشاف الكائنات وتجزئتها، وتضم 20 فئة من الكائنات وأكثر من 11 ألف صورة.
  • xView: مجموعة بيانات لاكتشاف الكائنات في الصور الجوية، تضم 60 فئة من الكائنات وأكثر من مليون كائن مشروح.

تقسيم الكائنات#

تجزئة المثيلات هي تقنية في الرؤية الحاسوبية تتضمن تحديد الكائنات وتحديد مواقعها في الصورة على مستوى البكسل. وعلى خلاف التجزئة الدلالية التي تصنّف كل بكسل فقط، تميّز تجزئة المثيلات بين المثيلات المختلفة للفئة نفسها.

  • Carparts-seg: مجموعة بيانات مصممة خصيصًا لتحديد أجزاء المركبات، بما يلبي احتياجات التصميم والتصنيع والبحث. وتُستخدم في مهام اكتشاف الكائنات والتجزئة على حد سواء.
  • COCO: مجموعة بيانات واسعة النطاق مصممة لمهام اكتشاف الكائنات والتجزئة وإنشاء الأوصاف، وتضم أكثر من 200 ألف صورة معنونة.
  • COCO8-seg: مجموعة بيانات أصغر لمهام تجزئة المثيلات، تحتوي على مجموعة فرعية من 8 صور COCO مع تعليقات توضيحية للتجزئة.
  • COCO128-seg: مجموعة بيانات أصغر لمهام تجزئة المثيلات، تحتوي على مجموعة فرعية من 128 صورة COCO مع تعليقات توضيحية للتجزئة.
  • Crack-seg: مجموعة بيانات مصممة خصيصًا لاكتشاف التشققات في الطرق والجدران، ويمكن استخدامها في مهام اكتشاف الكائنات والتجزئة على حد سواء.
  • Package-seg: مجموعة بيانات مخصصة لتحديد الطرود في المستودعات أو البيئات الصناعية، ومناسبة لتطبيقات اكتشاف الكائنات والتجزئة على حد سواء.

التقسيم الدلالي#

تُسنِد التجزئة الدلالية تسمية فئة إلى كل بكسل في الصورة، منتجةً خرائط كثيفة للمشهد لتطبيقات مثل القيادة الذاتية وتحليل المشاهد ورسم خرائط غطاء الأرض.

  • Cityscapes: مجموعة بيانات لتجزئة المشاهد الحضرية الدلالية، تضم 19 فئة تدريب.
  • Cityscapes8: مجموعة فرعية صغيرة من Cityscapes تتكون من 8 صور، لفحص مسارات التجزئة الدلالية بسرعة.
  • ADE20K: مجموعة بيانات لتحليل المشاهد، تضم 150 فئة دلالية.

تقدير العمق#

يتنبأ تقدير العمق أحادي العين بخريطة عمق لكل بكسل بوحدة المتر انطلاقًا من صورة RGB واحدة، مما يدعم إعادة بناء المشاهد ثلاثية الأبعاد وملاحة الروبوتات وتطبيقات AR/VR.

  • Depth8: مجموعة فرعية صغيرة من SUN RGB-D تتكون من 8 صور، لفحص المسارات بسرعة.
  • ARKitScenes: لقطات حقيقية داخلية لعمق الألوان الحمراء والخضراء والزرقاء (RGB-D) ملتقطة باستخدام ليدار أبل أركيت (Apple ARKit)، وهي أكبر مصدر تدريب حقيقي.
  • SUN RGB-D: مشاهد داخلية حقيقية ملتقطة بأربعة مستشعرات مختلفة لعمق الألوان الحمراء والخضراء والزرقاء (RGB-D).
  • DIODE: عمق داخلي وخارجي عالي الكثافة تم الحصول عليه من ناسر ليزري بمستوى المسح الهندسي.
  • Hypersim: مشاهد داخلية اصطناعية فائقة الواقعية مع عمق مثالي لكل بكسل.
  • TartanAir: بيئات محاكاة جوية اصطناعية (AirSim) ذات عمق كثيف يصل إلى حوالي 80 متراً.
  • Virtual KITTI 2: إعادة إنشاء اصطناعية لمشاهد القيادة لـ KITTI مع عمق كثيف.
  • KITTI: مشاهد قيادة ذاتية خارجية واقعية مع عمق ليدار فيلوداين (Velodyne LiDAR)، وتعتبر أيضاً معيار تقييم كيتي إيجين (KITTI Eigen).
  • ImageNet (pseudo-labeled): صور ImageNet-1K مع التسميات الوهمية لتقنية العمق أيا كان 3 (Depth Anything 3) لغرض التقاطير.
  • NYU Depth V2: معيار قياسي للعمق الداخلي التُقط باستخدام Microsoft Kinect v1.
  • ETH3D: معيار مسح ضوئي بالليزر عالي الدقة للمناطق الداخلية والخارجية.
  • Make3D: معيار خارجي للحرم الجامعي خارج نطاق التوزيع.
  • iBims-1: معيار داخلي عالي الجودة لحواف العمق والأسطح المستوية.

التصنيف#

تصنيف الصور هو مهمة في الرؤية الحاسوبية تتضمن تصنيف الصورة ضمن فئة أو أكثر من الفئات أو التصنيفات المحددة مسبقًا، استنادًا إلى محتواها المرئي.

  • Caltech 101: مجموعة بيانات تحتوي على صور لـ101 فئة من الكائنات لمهام تصنيف الصور.
  • Caltech 256: إصدار موسّع من Caltech 101 يضم 256 فئة من الكائنات وصورًا أكثر تحديًا.
  • CIFAR-10: مجموعة بيانات تضم 60 ألف صورة ملونة بحجم 32x32 ضمن 10 فئات، مع 6 آلاف صورة لكل فئة.
  • CIFAR-100: إصدار موسّع من CIFAR-10 يضم 100 فئة من الكائنات و600 صورة لكل فئة.
  • Fashion-MNIST: مجموعة بيانات تتكون من 70 ألف صورة بتدرج الرمادي لعشر فئات من الأزياء لمهام تصنيف الصور.
  • ImageNet: مجموعة بيانات واسعة النطاق لاكتشاف الكائنات وتصنيف الصور، تضم أكثر من 14 مليون صورة و20 ألف فئة.
  • ImageNet-10: مجموعة فرعية أصغر من ImageNet تضم 10 فئات لإجراء التجارب والاختبارات بسرعة أكبر.
  • Imagenette: مجموعة فرعية أصغر من ImageNet تحتوي على 10 فئات يسهل تمييزها، لتسريع التدريب والاختبار.
  • Imagewoof: مجموعة فرعية أكثر تحديًا من ImageNet، تحتوي على 10 فئات من سلالات الكلاب لمهام تصنيف الصور.
  • MNIST: مجموعة بيانات تضم 70 ألف صورة بتدرج الرمادي لأرقام مكتوبة يدويًا لمهام تصنيف الصور.
  • MNIST160: أول 8 صور لكل رقم (0-9) من قسمي التدريب والاختبار في MNIST. تحتوي مجموعة البيانات على 160 صورة إجمالًا.

تقدير الوضعية#

تقدير الوضعية هو تقنية تُستخدم لتحديد وضعية الكائن بالنسبة إلى الكاميرا أو نظام الإحداثيات العالمي. ويتضمن ذلك تحديد النقاط الرئيسية أو المفاصل على الكائنات، ولا سيما البشر أو الحيوانات.

  • COCO: مجموعة بيانات واسعة النطاق تتضمن تعليقات توضيحية لوضعيات البشر، ومصممة لمهام تقدير الوضعية.
  • COCO8-pose: مجموعة بيانات أصغر لمهام تقدير الوضعية، تحتوي على مجموعة فرعية من 8 صور COCO مع تعليقات توضيحية لوضعيات البشر.
  • Dog-pose: مجموعة بيانات شاملة تتضمن نحو 8,500 صورة تركز على الكلاب، مع 24 نقطة رئيسية مشروحة لكل كلب، ومخصصة لمهام تقدير الوضعية.
  • Hand-Keypoints: مجموعة بيانات موجزة تتضمن أكثر من 26 ألف صورة تركز على أيدي البشر، مع 21 نقطة رئيسية مشروحة لكل يد، ومصممة لمهام تقدير الوضعية.
  • Tiger-pose: مجموعة بيانات صغيرة تتكون من 263 صورة تركز على النمور، مع 12 نقطة رئيسية مشروحة لكل نمر لمهام تقدير الوضعية.

المربعات المحيطة الموجّهة (OBB)#

المربعات المحيطة الموجّهة (OBB) هي أسلوب في الرؤية الحاسوبية لاكتشاف الكائنات المائلة في الصور باستخدام مربعات محيطة مدوّرة، ويُطبّق غالبًا على الصور الجوية وصور الأقمار الصناعية. وعلى خلاف المربعات المحيطة التقليدية، يمكن لـOBB أن يلائم الكائنات بمختلف اتجاهاتها على نحو أفضل.

  • DOTA-v2: مجموعة بيانات شائعة للصور الجوية باستخدام OBB، تضم 1.7 مليون مثيل و11,268 صورة.
  • DOTA8: مجموعة فرعية أصغر من أول 8 صور من مجموعة تقسيم DOTAv1، بواقع 4 صور للتدريب و4 للتحقق، ومناسبة للاختبارات السريعة.
  • DOTA128: مجموعة فرعية من مجموعة بيانات DOTA تضم 128 صورة للتدريب والتحقق، وتوفر توازنًا جيدًا بين الحجم والتنوع لاختبار نماذج OBB.

المساهمة بمجموعات بيانات جديدة#

تتضمن المساهمة بمجموعة بيانات جديدة عدة خطوات لضمان توافقها جيدًا مع البنية التحتية الحالية. فيما يلي الخطوات اللازمة:



Watch: How to Contribute to Ultralytics Datasets

خطوات المساهمة بمجموعة بيانات جديدة#

  1. جمع الصور: اجمع الصور التي تنتمي إلى مجموعة البيانات. ويمكن جمعها من مصادر متنوعة، مثل قواعد البيانات العامة أو مجموعتك الخاصة.

  2. إضافة التعليقات التوضيحية إلى الصور: أضف إلى هذه الصور مربعات محيطة أو مقاطع أو نقاطًا رئيسية، وفقًا للمهمة.

  3. تصدير التعليقات التوضيحية: حوّل هذه التعليقات التوضيحية إلى تنسيق ملف YOLO *.txt الذي تدعمه Ultralytics.

  4. تنظيم مجموعة البيانات: رتّب مجموعة البيانات في بنية المجلدات الصحيحة. يجب أن يتوفر لديك الدليلان images/ وlabels/ على المستوى الأعلى، وداخل كل منهما دليل فرعي train/ وval/.

    dataset/
    ├── images/
    │   ├── train/
    │   └── val/
    └── labels/
        ├── train/
        └── val/
  5. إنشاء ملف data.yaml: أنشئ في الدليل الجذري لمجموعة البيانات ملفًا باسم data.yaml يصف مجموعة البيانات والفئات والمعلومات الضرورية الأخرى.

  6. تحسين الصور (اختياري): إذا أردت تقليل حجم مجموعة البيانات لمعالجة أكثر كفاءة، يمكنك تحسين الصور باستخدام التعليمات البرمجية أدناه. هذا الإجراء غير مطلوب، لكنه موصى به لتقليل حجم مجموعة البيانات وتسريع سرعات التنزيل.

  7. ضغط مجموعة البيانات: اضغط مجلد مجموعة البيانات بالكامل في ملف zip.

  8. التوثيق وPR: أنشئ صفحة توثيق تصف مجموعة البيانات وكيفية اندماجها في الإطار الحالي. بعد ذلك، أرسل طلب سحب (PR). راجع إرشادات المساهمة في Ultralytics لمزيد من التفاصيل حول إرسال PR.

مثال على تعليمات برمجية لتحسين مجموعة بيانات وضغطها#

تحسين مجموعة بيانات وضغطها
from pathlib import Path

from ultralytics.data.utils import compress_one_image
from ultralytics.utils.downloads import zip_directory

# Define dataset directory
path = Path("path/to/dataset")

# Optimize images in dataset (optional)
for f in path.rglob("*.jpg"):
    compress_one_image(f)

# Zip dataset into 'path/to/dataset.zip'
zip_directory(path)

باتباع هذه الخطوات، يمكنك المساهمة بمجموعة بيانات جديدة تتكامل جيدًا مع بنية Ultralytics الحالية.

الأسئلة الشائعة#

  • تدعم Ultralytics مجموعة واسعة من مجموعات البيانات لـاكتشاف الكائنات، بما في ذلك:

    • COCO: مجموعة بيانات واسعة النطاق لاكتشاف الكائنات وتجزئتها وإنشاء أوصاف لها، وتضم 80 فئة من الكائنات.
    • LVIS: مجموعة بيانات شاملة تضم 1203 فئات من الكائنات، ومصممة لاكتشاف الكائنات وتجزئتها بمستوى أدق.
    • Argoverse: مجموعة بيانات تحتوي على بيانات التتبع ثلاثي الأبعاد والتنبؤ بالحركة من البيئات الحضرية، مع تعليقات توضيحية غنية.
    • VisDrone: مجموعة بيانات تتضمن بيانات اكتشاف الكائنات وتتبع الكائنات المتعددة من صور التقطتها الطائرات المسيّرة.
    • SKU-110K: تتضمن اكتشافًا كثيفًا للكائنات في بيئات البيع بالتجزئة، مع أكثر من 11 ألف صورة.

    تسهّل مجموعات البيانات هذه تدريب نماذج Ultralytics YOLO قوية لمختلف تطبيقات اكتشاف الكائنات.

  • تتضمن المساهمة بمجموعة بيانات جديدة عدة خطوات:

    1. جمع الصور: اجمع الصور من قواعد البيانات العامة أو المجموعات الشخصية.
    2. إضافة التعليقات التوضيحية إلى الصور: أضف مربعات محيطة أو مقاطع أو نقاطًا رئيسية، وفقًا للمهمة.
    3. تصدير التعليقات التوضيحية: حوّل التعليقات التوضيحية إلى تنسيق YOLO *.txt.
    4. تنظيم مجموعة البيانات: استخدم بنية المجلدات التي تتضمن الدليلين train/ وval/، ويحتوي كل منهما على الدليلين الفرعيين images/ وlabels/.
    5. إنشاء ملف data.yaml: أدرج أوصاف مجموعة البيانات والفئات والمعلومات الأخرى ذات الصلة.
    6. تحسين الصور (اختياري): قلّل حجم مجموعة البيانات لتحقيق كفاءة أكبر.
    7. ضغط مجموعة البيانات: اضغط مجموعة البيانات في ملف zip.
    8. التوثيق وPR: صِف مجموعة البيانات وأرسل طلب سحب باتباع إرشادات المساهمة في Ultralytics.

    زر صفحة المساهمة بمجموعات بيانات جديدة للاطلاع على دليل شامل.

  • تقدم منصة Ultralytics ميزات قوية لإدارة مجموعات البيانات وتحليلها، بما في ذلك:

    • إدارة سلسة لمجموعات البيانات: ارفع مجموعات بياناتك ونظّمها وأدرها في مكان واحد.
    • تكامل فوري مع التدريب: استخدم مجموعات البيانات المرفوعة مباشرةً لتدريب النماذج من دون إعداد إضافي.
    • أدوات التصور: استكشف صور مجموعة البيانات وتعليقاتها التوضيحية وتصورها.
    • تحليل مجموعة البيانات: احصل على رؤى حول توزيع مجموعة بياناتك وخصائصها.

    تعمل المنصة على تبسيط الانتقال من إدارة مجموعة البيانات إلى تدريب النموذج، مما يجعل العملية بأكملها أكثر كفاءة. تعرّف على المزيد حول مجموعات بيانات منصة Ultralytics.

  • توفر نماذج Ultralytics YOLO العديد من الميزات الفريدة لمهام الرؤية الحاسوبية:

    • الأداء الآني: إمكانات استدلال وتدريب عالية السرعة للتطبيقات الحساسة للوقت.
    • تعدد الاستخدامات: دعم مهام الكشف، وتجزئة المثيلات، والتجزئة الدلالية، وتقدير العمق، والتصنيف، وتقدير الوضعية ضمن إطار عمل موحّد.
    • النماذج المدرّبة مسبقًا: إمكانية الوصول إلى نماذج عالية الأداء ومدرّبة مسبقًا لمختلف التطبيقات، مما يقلل وقت التدريب.
    • دعم مجتمعي واسع: مجتمع نشط ووثائق شاملة لاستكشاف الأخطاء وإصلاحها والتطوير.
    • سهولة التكامل: API بسيطة للتكامل مع المشاريع وسير العمل الحالية.

    اكتشف المزيد حول نماذج YOLO في صفحة نماذج Ultralytics.

  • لتحسين مجموعة بيانات وضغطها باستخدام أدوات Ultralytics، اتبع مثال التعليمات البرمجية التالي:

    تحسين مجموعة بيانات وضغطها
    from pathlib import Path
    
    from ultralytics.data.utils import compress_one_image
    from ultralytics.utils.downloads import zip_directory
    
    # Define dataset directory
    path = Path("path/to/dataset")
    
    # Optimize images in dataset (optional)
    for f in path.rglob("*.jpg"):
        compress_one_image(f)
    
    # Zip dataset into 'path/to/dataset.zip'
    zip_directory(path)

    تساعد هذه العملية على تقليل حجم مجموعة البيانات لتخزين أكثر كفاءة وسرعات تنزيل أعلى. تعرّف على المزيد حول كيفية تحسين مجموعة بيانات وضغطها.

التعليقات