رؤية YOLO لعام 2026:

مجموعة بيانات Roboflow 100#

مجموعة بيانات Roboflow 100، التي ترعاها Intel، هي مجموعة بيانات مرجعية رائدة لـ object detection. وهي تتضمن 100 مجموعة بيانات متنوعة. صُممت هذه المعيارية خصيصًا لاختبار مدى قابلية تكيُّف نماذج computer vision، مثل Ultralytics YOLO models، مع مختلف المجالات، بما في ذلك الرعاية الصحية، والصور الجوية، وألعاب الفيديو.

الترخيص

تقدم Ultralytics خيارين للترخيص لتلبية حالات الاستخدام المختلفة:

  • رخصة AGPL-3.0: هذه الرخصة المفتوحة المصدر المعتمدة من OSI مثالية للطلاب والهواة، حيث تعزز التعاون المفتوح ومشاركة المعرفة. راجع ملف LICENSE لمزيد من التفاصيل وقم بزيارة صفحة رخصة AGPL-3.0.
  • رخصة المؤسسات: للاستخدام في التطوير والإنتاج، تتيح هذه الرخصة التكامل السلس لبرمجيات Ultralytics ونماذج الذكاء الاصطناعي في منتجات وخدمات الأعمال، بما في ذلك الأدوات الداخلية، وسير العمل الآلي، وعمليات نشر الإنتاج، متجاوزة متطلبات المصدر المفتوح لـ AGPL-3.0. للبدء، يرجى الاتصال بنا عبر Ultralytics Licensing.

Roboflow 100 diverse object detection benchmark

الميزات الرئيسية#

  • مجالات متنوعة: تتضمن 100 مجموعة بيانات عبر سبعة مجالات متميزة: الجوية، وألعاب الفيديو، والمجهرية، وتحت الماء، والمستندات، والكهرومغناطيسية، والعالم الحقيقي.
  • الحجم: يضم المعيار 224,714 صورة موزعة على 805 فئات، تمثل أكثر من 11,170 ساعة من جهد data labeling.
  • القياسية: تتم معالجة جميع الصور مسبقًا preprocessed وتغيير حجمها إلى 640x640 بكسل لضمان تقييم متسق.
  • تقييم نظيف: يركز على القضاء على غموض الفئات وتصفية الفئات غير الممثلة بشكل كافٍ لضمان model evaluation أكثر نظافة.
  • الشروح التوضيحية: تتضمن bounding boxes للأجسام، وهي مناسبة لـ training وتقييم نماذج كشف الأجسام باستخدام مقاييس مثل mAP.

هيكل مجموعة البيانات#

تم تنظيم مجموعة بيانات Roboflow 100 في سبع فئات، يحتوي كل منها على مجموعة فريدة من مجموعات البيانات والصور والفئات:

  • الجوية: 7 مجموعات بيانات، 9,683 صورة، 24 فئة.
  • ألعاب الفيديو: 7 مجموعات بيانات، 11,579 صورة، 88 فئة.
  • المجهرية: 11 مجموعة بيانات، 13,378 صورة، 28 فئة.
  • تحت الماء: 5 مجموعات بيانات، 18,003 صورة، 39 فئة.
  • المستندات: 8 مجموعات بيانات، 24,813 صورة، 90 فئة.
  • الكهرومغناطيسية: 12 مجموعة بيانات، 36,381 صورة، 41 فئة.
  • العالم الحقيقي: 50 مجموعة بيانات، 110,615 صورة، 495 فئة.

توفر هذه البنية بيئة اختبار متنوعة وواسعة النطاق لنماذج object detection، مما يعكس مجموعة واسعة من سيناريو التطبيقات الواقعية الموجودة في مختلف Ultralytics Solutions.

قياس الأداء#

تتضمن عملية benchmarking لمجموعات البيانات تقييم أداء نماذج machine learning على مجموعات بيانات محددة باستخدام مقاييس معيارية. وتشمل المقاييس الشائعة accuracy، ومتوسط دقة الدقة (mAP)، وF1-score. يمكنك معرفة المزيد حول هذه المقاييس في دليل مقاييس أداء YOLO الخاص بنا.

نتائج قياس الأداء

يتم تجميع كل مخرجات تحت دليل واحد runs/<task>/multitrain/: يتم ضبط كل مجموعة بيانات بدقة في دليلها الفرعي الخاص (مع results.png الخاص بها)، وتتم كتابة مقاييس كل مجموعة بيانات والمتوسطات إلى multitrain_results.json إلى جانب مخطط شريطي multitrain_results.png. كما يُرجع استدعاء model.train() قاموس {dataset: metrics} للوصول البرمجي.

مثال على قياس الأداء

يقوم البرنامج النصي أدناه بتنزيل مجموعات بيانات Roboflow 100 المدرجة في datasets_links.txt من Roboflow، ثم ضبط نموذج أساسي واحد بدقة (مثل YOLO26n) عبر المجموعة بأكملها في استدعاء model.train() واحد. يؤدي تمرير قائمة بمجموعات البيانات إلى ضبط النموذج الأساسي بدقة على كل منها على التوالي وتصور نتائج التقاطع بين مجموعات البيانات تلقائيًا.

import re
from pathlib import Path

from roboflow import Roboflow

from ultralytics import YOLO
from ultralytics.utils import ASSETS_URL, LOGGER, YAML
from ultralytics.utils.downloads import safe_download

# Download the RF100 datasets (requires a Roboflow API key)
rf = Roboflow(api_key="YOUR_ROBOFLOW_API_KEY")
safe_download(f"{ASSETS_URL}/datasets_links.txt")  # list of RF100 dataset links

datasets = []
for line in Path("datasets_links.txt").read_text().splitlines():
    try:
        _, _url, workspace, project, version = re.split("/+", line.strip())
        location = f"rf-100/{project}-{version}"
        rf.workspace(workspace).project(project).version(version).download("yolov8", location=location)
        yaml = Path(location) / "data.yaml"
        cfg = YAML.load(yaml)  # point train/val at the downloaded image folders
        cfg["train"], cfg["val"] = "train/images", "valid/images"
        YAML.save(yaml, cfg)
        datasets.append(str(yaml))
    except Exception as e:
        LOGGER.warning(f"Failed to prepare dataset from {line!r}: {e}")

# Fine-tune one base model across all RF100 datasets and visualize the cross-dataset results
model = YOLO("yolo26n.pt")
results = model.train(data=datasets, epochs=100, imgsz=640)  # {dataset: metrics}

# Per-dataset runs, multitrain_results.json (per-dataset + mean), and multitrain_results.png are saved
# together under runs/detect/multitrain. Read results in-memory or from the JSON for custom post-processing.
for dataset, metrics in results.items():
    if metrics:  # None if that dataset failed to train
        print(f"{dataset}: mAP50-95 = {metrics['metrics/mAP50-95(B)']:.4f}")

التطبيقات#

تعتبر مجموعة بيانات Roboflow 100 لا تُقدّر بثمن للعديد من التطبيقات المتعلقة بـ computer vision وdeep learning. يمكن للباحثين والمهندسين الاستفادة من هذا المعيار من أجل:

  • تقييم أداء نماذج اكتشاف الكائنات في سياق متعدد المجالات.
  • اختبار قدرة النماذج على التكيف وrobustness مع سيناريوهات العالم الحقيقي بما يتجاوز benchmark datasets الشائعة مثل COCO أو PASCAL VOC.
  • قياس قدرات نماذج اكتشاف الكائنات عبر مجموعات بيانات متنوعة، بما في ذلك المجالات المتخصصة مثل الرعاية الصحية، والصور الجوية، وألعاب الفيديو.
  • مقارنة أداء النموذج عبر بنيات neural network وتقنيات optimization المختلفة.
  • تحديد التحديات الخاصة بالمجال والتي قد تتطلب model training tips متخصصة أو أساليب fine-tuning مثل transfer learning.

لمزيد من الأفكار والإلهام حول التطبيقات الواقعية، استكشف أدلتنا حول المشاريع العملية أو تحقق من Ultralytics Platform لتبسيط model training وdeployment.

الاستخدام#

مجموعة بيانات Roboflow 100، بما في ذلك البيانات الوصفية وروابط التنزيل، متوفرة على مستودع GitHub الرسمي لـ Roboflow 100. يمكنك الوصول إلى مجموعة البيانات والاستفادة منها مباشرة من هناك لتلبية احتياجات القياس الخاصة بك. بمجرد تنزيل مجموعات البيانات وإعدادها كما هو موضح أعلاه، يمكن ضبط نماذج Ultralytics بدقة عبر المجموعة بأكملها في استدعاء model.train() واحد عن طريق تمرير قائمة YAMLs لمجموعة البيانات.

عينة من البيانات والتعليقات#

تتكون Roboflow 100 من مجموعات بيانات ذات صور متنوعة ملتقطة من زوايا ومجاعات مختلفة. فيما يلي أمثلة للصور المشروحة المضمنة في معيار RF100، والتي توضح تنوع الأجسام والمشاهد. يمكن لتقنيات مثل data augmentation تعزيز التنوع بشكل أكبر أثناء التدريب.

Roboflow 100 sample images with annotations

يمثل التنوع لوحظ في معيار Roboflow 100 تقدمًا كبيرًا مقارنة بالمعايير التقليدية، والتي تركز غالبًا على تحسين مقياس واحد داخل مجال محدود. يساعد هذا النهج الشامل في تطوير نماذج computer vision أكثر قوة وتنوعًا قادرة على الأداء بشكل جيد عبر عدد كبير من السيناريوهات المختلفة.

الاقتباسات والشكر#

إذا كنت تستخدم مجموعة بيانات Roboflow 100 في بحثك أو عملك التطويري، يرجى الاستشهاد بالورقة البحثية الأصلية:

اقتباس
@misc{rf100benchmark,
    Author = {Floriana Ciaglia and Francesco Saverio Zuppichini and Paul Guerrie and Mark McQuade and Jacob Solawetz},
    Title = {Roboflow 100: A Rich, Multi-Domain Object Detection Benchmark},
    Year = {2022},
    Eprint = {arXiv:2211.13523},
    url = {https://arxiv.org/abs/2211.13523}
}

نعرب عن امتناننا لفريق Roboflow وجميع المساهمين على جهودهم الكبيرة في إنشاء وصيانة مجموعة بيانات Roboflow 100 كمورد قيم لمجتمع الرؤية الحاسوبية.

إذا كنت مهتمًا باستكشاف المزيد من مجموعات البيانات لتعزيز مشاريع كشف الأجسام والتعلم الآلي لديك، فلا تتردد في زيارة مجموعة بياناتنا الشاملة، والتي تتضمن مجموعة متنوعة من detection datasets الأخرى.

الأسئلة الشائعة#

  • مجموعة بيانات Roboflow 100 هي معيار مرجعي لنماذج object detection. وهي تضم 100 مجموعة بيانات متنوعة تغطي مجالات مثل الرعاية الصحية، والصور الجوية، وألعاب الفيديو. تكمن أهميتها في توفير طريقة قياسية لاختبار قابلية التكيف للنماذج وقوتها عبر نطاق واسع من سيناريوهات العالم الحقيقي، متجاوزة المعايير التقليدية التي غالباً ما تكون محدودة المجال.

  • تمتد مجموعة بيانات Roboflow 100 عبر سبعة مجالات متنوعة، مما يوفر تحديات فريدة لنماذج object detection:

    1. الجوية: 7 مجموعات بيانات (على سبيل المثال، صور الأقمار الصناعية، مناظر الطائرات بدون طيار).
    2. ألعاب الفيديو: 7 مجموعات بيانات (على سبيل المثال، كائنات من بيئات ألعاب مختلفة).
    3. المجهرية: 11 مجموعة بيانات (على سبيل المثال، خلايا، جسيمات).
    4. تحت الماء: 5 مجموعات بيانات (على سبيل المثال، الحياة البحرية، الكائنات المغمورة).
    5. المستندات: 8 مجموعات بيانات (على سبيل المثال، مناطق النص، عناصر النماذج).
    6. الكهرومغناطيسية: 12 مجموعة بيانات (على سبيل المثال، توقيعات الرادار، تصورات البيانات الطيفية).
    7. العالم الحقيقي: 50 مجموعة بيانات (فئة واسعة تشمل الكائنات اليومية، المشاهد، التجزئة، إلخ).

    هذا التنوع يجعل من RF100 مورداً ممتازاً لتقييم generalizability الخاصة بنماذج الرؤية الحاسوبية.

  • عند استخدام مجموعة بيانات Roboflow 100، يرجى الاستشهاد بالورقة البحثية الأصلية لإعطاء الفضل للمبدعين. إليك صيغة الاستشهاد BibTeX الموصى بها:

    اقتباس
    @misc{rf100benchmark,
        Author = {Floriana Ciaglia and Francesco Saverio Zuppichini and Paul Guerrie and Mark McQuade and Jacob Solawetz},
        Title = {Roboflow 100: A Rich, Multi-Domain Object Detection Benchmark},
        Year = {2022},
        Eprint = {arXiv:2211.13523},
        url = {https://arxiv.org/abs/2211.13523}
    }

    لمزيد من الاستكشاف، فكر في زيارة مجموعة بياناتنا الشاملة أو تصفح detection datasets الأخرى المتوافقة مع نماذج Ultralytics.

التعليقات