مجموعة بيانات ImageNet#
مجموعة بيانات Ultralytics ImageNet (data="imagenet") هي مجموعة ImageNet-1k الفرعية / ILSVRC-2012 المستخدمة لتدريب نماذج تصنيف الصور وقياس أدائها. وتحتوي على 1,000 فئة من الكائنات مع 1,281,167 صورة تدريب و50,000 صورة تحقق بحجم صورة 224x224، ويبلغ حجم تنزيلها نحو 144 GB من البيانات. وتُعد قاعدة بيانات ImageNet الأوسع نطاقًا أكبر بكثير — إذ تضم أكثر من 14 مليون صورة عالية الدقة مشروحة بمجموعات WordNet عبر أكثر من 20,000 فئة — لكن Ultralytics تدرّب على مجموعة ILSVRC الموحّدة ذات الفئات البالغ عددها 1,000، والتي أصبحت المعيار الفعلي لـالتعلم العميق في الرؤية الحاسوبية.
نماذج ImageNet المدربة مسبقًا#
| النموذج | الحجم (بكسل) | الدقة top1 | الدقة top5 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) عند 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
الميزات الرئيسية#
- توفر مجموعة بيانات Ultralytics
imagenetعددًا قدره 1,000 فئة مع 1,281,167 صورة تدريب و50,000 صورة تحقق (ILSVRC-2012)، وهي المعيار القياسي للتدريب المسبق على تصنيف الصور. - تُنظَّم الفئات وفقًا لتسلسل WordNet الهرمي، حيث تتوافق كل فئة مع مجموعة synset (مجموعة من المصطلحات المترادفة).
- تُدرَّب النماذج على صور بحجم 224x224، ويبلغ حجم تنزيل مجموعة البيانات الكاملة ~144 GB.
- كان لتحدي التعرف البصري واسع النطاق السنوي ImageNet (ILSVRC) دور أساسي في النهوض بأبحاث الرؤية الحاسوبية.
بنية مجموعة البيانات#
تستخدم مجموعة بيانات Ultralytics ImageNet تقسيم ILSVRC-2012:
| التقسيم | الصور | الفئات |
|---|---|---|
| التدريب | 1,281,167 | 1,000 |
| التحقق | 50,000 | 1,000 |
تُخزَّن الصور في مجلدات منفصلة لكل فئة، وتُسمّى هذه المجلدات باستخدام معرّف مجموعة synset في WordNet (مثلًا، n01440764)، وهو التنظيم الذي تتوقعه عملية تدريب التصنيف في Ultralytics. وتتوافق كل فئة من الفئات البالغ عددها 1,000 مع مجموعة synset في WordNet، ولا يوجد تقسيم اختبار منفصل، ولذلك تُستخدم مجموعة التحقق المكوّنة من 50,000 صورة لقياس الدقة.
يتطلب ImageNet-1k تنزيلًا بحجم ~144 GB، لذا تأكد من توفر مساحة كافية على القرص قبل التدريب. ولإجراء تجارب سريعة، تستخدم مجموعتا ImageNette وImageNet10 الأصغر تنسيق المجلدات نفسه، ويمكن تدريبهما في جزء بسيط من الوقت.
تحدي التعرف البصري واسع النطاق السنوي ImageNet (ILSVRC)#
أتاح تحدي التعرف البصري واسع النطاق السنوي ImageNet (ILSVRC) للباحثين قياس أداء الخوارزميات على مجموعة بيانات موحّدة واسعة النطاق باستخدام مقاييس تقييم متسقة. وأسهم في تحقيق تطورات كبيرة في التعلم العميق لتصنيف الصور، واكتشاف الكائنات، ومهام الرؤية الأخرى — ولا سيما فوز AlexNet في عام 2012، الذي ساعد على إطلاق عصر التعلم العميق الحديث.
التطبيقات#
تُستخدم مجموعة بيانات ImageNet على نطاق واسع لتدريب نماذج التعلم العميق وتقييمها في تصنيف الصور، واكتشاف الكائنات، وتحديد مواضع الكائنات. وقد طُوِّرت معماريات رائدة مثل AlexNet وVGG وResNet، واختُبرت جميعها على ImageNet، ولا تزال الأوزان المدربة مسبقًا على ImageNet نقطة انطلاق شائعة للتعلم بالنقل عبر مهام الرؤية المختلفة.
الاستخدام#
لتدريب نموذج تصنيف YOLO على ImageNet لمدة 100 حقبة وبحجم صورة 224x224، استخدم مقتطفات التعليمات البرمجية أدناه. للحصول على قائمة شاملة بالوسائط المتاحة، راجع صفحة التدريب الخاصة بالنموذج.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)يمكنك أيضًا إدارة مجموعات بيانات التصنيف وتشغيل التدريب في السحابة باستخدام Ultralytics Platform.
الصور والتعليقات التوضيحية النموذجية#
تغطي مجموعة بيانات ImageNet الفئات الـ1,000 الخاصة بـ ILSVRC-2012، مما يوفر موردًا متنوعًا وشاملًا لتدريب نماذج الرؤية الحاسوبية وتقييمها. فيما يلي بعض الصور النموذجية من مجموعة البيانات:

الاقتباسات والشكر والتقدير#
إذا استخدمت مجموعة بيانات ImageNet في أعمالك البحثية أو التطويرية، يُرجى الاستشهاد بالورقة التالية:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}نود أن نتوجه بالشكر إلى فريق ImageNet، بقيادة Olga Russakovsky وJia Deng وLi Fei-Fei، على إنشاء مجموعة بيانات ImageNet وصيانتها باعتبارها موردًا قيّمًا لمجتمع أبحاث التعلم الآلي والرؤية الحاسوبية. لمزيد من المعلومات حول مجموعة بيانات ImageNet ومنشئيها، تفضل بزيارة موقع ImageNet.
الأسئلة الشائعة#
مجموعة بيانات ImageNet هي قاعدة بيانات صور واسعة النطاق، وتضم مجموعتها الأوسع أكثر من 14 مليون صورة عالية الدقة مشروحة بمجموعات synset في WordNet. وفي Ultralytics، يتدرب
data="imagenet"على مجموعة ILSVRC-2012 الفرعية الموحّدة ذات الفئات الـ1,000، وهي المعيار الفعلي للتدريب المسبق على تصنيف الصور. وقد دُرِّبت نماذج رائدة مثل AlexNet وVGG وResNet واختُبرت على ImageNet، مما يؤكد دورها في تطوير الرؤية الحاسوبية.تستخدم مجموعة بيانات Ultralytics
imagenetمجموعة ILSVRC-2012 الفرعية التي تضم 1,000 فئة و1,281,167 صورة تدريب و50,000 صورة تحقق بحجم صورة 224x224، ويبلغ إجمالي تنزيلها نحو 144 GB. وقاعدة بيانات ImageNet الكاملة أكبر بكثير (إذ تضم أكثر من 14 مليون صورة عبر أكثر من 20,000 مجموعة synset في WordNet)، لكن المجموعة الفرعية ذات الفئات الـ1,000 هي المستخدمة لتدريب التصنيف وقياس الأداء.لتدريب نموذج Ultralytics YOLO على ImageNet، حمّل نموذج تصنيف مدربًا مسبقًا وأشِر إلى
dataفيimagenet:مثال على التدريبfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)لمزيد من التعليمات المتعمقة حول التدريب، راجع صفحة التدريب لدينا.
توفر نماذج Ultralytics YOLO26 المدربة مسبقًا أداءً متطورًا من حيث السرعة والدقة لمختلف مهام الرؤية الحاسوبية. فعلى سبيل المثال، جرى تحسين نموذج YOLO26n-cls، الذي يحقق دقة top-1 تبلغ 71.4% ودقة top-5 تبلغ 90.1%، للتطبيقات الآنية. وتقلل النماذج المدربة مسبقًا الموارد الحاسوبية المطلوبة للتدريب من الصفر، كما تسرّع دورات التطوير. تعرّف على المزيد حول مقاييس أداء نماذج YOLO26 في قسم نماذج ImageNet المدربة مسبقًا.
أسهم تحدي التعرف البصري واسع النطاق السنوي ImageNet (ILSVRC) في دفع عجلة التطورات في الرؤية الحاسوبية من خلال توفير منصة تنافسية لتقييم الخوارزميات على مجموعة بيانات موحّدة واسعة النطاق. وشجعت مقاييس التقييم المتسقة الابتكار في تصنيف الصور، واكتشاف الكائنات، وتجزئة الصور، ودَفعت باستمرار حدود التعلم العميق والرؤية الحاسوبية.