مجموعة بيانات ImageNet#
مجموعة بيانات Ultralytics ImageNet (data="imagenet") هي مجموعة بيانات فرعية ImageNet-1k / ILSVRC-2012 المستخدمة للتدريب وتقييم نماذج تصنيف الصور. وهي تحتوي على 1,000 فئة كائنات مع 1,281,167 صورة تدريب و50,000 صورة تحقق بحجم صورة 224x224، ويتم تنزيلها بحجم يبلغ حوالي 144 جيجابايت من البيانات. قاعدة بيانات ImageNet الأوسع أكبر بكثير — أكثر من 14 مليون صورة عالية الدقة مصنفة باستخدام مجموعات مرادفات WordNet عبر أكثر من 20,000 فئة — ولكن Ultralytics تتدرب على مجموعة فرعية ILSVRC القياسية المكونة من 1,000 فئة والتي أصبحت المعيار الفعلي لـ التعلم العميق في رؤية الكمبيوتر.
نماذج ImageNet المدربة مسبقاً#
| النموذج | الحجم (بكسل) | acc top1 | acc top5 | السرعة CPU ONNX (ms) | السرعة T4 TensorRT10 (ms) | المعلمات (M) | FLOPs (B) عند 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.5 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.6 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.9 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.2 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.6 |
الميزات الرئيسية#
- توفر مجموعة بيانات Ultralytics
imagenet1,000 فئة مع 1,281,167 صورة تدريب و50,000 صورة تحقق (ILSVRC-2012)، وهو معيار التدريب المسبقي القياسي لتصنيف الصور. - يتم تنظيم الفئات وفقًا لتسلسل WordNet الهرمي، حيث تتوافق كل فئة مع مجموعة مرادفات (مجموعة من المصطلحات المترادفة).
- يتم تدريب الصور بدقة 224x224، ومجموعة البيانات الكاملة عبارة عن تنزيل كبير بحجم ~144 جيجابايت.
- لقد كان تحدي التعرف البصري واسع النطاق السنوي من ImageNet (ILSVRC) فعالاً في دفع أبحاث الرؤية الحاسوبية قدماً.
هيكل مجموعة البيانات#
تستخدم مجموعة بيانات Ultralytics ImageNet تقسيم ILSVRC-2012:
| التقسيم (Split) | الصور | الفئات |
|---|---|---|
| التدريب | 1,281,167 | 1,000 |
| التحقق | 50,000 | 1,000 |
يتم تخزين الصور في مجلدات لكل فئة مسماة بواسطة معرف مجموعة مرادفات WordNet (على سبيل المثال، n01440764)، وهو التخطيط الذي يتوقعه تدريب تصنيف Ultralytics. ترتبط كل فئة من الفئات الـ 1,000 بمجموعة مرادفات WordNet، ولا يوجد تقسيم اختبار منفصل، لذلك يتم استخدام مجموعة التحقق المكونة من 50,000 صورة لقياس الدقة.
تعتبر مجموعة بيانات ImageNet-1k عملية تنزيل بحجم ~144 جيجابايت، لذا تأكد من توفر مساحة كافية على القرص لديك قبل التدريب. للتجارب السريعة، تستخدم المجموعات الفرعية الأصغر ImageNette وImageNet10 نفس تنسيق المجلد وتتدرب في جزء بسيط من الوقت.
تحدي التعرف البصري واسع النطاق من ImageNet (ILSVRC)#
أتاح تحدي التعرف البصري واسع النطاق ImageNet السنوي (ILSVRC) للباحثين تقييم الخوارزميات على مجموعة بيانات واسعة النطاق وموحدة مع مقاييس تقييم متسقة. لقد قاد تطورات كبرى في التعلم العميق لتصنيف الصور، واكتشاف الكائنات، وممهام الرؤية الأخرى — وأبرزها فوز AlexNet في عام 2012، والذي ساعد في إطلاق عصر التعلم العميق الحديث.
التطبيقات#
تُستخدم مجموعة بيانات ImageNet على نطاق واسع لتدريب وتقييم نماذج التعلم العميق لتصنيف الصور، واكتشاف الكائنات، وتحديد مواقع الكائنات. تم تطوير المعماريات البارزة مثل AlexNet، وVGG، وResNet وتقييمها جميعاً على ImageNet، وتبقى الأوزان المدربة مسبقاً على ImageNet نقطة بداية شائعة للتعلم المنقول عبر مهام الرؤية.
الاستخدام#
لتدريب نموذج تصنيف YOLO على ImageNet لمدة 100 حقبة تدريبية بحجم صورة 224x224، استخدم مقتطفات التعليمات البرمجية أدناه. للحصول على قائمة شاملة بالوسائط المتاحة، راجع صفحة التدريب للنموذج.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)يمكنك أيضاً إدارة مجموعات بيانات التصنيف وتشغيل التدريب في السحابة باستخدام منصة Ultralytics.
صور وشروحات توضيحية عينة#
تغطي مجموعة بيانات ImageNet فئات ILSVRC-2012 البالغ عددها 1,000 فئة، مما يوفر موردًا متنوعًا وشاملًا لتدريب وتقييم نماذج رؤية الكمبيوتر. إليك بعض الصور النموذجية من مجموعة البيانات:

الاقتباسات والشكر#
إذا كنت تستخدم مجموعة بيانات ImageNet في عملك البحثي أو التطويري، فيرجى الاستشهاد بالورقة البحثية التالية:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}نود أن نشكر فريق ImageNet، بقيادة أولغا روساكوفسكي، وبيتشنغ دينغ، ولي فاي فاي، لإنشاء والحفاظ على مجموعة بيانات ImageNet كورد مورِد قيّم لمجتمع أبحاث التعلم الآلي ورؤية الكمبيوتر. لمزيد من المعلومات حول مجموعة بيانات ImageNet ومبتكريها، تفضل بزيارة موقع ImageNet.
الأسئلة الشائعة#
تعتبر مجموعة بيانات ImageNet قاعدة بيانات صور واسعة النطاق تحتوي مجموعتها الأوسع على أكثر من 14 مليون صورة عالية الدقة مصنفة باستخدام مجموعات مرادفات WordNet. في Ultralytics، يتم التدريب على
data="imagenet"باستخدام مجموعة فرعية قياسية من ILSVRC-2012 تضم 1,000 فئة، وهي المعيار الفعلي للتدريب المسبق لـ تصنيف الصور. تم تدريب النماذج البارزة مثل AlexNet وVGG وResNet وتقييمها على ImageNet، مما يؤكد دورها في تقدم رؤية الكمبيوتر.تستخددم مجموعة بيانات Ultralytics
imagenetمجموعة البيانات الفرعية ILSVRC-2012 مع 1,000 فئة و1,281,167 صورة تدريب و50,000 صورة تحقق بحجم صورة 224x224، بإجمالي تنزيل يبلغ حوالي 144 جيجابايت. قاعدة بيانات ImageNet الكاملة أكبر بكثير (أكثر من 14 مليون صورة عبر أكثر من 20,000 مجموعة مرادفات لـ WordNet)، ولكن المجموعة الفرعية المكونة من 1,000 فئة هي تلك المستخدمة لتدريب التصنيف والتقييم.لتدريب نموذج Ultralytics YOLO على ImageNet، قم بتحميل نموذج تصنيف مدرب مسبقاً وقم بتوجيه
dataإلىimagenet:مثال على التدريبfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)لمزيد من إرشادات التدريب المتعمقة، راجع صفحة التدريب الخاصة بنا.
توفر النماذج المدربة مسبقاً من Ultralytics YOLO26 أداءً متطوراً من حيث السرعة والدقة لمهام رؤية الكمبيوتر المختلفة. على سبيل المثال، تم تحسين نموذج YOLO26n-cls، بدقة أعلى-1 تبلغ 71.4% ودقة أعلى-5 تبلغ 90.1%، للتطبيقات في الوقت الفعلي. تقلل النماذج المدربة مسبقاً الموارد الحسابية اللازمة للتدريب من الصفر وتسرع دورات التطوير. تعرف على المزيد حول مقاييس الأداء لنماذج YOLO26 في قسم النماذج المدربة مسبقاً لـ ImageNet.
أدى تحدي التعرف البصري واسع النطاق ImageNet السنوي (ILSVRC) إلى دفع التقدم في رؤية الكمبيوتر من خلال توفير منصة تنافسية لتقييم الخوارزميات على مجموعة بيانات واسعة النطاق وموحدة. لقد عززت مقاييس التقييم المتسقة الخاصة بها الابتكار في تصنيف الصور، واكتشاف الكائنات، وتجزئة الصور، مما دفع باستمرار حدود التعلم العميق ورؤية الكمبيوتر.