YOLOX مقابل YOLOv5#
يُعد اختيار نموذج اكتشاف الكائنات المناسب قرارًا حاسمًا يحدد نجاح أي مشروع في مجال الرؤية الحاسوبية. يقدّم هذا الدليل مقارنة تقنية شاملة بين نموذجين محوريين في مشهد الذكاء الاصطناعي: YOLOX من Megvii وUltralytics YOLOv5. ومن خلال تحليل بنيتهما المعمارية ومقاييس الأداء ومنظومات التدريب الخاصة بهما، نهدف إلى مساعدة المطورين والباحثين على اتخاذ قرار مستنير يناسب بيئات النشر الخاصة بهم.
مقدمة إلى النماذج#
ظهر كلا النموذجين خلال فترة من التقدم السريع في اكتشاف الكائنات في الوقت الفعلي، إلا أنهما اتبعا فلسفتين معماريتين مختلفتين لتحقيق أدائهما.
YOLOX: نهج خالٍ من صناديق الارتساء#
أطلق الباحثون Zheng Ge وSongtao Liu وFeng Wang وZeming Li وJian Sun في Megvii نموذج YOLOX في 18 يوليو 2021، وقدّم تحولًا مهمًا من خلال الابتعاد عن صناديق الارتساء التقليدية. ووثّق الباحثون النموذج في التقرير التقني على Arxiv، حيث دمج YOLOX تصميمًا خاليًا من صناديق الارتساء مع رأس غير مقترن واستراتيجية إسناد التسميات SimOTA. وقد استهدف هذا التصميم ردم الفجوة بين البحث الأكاديمي والتطبيق الصناعي، مع تقديم أداء قوي على مجموعات البيانات القياسية.
YOLOv5: المعيار القياسي للذكاء الاصطناعي في الرؤية للإنتاج#
ألّف Glenn Jocher نموذج YOLOv5 وأطلقته Ultralytics في 26 يونيو 2020، وسرعان ما أصبح المعيار الصناعي للرؤية الحاسوبية المنشورة. وبُني أصلاً على إطار PyTorch، وقد أتاح الذكاء الاصطناعي المتقدم للجميع بفضل سهولة الاستخدام التي لا تضاهى، وسرعة التدريب الاستثنائية، والمستودع المصقول بدرجة عالية. ركزت بنية YOLOv5 على تحقيق توازن مثالي بين السرعة والدقة وسهولة النشر، مما جعله خيارًا مفضلًا لكل شيء بدءًا من الأجهزة الطرفية ووصولًا إلى عمليات النشر السحابية الضخمة.
الاختلافات المعمارية#
يوضح فهم الفروق الميكانيكية الأساسية بين هاتين الشبكتين سبب اختلاف أدائهما عبر المهام المتنوعة.
خالٍ من صناديق الارتساء مقابل قائم على صناديق الارتساء#
يتمثل الاختلاف الأكثر وضوحًا في آلية YOLOX الخالية من صناديق الارتساء. تعتمد النماذج التقليدية مثل YOLOv5 على صناديق ارتساء محددة مسبقًا للتنبؤ بالصناديق المحيطة، وهو ما يتطلب تحليل التجميع على مجموعة بيانات التدريب لتحديد أحجام صناديق الارتساء المثلى. يلغي YOLOX هذه الخطوة، إذ يتنبأ بإحداثيات الصندوق المحيط مباشرةً في كل موضع مكاني. وبينما يقلل النهج الخالي من صناديق الارتساء عدد معلمات التصميم والضبط الاستكشافي، يضمن النهج المحسّن القائم على صناديق الارتساء في YOLOv5، والمدعوم بوظيفة صناديق الارتساء التلقائية، تقاربًا مستقرًا وقابلًا للتنبؤ بدرجة كبيرة منذ البداية.
رأس غير مقترن مقابل رأس مقترن#
يستخدم YOLOX رأسًا غير مقترن، أي إن مهمتي التصنيف والانحدار منفصلتان في فرعين متميزين من الشبكة العصبية. وقد رأى المؤلفون أن هذا يحل التعارضات بين تعلم السمات المكانية والدلالية. في المقابل، استخدم YOLOv5 رأسًا مقترنًا عالي التحسين (في إصداراته الأولى) لتعظيم الكفاءة الحاسوبية وتقليل زمن استدلال، وهو أمر بالغ الأهمية للحوسبة الطرفية في الوقت الفعلي.
استراتيجية إسناد التسميات#
يستخدم YOLOX خوارزمية SimOTA لإسناد التسميات، إذ تصوغ مطابقة الكائنات الحقيقية بالتنبؤات على أنها مسألة نقل أمثل. ويحسن هذا الإسناد الديناميكي التعامل مع المشاهد المزدحمة. أما YOLOv5 فيستخدم إسنادًا متينًا قائمًا على قواعد الشكل، مما يضمن إدخال عينات موجبة عالية الجودة باستمرار إلى دالة الخسارة، ويسهم في استقرار تدريبه المشهود.
الأداء والمعايير القياسية#
يمثل المفاضلة بين السرعة والدقة الاختبار النهائي لهذه البنى. يوضح الجدول أدناه أداء أحجام النماذج المختلفة على المعايير القياسية.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
على الرغم من أن YOLOX يحقق درجات mAP تنافسية، لا سيما في إصداراته الأكبر، يحافظ YOLOv5 على أفضلية ملحوظة في سرعة الاستدلال باستخدام TensorRT عبر مختلف الأحجام. فعلى سبيل المثال، يقدّم نموذج YOLOv5s نسبًا استثنائية بين السرعة والدقة، مما يجعله مرغوبًا للغاية في التطبيقات الآنية التي تكون فيها كل ميلي ثانية مهمة.
ميزة Ultralytics: التدريب وسهولة الاستخدام#
عند الانتقال من البحث إلى الإنتاج، غالبًا ما تكون المنظومة المحيطة بالنموذج بأهمية النموذج نفسه. وهنا تصبح مزايا منظومة Ultralytics واضحة للغاية.
تجربة مستخدم مبسطة#
يحظى YOLOv5 بإشادة واسعة بفضل تجربة المطور التي تنقلك من "الصفر إلى الاحتراف". وتتيح واجهة Python البرمجية لـ Ultralytics وCLI تحميل النماذج وتدريبها ونشرها باستخدام أسطر برمجية مفردة. وعلى النقيض، يتطلب تشغيل YOLOX من مستودع Megvii على GitHub إعدادًا يدويًا أكبر لمتغيرات البيئة، وضبطًا معقدًا لمسارات Python، ومنحنى تعلم أكثر حدة، وهو أمر معتاد في قواعد شيفرة الأبحاث الأكاديمية.
كفاءة التدريب ومتطلبات الذاكرة#
تُهندس نماذج Ultralytics بعناية لتقليل استخدام الذاكرة أثناء التدريب. ويتطلب YOLOv5 ذاكرة CUDA أقل بكثير مقارنةً بنماذج Transformer كثيرة المعلمات مثل RT-DETR أو نماذج الأبحاث غير المحسّنة. ويتيح ذلك للمطورين تدريب أحجام دفعات أكبر على عتاد من فئة الأجهزة الاستهلاكية، مما يسرّع دورة التطوير التكرارية.
تعدد الاستخدامات عبر المهام#
في حين أن YOLOX إطار عمل مخصص بصرامة لاكتشاف الكائنات، تطورت منظومة Ultralytics لتجعل YOLOv5 يدعم مهام رؤية متعددة. فبمجرد التثبيت، يمكنك تنفيذ تصنيف الصور وتقسيم الكائنات واكتشاف الكائنات باستخدام صياغة API نفسها تمامًا.
إذا كنت تحتاج إلى مهام أكثر تقدمًا مثل تقدير الوضعية أو اكتشاف الصندوق المحيط الموجّه (OBB)، فنحن نوصي بشدة بالترقية إلى بنية Ultralytics YOLO26 الأحدث، التي تدعم هذه المهام جميعًا أصلاً بدقة متقدمة جدًا.
مقارنة الشيفرات#
يتضح الفرق في سهولة الاستخدام على أفضل نحو من خلال الشيفرة.
التدريب باستخدام YOLOv5:
from ultralytics import YOLO
# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")
# Display results
results[0].show()التدريب باستخدام YOLOX: (يتطلب استنساخ المستودع يدويًا، وتثبيت setup.py، ومعاملات CLI معقدة)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oيزيل نهج Ultralytics العوائق، مما يتيح لك التركيز على مجموعة بياناتك ومنطق تطبيقك بدلًا من تصحيح أخطاء ملفات الإعداد. علاوة على ذلك، تُعد متابعة تجاربك عملية سلسة بفضل التكاملات المضمنة مع Weights & Biases وComet ML.
حالات الاستخدام المثالية والتطبيقات الواقعية#
يعتمد الاختيار بين هذين النموذجين على بيئة التشغيل الخاصة بمشروعك.
المجالات التي يتفوق فيها YOLOX#
يبقى YOLOX مرشحًا قويًا في الأوساط الأكاديمية التي يدرس فيها الباحثون صراحةً النماذج الخالية من صناديق الارتساء أو استراتيجيات إسناد التسميات. كما يفيد في السيناريوهات التي يكون فيها اكتشاف المشاهد المزدحمة هو المقياس الأساسي على الإطلاق، بينما تأتي سرعات النشر الطرفي في مرتبة ثانوية.
أين يتفوق YOLOv5#
يُعد YOLOv5 البطل بلا منازع في مجال النشر العملي.
- التصنيع عالي السرعة: في اكتشاف العيوب على خطوط التجميع، يضمن زمن الاستدلال المنخفض الذي يحققه YOLOv5 على وحدات GPU الطرفية فحص المنتجات دون إبطاء سير الناقل.
- الصور الملتقطة بالطائرات والمسيّرات: يتيح استهلاكه الفعال للذاكرة تشغيله على حواسيب مرافقة خفيفة الوزن على متن الطائرات المسيّرة، لتنفيذ مهام مثل مراقبة الزراعة وتتبع الحياة البرية.
- التجزئة الذكية: بدءًا من الدفع الآلي ووصولًا إلى إدارة المخزون، يصدّر YOLOv5 بسهولة إلى TensorRT وONNX للنشر واسع النطاق عبر آلاف كاميرات المتاجر.
التطلع إلى المستقبل: ميزة YOLO26#
على الرغم من أن YOLOv5 نموذج أسطوري، يتقدم مجال الذكاء الاصطناعي بسرعة. وإذا كنت تبدأ مشروعًا جديدًا اليوم، فنحن ننصح بشدة بالنظر في أحدث جيل من نماذج Ultralytics.
أُطلق Ultralytics YOLO26 في عام 2026، ويمثل قفزة هائلة إلى الأمام. وهو يتميز بتصميم شامل من البداية إلى النهاية خالٍ من NMS، إذ يلغي تمامًا الحاجة إلى المعالجة اللاحقة لقمع غير الأعظمي، مما يبسّط منطق النشر بدرجة كبيرة. ومن خلال إزالة خسارة البؤرة التوزيعية (DFL) واستخدام محسّن MuSGD المتقدم، يحقق YOLO26 استدلالًا على CPU أسرع بنسبة تصل إلى 43% من الأجيال السابقة، مع الحفاظ على دقة أعلى، لا سيما في الكائنات الصغيرة بفضل دالتي الخسارة الجديدتين ProgLoss وSTAL.
سواء اخترت موثوقية YOLOv5 المجربة ميدانيًا أو أداء YOLO26 المتطور، تضمن منصة Ultralytics امتلاكك أفضل الأدوات المتاحة لنقل حلول الرؤية الحاسوبية من الفكرة إلى الإنتاج بسلاسة. واحرص على استكشاف وثائق Ultralytics الشاملة لإطلاق الإمكانات الكاملة لمسار الذكاء الاصطناعي لديك.