رؤية YOLO 2026:

مقارنة بين YOLOX وYOLOv5#

يعد اختيار نموذج اكتشاف الكائنات المناسب قراراً حاسماً يحدد نجاح أي مشروع للرؤية الحاسوبية. يقدم هذا الدليل مقارنة تقنية شاملة بين نموذجين محوريين في مشهد الذكاء الاصطناعي وهما نموذج YOLOX من شركة Megvii ونموذج Ultralytics YOLOv5. من خلال تحليل بنياتهما، ومقاييس الأداء، وبيئات التدريب الخاصة بهما، نهدف إلى مساعدة المطورين والباحثين في اتخاذ خيار مدروس لبيئات نشرهم المحددة.

مقدمة عن النماذج#

ظهر كلا النموذجين خلال فترة من التقدم السريع في اكتشاف الأجسام في الوقت الفعلي، ومع ذلك اتخذا فلسفات معمارية مختلفة لتحقيق أدائهما.

YOLOX: نهج خالٍ من الصناديق المرجعية (Anchor-Free)#

تم إطلاق نموذج YOLOX بواسطة الباحثين تشينغ جي (Zheng Ge)، وسونغتاو ليو (Songtao Liu)، وفينغ وانغ (Feng Wang)، وزيمينغ لي (Zeming Li)، وجيان سون (Jian Sun) في شركة Megvii في 18 يوليو 2021، حيث أحدث تحولاً كبيراً بالابتعاد عن صناديق الربط التقليدية (anchor boxes). وكما هو موضح في التقرير التقني على موقع Arxiv، دمج YOLOX تصميماً خالياً من الصناديق المرجعية (anchor-free) مع رأس مفصول (decoupled head) واستراتيجية تعيين التسميات SimOTA. هدف هذا التصميم إلى ردم الهوة بين البحث الأكاديمي والتطبيق الصناعي، مقدماً أداءً قوياً على مجموعات البيانات القياسية.

اعرف المزيد عن YOLOX

YOLOv5: المعيار الذهبي لرؤية الذكاء الاصطناعي في الإنتاج#

تم تطوير نموذج YOLOv5 بواسطة غلين جوشر (Glenn Jocher) وتم إصداره بواسطة شركة Ultralytics في 26 يونيو 2020، ليصبح بسرعة معياراً صناعياً للرؤية الحاسوبية المنتجة. وبناءً بشكل أساسي على إطار عمل PyTorch، فقد ساهم في إضفاء الطابع الديمقراطي على الذكاء الاصطناعي المتقدم من خلال توفير سهولة استخدام لا مثيل لها، وتدريب سريع للغاية، ومستودع عالي الجودة. ركزت بنية YOLOv5 على تحقيق توازن مثالي بين السرعة، والدقة، وسولة النشر، مما جعله الخيار المفضل لكل شيء بدءاً من الأجهزة الطرفية وصولاً إلى عمليات نشر السحابة الضخمة.

اعرف المزيد عن YOLOv5

الاختلافات المعمارية#

يوضح فهم الاختلافات الميكانيكية الجوهرية بين هذه الشبكات سبب اختلاف أدائها عبر المهام المختلفة.

خالٍ من الصناديق المرجعية مقابل قائم على الصناديق المرجعية#

أبرز تباين هو آلية YOLOX الخالية من الصناديق المرجعية. تعتمد النماذج التقليدية مثل YOLOv5 على صناديق مرجعية محددة مسبقاً للتنبؤ بصناديق الإحاطة (bounding boxes)، وهو ما يتطلب تحليل تجميعي على مجموعة بيانات التدريب لتحديد أحجام الصناديق المرجعية المثلى. يلغي YOLOX هذا، حيث يتنبأ بإحداثيات صندوق الإحاطة مباشرة في كل موقع مكاني. في حين أن النهج الخالي من الصناديق المرجعية يقلل من عدد معلمات التصميم والضبط التجريبي، فإن نهج YOLOv5 القائم على الصناديق المرجعية والمُحسّن، مدعوماً بوظيفة الصناديق المرجعية التلقائية (auto-anchor)، يضمن تقارباً مستقراً وقابلاً للتنبؤ به في التدريب منذ البداية.

رأس منفصل (Decoupled Head) مقابل رأس مزدوج (Coupled Head)#

يستخدم YOLOX رأساً منفصلاً، مما يعني فصل مهام التصنيف والانحدار إلى فروع شبكة عصبية متميزة. جادل المؤلفون بأن هذا يحل النزاعات بين تعلم الميزات المكانية والدلالية. على العكس من ذلك، استخدم YOLOv5 رأساً مزدوجاً عالي الكفاءة (في إصداراته السابقة) والذي حقق أقصى قدر من الكفاءة الحسابية وقلل من زمن انتقال الاستدلال، وهو أمر بالغ الأهمية للحوسبة الطرفية في الوقت الفعلي.

التطور المعماري

بينما قاد YOLOX استخدام الرأس المفصول في عام 2021، قامت Ultralytics لاحقاً تبني وإتقان البنى المفصولة في النماذج اللاحقة مثل YOLOv8 ونموذج YOLO26 المتطور، جامعاً بذلك بين أفضل ما في العالميين.

استراتيجية تعيين التسميات#

يستخدم YOLOX استراتيجية SimOTA لتعيين التسميات، والتي تصيغ اقتران الكائنات الحقيقية بالتنبؤات كمسألة نقل أمثل. هذا التعيين الديناميكي يحسن التعامل مع المشاهد المزدحمة. يستخدم YOLOv5 تعييناً قوياً يعتمد على قواعد الشكل، مما يضمن تغذية عينات إيجابية عالية الجودة باستمرار إلى دالة الخسارة، وهو ما يساهم في استقراره الأسطوري في التدريب.

الأداء والمعايير القياسية#

المقايضة بين السرعة والدقة هي الاختبار النهائي لهذه البنى. يوضح الجدول أدناه أداء أحجام النماذج المختلفة على المعايير القياسية.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

بينما يحقق YOLOX درجات mAP تنافسية، خاصة في إصداراته الأكبر، يحافظ YOLOv5 على ميزة ملحوظة في سرعة استدلال TensorRT عبر جميع المستويات. يوفر نموذج YOLOv5s، على سبيل المثال، نسب سرعة إلى دقة استثنائية، مما يجعله مرغوباً للغاية للتطبيقات في الوقت الفعلي حيث يكون كل جزء من الثانية مهماً.

ميزة Ultralytics: التدريب وسهولة الاستخدام#

عند الانتقال من البحث إلى الإنتاج، غالباً ما يكون النظام البيئي المحيط بالنموذج بنفس أهمية النموذج نفسه. وهنا، تصبح مزايا نظام Ultralytics البيئي واضحة بشكل جلي.

تجربة مستخدم انسيابية#

يحظى YOLOv5 بإشادة عالمية لتجربة المطورين التي تمنحهم "الانطلاق السريع" (zero-to-hero). تتيح لك واجهة برمجة تطبيقات Python من Ultralytics وواجهة سطر الأوامر (CLI) تحميل النماذج وتدريبها ونشرها بأسطر برمجية قليلة. في المقابل، يتطلب تشغيل YOLOX من مستودع GitHub الخاص بـ Megvii تكويناً يدوياً أكبر لمتغيرات البيئة، وإعدادات مسار Python المعقدة، ومنحنى تعلم أكثر صعوبة وهو أمر معتاد في قواعد الأكواد البحثية الأكاديمية.

كفاءة التدريب ومتطلبات الذاكرة#

تم تصميم نماذج Ultralytics بدقة متناهية لتقليل استهلاك الذاكرة أثناء التدريب. يتطلب YOLOv5 ذاكرة CUDA أقل بكثير مقارنة بنماذج المحولات (transformers) كثيرة البارامترات مثل RT-DETR أو النماذج البحثية غير المُحسّنة. يتيح هذا للمطورين تدريب أحجام دفعات (batch sizes) أكبر على الأجهزة الاستهلاكية، مما يسرع دورة التطوير التكرارية.

تعدد الاستخدامات عبر المهام#

في حين أن YOLOX هو إطار عمل لاكتشاف الكائنات حصراً، فقد قام نظام Ultralytics بتطوير YOLOv5 لدعم مهام رؤية متعددة. وجاهزاً للاستخدام الفوري، يمكنك إجراء تصنيف الصور، وتجزئة المثيلات، واكتشاف الكائنات باستخدام نفس بناء واجهة برمجة التطبيقات (API) تماماً.

الابتكار المستمر

إذا كنت بحاجة إلى مهام أكثر تقدمًا مثل تقدير الوضعية أو اكتشاف صناديق التقييد الموجهة (OBB)، فإننا نوصي بشدة الترقية إلى أحدث بنية من Ultralytics YOLO26، والتي تدعم كل هذه المهام بشكل أساسي بدقة متطورة.

مقارنة الكود#

يتم إثبات الفرق في سهولة الاستخدام بشكل أفضل من خلال الكود.

التدريب باستخدام YOLOv5:

from ultralytics import YOLO

# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display results
results[0].show()

التدريب باستخدام YOLOX: (يتطلب استنساخ المستودع يدوياً، وتثبيت setup.py، ووسائط CLI معقدة)

# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -o

نهج Ultralytics يزيل التعقيد، مما يتيح لك التركيز على مجموعة البيانات الخاصة بك ومنطق التطبيق بدلاً من تصحيح أخطاء ملفات التكوين. علاوة على ذلك، يعد تتبع تجاربك أمراً سلساً مع عمليات التكامل المدمجة لكل من Weights & Biases وComet ML.

حالات الاستخدام المثالية والتطبيقات الواقعية#

يعتمد الاختيار بين هذه النماذج على بيئة التشغيل الخاصة بمشروعك.

أين يتفوق YOLOX#

يظل YOLOX مرشحاً قوياً في الأوساط الأكاديمية حيث يدرس الباحثون صراحةً نماذج خالية من الصناديق المرجعية أو استراتيجيات تعيين التسميات. كما أنه مفيد في السيناريوهات التي يكون فيها اكتشاف المشاهد المزدحمة هو المقياس الأساسي المطلق وتكون سرعات النشر على الحافة ثانوية.

أين يتفوق YOLOv5#

YOLOv5 هو البطل بلا منازع للنشر العملي.

  • التصنيع عالي السرعة: بالنسبة لـ اكتشاف العيوب على خطوط التجميع، يضمن الحد الأدنى من زمن الانتقال للاستدلال في YOLOv5 على وحدات معالجة الرسوميات الطرفية فحص المنتجات دون إبطاء حركة السير.
  • الطائرات بدون طيار والصور الجوية: تتيح بصمة الذاكرة الفعالة الخاصة به إمكانية التشغيل على أجهزة حاسوبية مصاحبة خفيفة الوزن على الطائرات بدون طيار لمهام مثل مراقبة الزراعة وتتبع الحياة البرية.
  • التجارة الذكية: بدءاً من الدفع الآلي وصولاً إلى إدارة المخزون، يصدر YOLOv5 بسهولة إلى TensorRT وONNX للنشر الجماعي عبر آلاف كاميرات المتاجر.

نتطلع للمستقبل: ميزة YOLO26#

بينما يعد YOLOv5 نموذجاً أسطورياً، فإن مجال الذكاء الاصطناعي يتقدم بسرعة. إذا كنت تبدأ مشروعاً جديداً اليوم، فإننا ننصح بشدة بالنظر إلى الجيل الأحدث من نماذج Ultralytics.

تم إصداره في عام 2026، ويمثل Ultralytics YOLO26 قفزة هائلة للأمام. فهو يتميز بـ تصميم شامل خالٍ من NMS (End-to-End NMS-Free Design)، مما يزيل تماماً الحاجة إلى معالجة لاحقة لكبح الحد الأقصى غير (Non-Maximum Suppression)، وهو ما يبسط بشكل جذري منطق النشر. من خلال إزالة خسارة التوزيع البؤري (DFL) والاستفادة من مُحسِّن MuSGD المتطور، يحقق YOLO26 استدلالاً أسرع على وحدة المعالجة المركزية بنسبة تصل إلى 43% مقارنة بالأجيال السابقة مع الحفاظ على دقة أعلى، لا سيما على الكائنات الصغيرة بفضل وظائف الخسارة الجديدة ProgLoss + STAL.

سواء اخترت الموثوقية المثبتة ميدانياً لـ YOLOv5 أو الأداء المتطور لـ YOLO26، فإن منصة Ultralytics تضمن لك الحصول على أفضل الأدوات المتاحة لنقل حلول الرؤية الحاسوبية الخاصة بك من المفهوم إلى الإنتاج بسلاسة. تأكد من استكشاف وثائق Ultralytics الشاملة لفتح الإمكانات الكاملة لخط أنابيب الذكاء الاصطناعي الخاص بك.

التعليقات