YOLOv5 مقابل RTDETRv2#
شهد مجال الرؤية الحاسوبية توسعًا كبيرًا خلال السنوات القليلة الماضية، ما أتاح للمطورين مجموعة واسعة من البنى لمعالجة المهام المرئية المعقدة. ومن بين أكثر النماذج الشائعة الشبكات العصبية الالتفافية (CNNs) ومحولات الاكتشاف (DETRs).
يقدم هذا الدليل مقارنة تقنية متعمقة بين نموذجين محوريين في هاتين الفئتين: Ultralytics YOLOv5، وهو نموذج فعّال للغاية واسع الانتشار قائم على CNN، وRTDETRv2، وهو كاشف أجسام آني قائم على Transformer ومن أحدث ما توصلت إليه التقنية.
Ultralytics YOLOv5: معيار الكفاءة في القطاع#
منذ إصداره، أصبح Ultralytics YOLOv5 ركيزة أساسية في مجتمع الذكاء الاصطناعي، إذ يدعم آلاف التطبيقات التجارية والمشاريع البحثية حول العالم. وقد بُني بالكامل على إطار عمل PyTorch، مع إعطاء الأولوية لتجربة مطور سهلة الاستخدام دون المساس بالأداء في الزمن الحقيقي.
الخصائص الرئيسية:
- المؤلف: Glenn Jocher
- الجهة: Ultralytics
- التاريخ: 2020-06-26
- الروابط: مستودع GitHub
البنية ومواطن القوة#
يستخدم YOLOv5 بنية CNN مبسطة صُممت لتعظيم كفاءة استخراج السمات مع الحفاظ على استهلاك منخفض للغاية للذاكرة. ويستخدم عمودًا فقريًا من CSPDarknet وعنقًا من PANet، ما يشكّل مزيجًا قويًا لدمج السمات متعددة المقاييس.
تتمثل إحدى المزايا الأساسية لـ YOLOv5 في التوازن بين الأداء. فهو يحقق توازنًا استثنائيًا بين السرعة والدقة، ما يجعله خيارًا مثاليًا لـنشر النماذج على الأجهزة محدودة الموارد مثل أجهزة NVIDIA Jetson والهواتف الذكية.
علاوة على ذلك، يتمتع YOLOv5 بـتعدد استخدامات لا مثيل له. فعلى خلاف النماذج التي تقتصر على التنبؤ بصناديق الإحاطة، يدعم YOLOv5 بطبيعته تصنيف الصور وتجزئة المثيلات، موفرًا إطار عمل موحدًا لمهام مرئية متنوعة. كما أن كفاءة تدريبه لافتة، إذ يتطلب ذاكرة CUDA أقل بكثير أثناء التدريب مقارنةً بالبنى القائمة على Transformer.
نقاط الضعف#
نظرًا إلى اعتماده على إطار CNN أقدم، يعتمد YOLOv5 بطبيعته على كبح غير الحد الأقصى (NMS) أثناء المعالجة اللاحقة لإزالة صناديق الإحاطة المكررة. وعلى الرغم من التحسين الكبير الذي يحظى به NMS ضمن إطار Ultralytics، فقد يتسبب أحيانًا في اختناقات زمن الاستجابة على وحدات NPU الطرفية المتخصصة.
RTDETRv2: المحولات الآنية من Baidu#
يمثل RTDETRv2 (محول الكشف في الزمن الحقيقي، الإصدار الثاني) قفزة كبيرة في تطبيق بنى Transformer على اكتشاف الأجسام في الزمن الحقيقي، إذ يعالج أوجه القصور الحاسوبية التي أثقلت تاريخيًا كواشف DETR القياسية.
الخصائص الرئيسية:
- المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
- الجهة: Baidu
- التاريخ: 2024-07-24
- روابط: ورقة Arxiv، مستودع GitHub
البنية ومواطن القوة#
يبني RTDETRv2 على النموذج السابق باستخدام مُرمِّز هجين وتصميم مفكّك ترميز مرن لمعالجة الصور. وتمنح آلية الانتباه الذاتي في Transformer النموذج فهمًا شاملًا لسياق الصورة، ما يتيح له أداءً استثنائيًا في المشاهد المعقدة التي تشهد حجبًا شديدًا للأجسام.
من السمات المحددة لـ RTDETRv2 تصميمه الشامل من البداية إلى النهاية والخالي من NMS. فمن خلال التنبؤ باستعلامات الأجسام مباشرةً دون الحاجة إلى صناديق المراسي أو المعالجة اللاحقة باستخدام NMS، يبسط النموذج مسار الاستدلال. وتحقق هذه البنية mAP (متوسط الدقة) مبهرة على مجموعات البيانات المرجعية مثل COCO.
نقاط الضعف#
على الرغم من قدراته على العمل في الزمن الحقيقي، فإن متطلبات الذاكرة لدى RTDETRv2 أعلى بكثير من نماذج YOLO. وتتزايد آليات الانتباه في نماذج Transformer تربيعيًا مع طول التسلسل، ما قد يؤدي إلى أخطاء نفاد الذاكرة أثناء التدريب عالي الدقة ما لم تُستخدم عناقيد GPU ضخمة. وإضافةً إلى ذلك، يفتقر النموذج إلى تعدد الاستخدامات الجاهز للاستخدام الذي توفره منظومة Ultralytics، إذ يركز أساسًا على اكتشاف الأجسام ثنائي الأبعاد دون دعم أصلي للتجزئة أو تقدير الوضعية.
جدول مقارنة الأداء#
لتقييم هذه البنى بموضوعية، جمعنا مقاييس أدائها. وتمثل القيم المظللة بخط عريض المقاييس الأعلى كفاءة أو أداءً عبر النطاقات المختبرة.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
مع أن RTDETRv2-x يحقق أعلى قيمة mAP مطلقة، فإنه يتطلب عددًا من المعلمات يزيد بنحو 40 مرة عن YOLOv5n. وفي التطبيقات عالية السرعة التي تعمل على أجهزة محدودة، توفر نماذج Ultralytics باستمرار أفضل كفاءة حاسوبية.
ميزة منظومة Ultralytics#
عند نقل نموذج من دفتر أبحاث إلى بيئة إنتاج، لا تقل أهمية البرمجيات المحيطة بالنموذج عن أهمية بنية الشبكة العصبية. يعمل النظام البيئي المُصان جيدًا الذي توفره Ultralytics على تسريع دورة التطوير بشكل كبير.
سهولة استخدام لا مثيل لها#
تعطي نماذج Ultralytics الأولوية لتجربة مستخدم مبسطة للغاية. سواء أكنت تريد تدريب نموذج مخصص أو إجراء التحقق من الصحة أو التصدير إلى تنسيقات خاصة بالأجهزة مثل TensorRT أو ONNX، فإن واجهة Python البرمجية من Ultralytics تتيح إنجاز ذلك باستخدام بضعة أسطر من التعليمات البرمجية فحسب.
فيما يلي مثال عملي على التعليمات البرمجية يوضح مدى سهولة تدريب نموذج Ultralytics وتشغيل الاستدلال به:
from ultralytics import YOLO
# تهيئة النموذج (تُنزَّل الأوزان تلقائيًا)
model = YOLO("yolov5su.pt") # YOLOv5u: أوزان YOLOv5 الخالية من المراسي لحزمة ultralytics
# تدريب النموذج على مجموعة بيانات COCO8
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")
# إجراء الاستدلال على صورة عبر الإنترنت
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")
# عرض الصورة الناتجة مع مربعات الإحاطة
inference_results[0].show()تدعم واجهة API الموحدة والبسيطة هذه تكاملات تتبّع التجارب محليًا مع أدوات مثل Weights & Biases وComet، ما يتيح للمطورين تسجيل المقاييس بسلاسة من دون كتابة تعليمات برمجية نمطية معقدة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLOv5 وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلات النظام البيئي.
متى تختار YOLOv5#
يُعد YOLOv5 خيارًا قويًا لما يلي:
- أنظمة إنتاج مُجرّبة: عمليات النشر القائمة التي تُقدّر سجل YOLOv5 الطويل في الاستقرار ووثائقه الشاملة ودعم مجتمعه الكبير.
- التدريب مع موارد محدودة: البيئات التي تعاني من محدودية موارد GPU، حيث يكون مسار التدريب الفعّال في YOLOv5 ومتطلباته الأقل للذاكرة مفيدين.
- دعم واسع لتنسيقات التصدير: المشاريع التي تتطلب النشر بتنسيقات عديدة، منها ONNX وTensorRT وCoreML وLiteRT.
متى تختار RT-DETR#
يوصى بـRT-DETR في الحالات التالية:
- أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
- سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
- كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
نظرة إلى المستقبل: YOLO11 وYOLO26#
إذا كنت تبدأ اليوم مشروعًا جديدًا في مجال الرؤية الحاسوبية، فمن المستحسن بشدة استكشاف أحدث أجيال نماذج Ultralytics.
مع أن YOLOv5 لا يزال موثوقًا للغاية، فإن YOLO11 يوفر دقة محسّنة ومجموعة أوسع من المهام، بما في ذلك اكتشاف مربعات الإحاطة الموجّهة (OBB).
والأهم من ذلك أن YOLO26 المتطور يجمع أفضل ما في العالمين. فهو يطبّق تصميمًا شاملًا من البداية إلى النهاية وخاليًا من NMS (طُبّق لأول مرة في YOLOv10)، ما يلغي عبء المعالجة اللاحقة مع الحفاظ على كفاءة CNN. كما يقدم YOLO26 محسّن MuSGD المستوحى من ابتكارات تدريب LLM، لتحقيق تقارب أسرع. وبفضل إزالة DFL (إزالة Distribution Focal Loss لتبسيط التصدير وتحسين التوافق مع الأجهزة الطرفية ومنخفضة الطاقة)، يوفر YOLO26 استدلالًا أسرع بنسبة تصل إلى 43% على CPU، ما يجعله الخيار الأفضل على الإطلاق للذكاء الاصطناعي الطرفي. إضافة إلى ذلك، توفر ProgLoss + STAL دوال خسارة محسّنة مع تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر أساسي لإنترنت الأشياء والروبوتات والصور الجوية.
الخلاصة#
يعتمد الاختيار بين YOLOv5 وRTDETRv2 بدرجة كبيرة على قيود النشر لديك. يوسّع RTDETRv2 حدود mAP باستخدام آليات انتباه قوية قائمة على Transformer، لكنه يتطلب تكلفة كبيرة من الذاكرة والموارد الحاسوبية.
في المقابل، يوفر Ultralytics YOLOv5 حلًا مجرّبًا ومحسّنًا بدرجة عالية ومتعدد الاستخدامات، يعمل بسلاسة في كل مكان، من الخوادم السحابية إلى المتحكمات الدقيقة. وبالنسبة إلى الفرق التي تبحث عن أعلى دقة ممكنة إلى جانب أدوات نشر سلسة، فإن الترقية إلى YOLO26 ضمن نظام Ultralytics البيئي توفر الحل الأحدث والأكثر تطورًا لتطبيقات الذكاء الاصطناعي للرؤية الحديثة.