مقارنة بين YOLOv5 وRTDETRv2#
شهد مجال الرؤية الحاسوبية توسعًا كبيرًا خلال السنوات القليلة الماضية، مما أتاح للمطورين مجموعة واسعة من البنى لمعالجة المهام البصرية المعقدة. ومن بين أكثر النماذج انتشارًا الشبكات العصبية الالتفافية (CNNs) ومحوّلات الكشف (DETRs).
يقدم هذا الدليل مقارنة تقنية معمقة بين نموذجين محوريين في هاتين الفئتين: Ultralytics YOLOv5، وهو نموذج قائم على CNN يتميز بكفاءة عالية واعتماد واسع، وRTDETRv2، وهو كاشف أجسام آني قائم على Transformer ومتطور للغاية.
Ultralytics YOLOv5: المعيار الصناعي للكفاءة#
منذ إصداره، أصبح Ultralytics YOLOv5 ركيزة أساسية في مجتمع الذكاء الاصطناعي، إذ يشغّل آلاف التطبيقات التجارية والمشروعات البحثية حول العالم. وقد بُني بالكامل على إطار عمل PyTorch، مع إعطاء الأولوية لتجربة مطور بديهية دون المساس بالأداء الآني.
الخصائص الرئيسية:
- المؤلف: Glenn Jocher
- المنظمة: Ultralytics
- التاريخ: 2020-06-26
- الروابط: مستودع GitHub
البنية ونقاط القوة#
يستخدم YOLOv5 بنية CNN مبسطة مصممة لتعظيم كفاءة استخراج السمات مع الحفاظ على بصمة ذاكرة منخفضة للغاية. ويستخدم عمودًا فقريًا من نوع CSPDarknet وعنقًا من نوع PANet، مما ينشئ توليفة قوية لدمج السمات متعددة المقاييس.
تتمثل إحدى المزايا الأساسية لـ YOLOv5 في توازن الأداء. فهو يحقق موازنة استثنائية بين السرعة والدقة، مما يجعله خيارًا مثاليًا لـنشر النماذج على الأجهزة محدودة الموارد، مثل أجهزة NVIDIA Jetson والهواتف الذكية.
علاوة على ذلك، يتميز YOLOv5 بـتعدد استخدامات لا مثيل له. فعلى خلاف النماذج المقيدة بصرامة بتنبؤات مربعات الإحاطة، يدعم YOLOv5 أصلاً تصنيف الصور وتجزئة الكائنات، مما يوفر إطارًا موحدًا لمهام بصرية متنوعة. كما أن كفاءة التدريب لديه لافتة، إذ يتطلب قدرًا أقل بكثير من ذاكرة CUDA أثناء التدريب مقارنة بالبنى القائمة على Transformer.
نقاط الضعف#
نظرًا لاعتماده على إطار CNN أقدم، يعتمد YOLOv5 بطبيعته على القمع غير الأقصى (NMS) أثناء المعالجة اللاحقة للتخلص من مربعات الإحاطة المكررة. ورغم أن NMS محسّن بدرجة كبيرة ضمن إطار Ultralytics، فإنه قد يسبب أحيانًا اختناقات في زمن الاستجابة على وحدات NPU الطرفية المتخصصة.
RTDETRv2: محوّلات في الزمن الحقيقي من Baidu#
يمثل RTDETRv2 (محوّل الكشف في الوقت الفعلي الإصدار 2) قفزة كبيرة في تطبيق بنى Transformer على كشف الأجسام في الوقت الفعلي، إذ يعالج أوجه القصور الحسابية التي عانت منها DETRs التقليدية تاريخيًا.
الخصائص الرئيسية:
- المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- الروابط: ورقة Arxiv، مستودع GitHub
البنية ونقاط القوة#
يبني RTDETRv2 على سابقه باستخدام مُرمّز هجين وتصميم مُفكّك ترميز مرن لمعالجة الصور. وتمنح آلية الانتباه الذاتي في Transformer النموذج فهمًا شاملًا لسياق الصورة، مما يتيح له أداءً متميزًا في المشاهد المعقدة التي تشهد حجبًا شديدًا للأجسام.
تتمثل إحدى السمات المميزة لـ RTDETRv2 في تصميمه الشامل الخالي من NMS. فمن خلال التنبؤ باستعلامات الأجسام مباشرةً دون الحاجة إلى مربعات الارتساء أو معالجة لاحقة باستخدام NMS، فإنه يبسط مسار الاستدلال. وتحقق هذه البنية قيمة mAP (متوسط الدقة المطلقة) مثيرة للإعجاب على مجموعات بيانات معيارية مثل COCO.
نقاط الضعف#
على الرغم من قدراته الآنية، فإن RTDETRv2 لديه متطلبات ذاكرة أعلى بكثير مقارنةً بنماذج YOLO. إذ تتوسع آليات الانتباه في Transformer تربيعيًا مع طول التسلسل، مما قد يؤدي إلى أخطاء نفاد الذاكرة أثناء التدريب عالي الدقة ما لم تُستخدم عناقيد GPU ضخمة. إضافةً إلى ذلك، يفتقر إلى تعدد الاستخدامات الجاهز للاستخدام الذي يميز منظومة Ultralytics، إذ يركز أساسًا على كشف الأجسام ثنائي الأبعاد دون دعم أصلي للتجزئة أو تقدير الوضعية.
جدول مقارنة الأداء#
لتقييم هذه البنى بموضوعية، جمعنا مقاييس أدائها. وتمثل القيم المميزة بخط عريض المقاييس الأكثر كفاءة أو الأعلى أداءً عبر المقاييس المختبرة.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
رغم أن RTDETRv2-x يحقق أعلى قيمة mAP مطلقة، فإنه يتطلب عددًا من المعلمات يقارب 30 ضعفًا لعدد معلمات YOLOv5n. وبالنسبة إلى التطبيقات عالية السرعة التي تعمل على أجهزة محدودة، تقدم نماذج Ultralytics باستمرار أفضل كفاءة حسابية.
ميزة منظومة Ultralytics#
عند نقل نموذج من دفتر بحثي إلى بيئة إنتاج، تكون البرمجيات المحيطة بالنموذج بأهمية بنية الشبكة العصبية نفسها. وتسرّع المنظومة المُدارة جيدًا التي توفرها Ultralytics دورة حياة التطوير بدرجة كبيرة.
سهولة استخدام لا مثيل لها#
تعطي نماذج Ultralytics الأولوية لتجربة مستخدم بالغة السلاسة. سواء أردت تدريب نموذج مخصص، أو إجراء التحقق، أو التصدير إلى تنسيقات خاصة بالأجهزة مثل TensorRT أو ONNX، فإن واجهة Python البرمجية من Ultralytics تجعل ذلك ممكنًا في بضعة أسطر من التعليمات البرمجية فقط.
إليك مثال عملي على التعليمات البرمجية يوضح مدى سهولة تدريب نموذج من Ultralytics وإجراء الاستدلال به:
from ultralytics import YOLO
# Initialize the model (automatically downloads the weights)
model = YOLO("yolov5s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")
# Perform inference on an online image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
inference_results[0].show()تدعم واجهة API الموحدة والبسيطة هذه أصلاً عمليات التكامل الخاصة بـتتبع التجارب مع أدوات مثل Weights & Biases وComet، مما يتيح للمطورين تسجيل المقاييس بسلاسة دون كتابة تعليمات برمجية تمهيدية معقدة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLOv5 وRT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلاتك المتعلقة بالمنظومة.
متى تختار YOLOv5#
يُعد YOLOv5 خيارًا قويًا من أجل:
- أنظمة الإنتاج المجربة: عمليات النشر الحالية التي تُقدّر سجل YOLOv5 الطويل من الاستقرار، ووثائقه الشاملة، والدعم الواسع من المجتمع.
- التدريب في ظل قيود الموارد: البيئات ذات موارد GPU المحدودة، حيث توفر مسارات تدريب YOLOv5 الفعالة ومتطلبات الذاكرة الأقل مزايا مهمة.
- دعم موسّع لتنسيقات التصدير: المشاريع التي تتطلب النشر عبر العديد من التنسيقات، بما في ذلك ONNX وTensorRT وCoreML وTFLite.
متى تختار RT-DETR#
يوصى باستخدام RT-DETR في الحالات التالية:
- أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
- السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
- اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
التطلع إلى المستقبل: YOLO11 وYOLO26#
إذا كنت تبدأ مشروع رؤية جديدًا اليوم، فمن المستحسن بشدة استكشاف أحدث أجيال نماذج Ultralytics.
مع أن YOLOv5 يظل موثوقًا للغاية، فإن YOLO11 يوفر دقة محسّنة ومجموعة موسعة من المهام، بما في ذلك كشف مربع الإحاطة الموجّه (OBB).
والأهم من ذلك أن YOLO26 المتطور يجمع أفضل ما في العالمين. فهو يطبق تصميمًا شاملًا خاليًا من NMS (طُرح للمرة الأولى في YOLOv10)، مما يلغي النفقات العامة للمعالجة اللاحقة مع الحفاظ على كفاءة CNN. ويقدم YOLO26 أيضًا مُحسِّن MuSGD المستوحى من ابتكارات تدريب LLM، لتحقيق تقارب أسرع. ومع إزالة DFL (إزالة خسارة البؤرة التوزيعية لتبسيط التصدير وتحسين التوافق مع الأجهزة الطرفية ومنخفضة الطاقة)، يحقق YOLO26 استدلالًا أسرع على CPU بنسبة تصل إلى 43%، مما يجعله الخيار الأفضل على الإطلاق للذكاء الاصطناعي الطرفي. بالإضافة إلى ذلك، يوفر ProgLoss + STAL دوال خسارة محسّنة مع تحسينات ملحوظة في التعرف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لإنترنت الأشياء والروبوتات والصور الجوية.
الخلاصة#
يعتمد الاختيار بين YOLOv5 وRTDETRv2 بدرجة كبيرة على قيود النشر لديك. إذ يدفع RTDETRv2 حدود mAP باستخدام آليات انتباه Transformer القوية، لكنه يأتي بتكلفة مرتفعة من حيث الذاكرة والنفقات الحسابية العامة.
وعلى العكس، يقدم Ultralytics YOLOv5 حلًا مثبتًا ومحسّنًا بدرجة عالية ومتعدد الاستخدامات، ويعمل بسلاسة في كل مكان—من خوادم السحابة إلى المتحكمات الدقيقة. وبالنسبة إلى الفرق التي تبحث عن أعلى دقة ممكنة إلى جانب أدوات نشر سلسة، فإن الترقية ضمن منظومة Ultralytics إلى YOLO26 توفر الحل المتطور الحاسم لتطبيقات الذكاء الاصطناعي للرؤية الحديثة.