مقارنة بين YOLOv8 وRTDETRv2#
يتطور مجال الرؤية الحاسوبية باستمرار، إذ تدفع البنى الجديدة حدود ما يمكن تحقيقه في كشف الأجسام في الوقت الفعلي. ومن أبرز النموذجين اللذين حظيا باهتمام كبير Ultralytics YOLOv8 وRTDETRv2 من Baidu. يقدم هذا الدليل مقارنة تقنية شاملة بين هذين النموذجين القويين، مع استكشاف بنيتهما ومقاييس أدائهما وسيناريوهات النشر المثالية لهما.
نظرة عامة على YOLOv8#
يمثل Ultralytics YOLOv8 محطة مهمة في عائلة نماذج YOLO. ويستند إلى سنوات من الأبحاث الأساسية لتقديم سرعة ودقة وسهولة استخدام استثنائية لمجموعة واسعة من المهام.
الخصائص الرئيسية:
- المؤلفون: Glenn Jocher وAyush Chaurasia وJing Qiu
- المنظمة: Ultralytics
- التاريخ: 10 يناير 2023
- GitHub: مستودع Ultralytics
- الوثائق: وثائق YOLOv8
البنية ونقاط القوة#
يقدم YOLOv8 بنية مبسطة تعمل على تحسين كل من استخراج السمات وانحدار الصندوق المحيط. وهو كاشف لا يعتمد على المراسي، ما يبسط رأس التنبؤ ويقلل عدد تعديلات المعلمات الفائقة المطلوبة أثناء التدريب. وتضمن هذه البنية توازنًا ممتازًا في الأداء بين سرعة الاستدلال ومتوسط الدقة (mAP)، ما يجعلها مناسبة للغاية للنشر في العالم الحقيقي على كل من الأجهزة الطرفية والخوادم السحابية.
علاوة على ذلك، يتطلب YOLOv8 قدرات ذاكرة أقل بكثير أثناء التدريب مقارنة بالبنى القائمة على Transformer. ويتيح ذلك للمطورين تدريب النماذج على وحدات GPU استهلاكية قياسية من دون مواجهة أخطاء نفاد الذاكرة.
تعدد الاستخدامات#
تتمثل إحدى نقاط القوة المميزة لـYOLOv8 في تعدد استخداماته الأصلي. ففي حين تركز نماذج كثيرة على الصناديق المحيطة فقط، يوفر YOLOv8 دعمًا جاهزًا للاستخدام لـكشف الأجسام، وتجزئة المثيلات، وتصنيف الصور، وتقدير الوضعية، وكشف الصناديق المحيطة الموجّهة (OBB).
نظرة عامة على RTDETRv2#
يبني RTDETRv2 (محوّل الكشف في الوقت الفعلي، الإصدار 2) على RT-DETR الأصلي، مستهدفًا جلب آليات الانتباه القوية في محوّلات الرؤية إلى تطبيقات كشف الأجسام في الوقت الفعلي.
الخصائص الرئيسية:
- المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- Arxiv: 2407.17140
- GitHub: مستودع RT-DETR
- الوثائق: ملف README لـ RTDETRv2
البنية ونقاط القوة#
يستفيد RTDETRv2 من بنية هجينة تجمع بين عمود فقري لشبكة عصبية التفافية (CNN) وبنية مُشفّر-فكّ مشفّر قائمة على Transformer. ويتيح ذلك للنموذج التقاط العلاقات المكانية المعقدة والسياق الشامل من خلال آليات الانتباه الذاتي. وباستخدام مجموعة من استراتيجيات التدريب «المزايا المجانية»، يحقق RTDETRv2 درجات mAP تنافسية على مجموعات بيانات المعايير القياسية مثل مجموعة بيانات COCO.
نقاط الضعف#
على الرغم من دقته العالية، تؤدي طبيعة RTDETRv2 القائمة على Transformer إلى استهلاك أكبر للذاكرة وأوقات تدريب أبطأ مقارنة بالبنى القائمة بالكامل على CNN. وتتطلب محوّلات Transformer قدرًا أكبر من VRAM بطبيعتها، ما يجعل تدريبها صعبًا على الأجهزة محدودة الموارد. إضافة إلى ذلك، وعلى الرغم من قوة RTDETRv2 في الكشف، فإنه يفتقر إلى تعدد المهام، مثل الوضعية والتجزئة، المتأصل في منظومة Ultralytics.
مقارنة الأداء#
عند تقييم النماذج للإنتاج، تكون المفاضلة بين حجم النموذج وسرعة الاستدلال والدقة ذات أهمية قصوى. يقدم الجدول أدناه مقارنة مباشرة بين متغيرات YOLOv8 وRTDETRv2.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
قيسَت السرعات باستخدام مثيل Amazon EC2 P4d. واستفاد الاستدلال على CPU من ONNX، بينما اختُبرت سرعات GPU باستخدام TensorRT.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLOv8 وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلاتك المتعلقة بالمنظومة.
متى تختار YOLOv8#
يُعد YOLOv8 خيارًا قويًا من أجل:
- النشر متعدد المهام ومتعدد الاستخدامات: المشروعات التي تتطلب نموذجًا مُثبتًا لـالكشف والتجزئة والتصنيف وتقدير الوضعية ضمن منظومة Ultralytics.
- أنظمة الإنتاج الراسخة: بيئات الإنتاج الحالية المبنية مسبقًا على بنية YOLOv8، مع مسارات نشر مستقرة ومختبرة جيدًا.
- دعم واسع من المجتمع والمنظومة: التطبيقات التي تستفيد من البرامج التعليمية الشاملة لـYOLOv8، وعمليات التكامل التابعة لجهات خارجية، وموارد المجتمع النشطة.
متى تختار RT-DETR#
يوصى باستخدام RT-DETR في الحالات التالية:
- أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
- السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
- اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
ميزة Ultralytics#
يتجاوز اختيار النموذج المقاييس الخام؛ إذ إن منظومة البرمجيات المحيطة به ضرورية لإنتاجية المطورين. وتشتهر منظومة Ultralytics بسهولة استخدامها، إذ توفر API موحدًا لـPython يبسط دورة حياة تعلّم الآلة بأكملها.
بدءًا من إدارة مجموعات البيانات ووصولًا إلى التدريب الموزع، تجرد Ultralytics المطورين من تعقيدات الشيفرة البرمجية النمطية. ويستفيد المطورون من الأوزان المدرّبة مسبقًا والمتاحة بسهولة، ومن التكامل السلس مع منصات مثل Hugging Face وأدوات المراقبة. وتضمن هذه المنظومة المُدارة جيدًا التطوير النشط والتحديثات المتكررة والدعم القوي من المجتمع.
علاوة على ذلك، تُعد كفاءة التدريب سمة مميزة لنماذج Ultralytics YOLO. فهي محسّنة بدرجة كبيرة لتحقيق تقارب سريع وبصمة ذاكرة أقل أثناء عملية التدريب، ما يسرّع دورات التجريب بدرجة كبيرة مقارنة بالكواشف القائمة على Transformer مثل RTDETRv2.
استشراف المستقبل: قوة YOLO26#
مع بقاء YOLOv8 نموذجًا قويًا، ينبغي للمطورين الباحثين عن أحدث التقنيات على الإطلاق التفكير في الترقية إلى YOLO26 المرتقب بشدة، والذي صدر في يناير 2026. ويعيد YOLO26 تعريف أحدث ما توصلت إليه التقنية من خلال العديد من الابتكارات الرائدة:
- تصميم شامل من البداية إلى النهاية وخالٍ من NMS: يلغي YOLO26 المعالجة اللاحقة لقمع القيم غير العظمى (NMS)، ما يؤدي إلى سير عمل نشر أسرع وأكثر حتمية.
- إزالة DFL: تؤدي إزالة خسارة البؤرة التوزيعية إلى تبسيط النموذج وتحسين توافقه مع الأجهزة الطرفية والأجهزة منخفضة الطاقة.
- مُحسِّن MuSGD: من خلال دمج ابتكارات تدريب نماذج اللغة الكبيرة، يضمن مُحسِّن MuSGD عمليات تدريب أكثر استقرارًا وتقاربًا أسرع.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: مُحسّن بدرجة كبيرة للبيئات التي تفتقر إلى وحدات GPU مخصصة.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية للصور الجوية والروبوتات.
تشمل البدائل الحديثة الأخرى الجديرة بالاستكشاف ضمن مجموعة Ultralytics YOLO11، الذي يوفر أداءً قويًا للمشروعات القديمة، مع التوصية باستخدام YOLO26 لجميع عمليات النشر الجديدة.
مثال على التعليمات البرمجية: التدريب والاستدلال#
تعني بساطة API الخاص بـUltralytics أنه يمكنك تحميل النماذج وتدريبها ونشرها في بضعة أسطر فقط من شيفرة Python. تأكد من تثبيت PyTorch قبل تشغيل المثال التالي.
from ultralytics import YOLO
# Load a pretrained YOLOv8 small model
model = YOLO("yolov8s.pt")
# Train the model on your custom dataset
# Memory efficient training allows for larger batch sizes
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)
# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()
# Export seamlessly for edge deployment
export_path = model.export(format="onnx")تدعم Ultralytics عمليات التصدير بنقرة واحدة إلى العديد من التنسيقات، بما في ذلك ONNX وTensorRT وCoreML، ما يبسط خيارات نشر النماذج عبر بنيات الأجهزة المختلفة.
الخلاصة#
يوفر كل من YOLOv8 وRTDETRv2 إمكانات مقنعة لكشف الأجسام في الوقت الفعلي. ويبرهن RTDETRv2 على قوة Transformer في التقاط السياق الشامل، ما يجعله مناسبًا لمهام الاستدلال المكاني المعقدة التي لا تكون فيها سرعة الاستدلال واستهلاك الذاكرة الإضافي من القيود الأساسية.
ومع ذلك، يظلّت نماذج Ultralytics YOLO الخيار الأفضل للمطورين الذين يعطون الأولوية لتوازن استثنائي بين السرعة والدقة وكفاءة الموارد. وتجعل الطبيعة خفيفة الوزن لـYOLOv8، إلى جانب سهولة استخدامه الفائقة وتعدد استخداماته عبر مهام الرؤية المتعددة ومنظومته المزدهرة مفتوحة المصدر، منه الحل المفضل لبيئات الإنتاج القابلة للتوسع. أما الباحثون عن أقصى أداء ممكن على الأجهزة الطرفية، فيقدم لهم YOLO26 المُصدر حديثًا كفاءة لا مثيل لها وخالية من NMS، تواصل ريادتها في المجال.