مقارنة RTDETRv2 وPP-YOLOE+#
أفرز المجال سريع التطور للرؤية الحاسوبية أساليب معمارية متنوعة لحل تحديات اكتشاف الأجسام في الوقت الفعلي المعقدة. ومن أبرز التطورات الحديثة RTDETRv2 وPP-YOLOE+، وهما نموذجان قويان يت approachان التعرّف البصري وفق فلسفتين تصميميتين مختلفتين جذريًا. وبينما يهدف كلا النموذجين إلى توفير اكتشاف عالي الأداء، فإن آلياتهما الأساسية، ونماذج التدريب الخاصة بهما، وسيناريوهات النشر المثالية لهما تختلف اختلافًا كبيرًا.
يتعمق هذا الدليل الشامل في الفروق التقنية الدقيقة بين النموذجين، ويقارن بين معماريتيهما ومقاييس أدائهما ودعم النظام البيئي لهما، لمساعدة المطورين والباحثين على اختيار الحل الأمثل لاحتياجات النشر الخاصة بهم.
نظرة عامة على النماذج#
قبل تحليل بيانات الأداء، من المهم فهم أصول كل نموذج وأهدافه المعمارية. فكلاهما نشأ على يد فرق بحثية في Baidu، إلا أنهما يمثلان فرعين مختلفين من شجرة عائلة اكتشاف الأجسام.
RTDETRv2#
يمثل RTDETRv2 قفزة مهمة في معماريات الرؤية القائمة على Transformer. واستنادًا إلى Transformer للكشف في الوقت الفعلي الأصلي، فإنه يستفيد من بنية أساسية مرنة لمحوّل الرؤية مقترنة بمشفّر هجين فعال. وتتمثل أبرز خصائصه في قدرته الأصلية على التنبؤ من البداية إلى النهاية، ما يلغي تمامًا الحاجة إلى قمع القيم غير العظمى (NMS) أثناء المعالجة اللاحقة.
- المؤلفون: وينيو ليف (Wenyu Lv)، ويان تشاو (Yian Zhao)، كينياو تشانغ (Qinyao Chang)، كوي هوانغ (Kui Huang)، غوانغتشونغ وانغ (Guanzhong Wang)، ويي ليو (Yi Liu)
- المنظمة: Baidu
- التاريخ: 2024-07-24
- Arxiv: 2407.17140
- GitHub: مستودع RT-DETR
PP-YOLOE+#
يُعد PP-YOLOE+ إصدارًا متقدمًا من سلسلة YOLO، وقد جرى تحسينه بدرجة كبيرة للتطبيقات الصناعية عالية الأداء. ويتميز بمعمارية CNN قابلة للتوسع مع رأس كشف خالٍ من المراسي. وصُمم لتوفير موازنة استثنائية بين السرعة والدقة، كما يقدم تقنيات قوية مثل رأس ET ودالة خسارة بؤرية معممة لتحسين اكتشاف الأجسام الصغيرة.
- المؤلف: مؤلفو PaddlePaddle
- الجهة: Baidu
- التاريخ: 2022-04-02
- Arxiv: 2203.16250
- GitHub: مستودع PaddleDetection
على الرغم من أن لكل من النموذجين مستودعًا بحثيًا مستقلًا، يمكنك بسهولة تجربة RTDETRv2 مباشرةً ضمن حزمة Ultralytics Python، والاستفادة من API موحّدة وخيارات تصدير مبسطة.
الاختلافات المعمارية#
يكمن الفرق الأساسي بين هذين النموذجين في كيفية معالجتهما للسياق البصري وتوليد التنبؤات.
يستخدم PP-YOLOE+ بنية أساسية تقليدية لكنها محسّنة بدرجة كبيرة من CNN. ويعتمد على المجالات الاستقبالية المحلية لاستخراج الميزات، ما يجعله سريعًا وفعالًا للغاية في عمليات النشر القياسية. إلا أنه لا يزال يتطلب معالجة لاحقة قياسية باستخدام NMS لتصفية مربعات الإحاطة المتداخلة، وهو ما قد يؤدي إلى اختناقات في زمن الاستجابة في المشاهد الكثيفة.
وعلى العكس، يستخدم RTDETRv2 مشفّرًا هجينًا ومفكك ترميز من Transformer. ويتيح ذلك للنموذج التقاط السياق العام عبر الصورة بأكملها في الوقت نفسه. وتفهم آليات الانتباه بطبيعتها العلاقات بين الأجسام، مما يمكّن النموذج من إخراج مربعات الإحاطة النهائية مباشرةً دون NMS. ويضمن هذا النهج من البداية إلى النهاية زمن استدلال ثابتًا بغض النظر عن عدد الأجسام المكتشفة.
مقاييس الأداء والمقارنة#
عند تقييم مقاييس أداء YOLO، من الضروري تحقيق توازن بين الدقة (mAP) والتكلفة الحسابية (FLOPs) وسرعة الاستدلال. يسلط الجدول أدناه الضوء على أداء كلا النموذجين عبر أحجام مختلفة.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
على الرغم من أن PP-YOLOE+x يحقق mAPval أعلى هامشيًا بنسبة 54.7% على مجموعة بيانات COCO، فإن نماذج RTDETRv2 توفر عمومًا دقة تنافسية مع ميزة إضافية تتمثل في زمن استجابة ثابت بفضل تصميمها الخالي من NMS. ومع ذلك، يحافظ PP-YOLOE+ على تفوق واضح في عدد المعلمات وFLOPs بالنسبة إلى النماذج الأصغر، مما يجعله فعالًا للغاية لعمليات النشر الطرفية.
ميزة Ultralytics: تقديم YOLO26#
على الرغم من أن RTDETRv2 وPP-YOLOE+ يتمتعان بقدرات قوية كلٌّ على حدة، فإن أحدث ما توصل إليه المجال واصل تطوره. وبالنسبة إلى المطورين الذين يسعون إلى تحقيق التوازن الأمثل بين السرعة والدقة ودعم النظام البيئي، يمثل Ultralytics YOLO26 المعيار الصناعي الجديد.
يجمع YOLO26 أفضل جوانب كلٍّ من CNN وTransformer. ويعتمد تصميم من البداية إلى النهاية وخالٍ من NMS الذي ابتكرته المعماريات الحديثة، مما يلغي اختناقات المعالجة اللاحقة بفاعلية. علاوةً على ذلك، يقدم مُحسِّن MuSGD الثوري، وهو نهج هجين مستوحى من ابتكارات تدريب LLM، يضمن تدريبًا مستقرًا للغاية وتقاربًا سريعًا.
على عكس نماذج Transformer الثقيلة التي تتطلب قدرًا كبيرًا من ذاكرة CUDA، يتميز YOLO26 بـ إزالة DFL (خسارة التركيز التوزيعي)، وقد جرى تحسينه خصيصًا للحوسبة الطرفية، إذ يوفر استدلالًا أسرع على CPU بنسبة تصل إلى 43% مقارنةً بالأجيال السابقة.
إضافةً إلى ذلك، لا يقتصر YOLO26 على اكتشاف الأجسام البسيط. فهو متعدد الاستخدامات بطبيعته، ويدعم تقسيم الكائنات وتقدير الوضعيات ومربعات الإحاطة الموجّهة (OBB) مباشرةً، بينما يركز PP-YOLOE+ أساسًا على اكتشاف مربعات الإحاطة.
منهجيات التدريب والمنظومة#
تتألق منظومة Ultralytics حقًا مقارنةً بالمستودعات البحثية المستقلة في كفاءة التدريب وسهولة الاستخدام. فبينما يعتمد PP-YOLOE+ على إطار عمل PaddlePaddle، ويتطلب RTDETRv2 غالبًا إعدادات بيئة معقدة، يوفر دمج النماذج عبر Ultralytics تجربة سلسة.
من خلال API الخاصة بـ Ultralytics، تستفيد من متطلبات ذاكرة أقل أثناء التدريب، ومعالجة آلية لمجموعات البيانات، وضبط مبسط للمعلمات الفائقة. علاوةً على ذلك، يمكن نشر النماذج بتنسيقات الإنتاج مثل ONNX أو TensorRT باستخدام أمر واحد.
مثال برمجي: استدلال مبسّط#
فيما يلي عرض توضيحي لمدى سهولة استخدام RTDETRv2 إلى جانب نموذج YOLO26 الموصى به باستخدام حزمة Ultralytics Python:
from ultralytics import RTDETR, YOLO
# Initialize the RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Perform NMS-free inference on a test image
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()
# For superior speed and versatility, initialize the latest YOLO26 model
model_yolo26 = YOLO("yolo26n.pt")
# Train the YOLO26 model effortlessly with optimized memory usage
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)
# Export to TensorRT for edge deployment
model_yolo26.export(format="engine")التطبيقات وحالات الاستخدام في العالم الحقيقي#
غالبًا ما يعتمد الاختيار بين هاتين المعمارّيتين على متطلبات العتاد والتطبيق المحددة.
- يتفوق RTDETRv2 في البيئات من جهة الخادم وفهم المشاهد المعقدة. وتجعل آلية الانتباه العامة الخاصة به فعّالة للغاية في إدارة الحشود وتحليل الصور الطبية الكثيف، حيث تتسبب الأجسام المتداخلة عادةً في فشل خوارزميات NMS القياسية.
- يناسب PP-YOLOE+ بدرجة كبيرة الفحص الصناعي عالي السرعة والبيئات التي استثمرت بكثافة في منظومة PaddlePaddle. كما أن انخفاض عدد المعلمات في المقاييس الأصغر يجعله ملائمًا لبعض تطبيقات الروبوتات.
- يُعد Ultralytics YOLO26 الحل الموصى به عالميًا للنشر التجاري الشامل. وبفضل دوال ProgLoss + STAL المحسّنة، فإنه يحسن بدرجة كبيرة التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لـعمليات الطائرات المسيّرة ومراقبة حركة المرور في المدن الذكية.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين RT-DETR وPP-YOLOE+ على متطلبات مشروعك المحددة وقيود النشر وتفضيلات النظام البيئي.
متى تختار RT-DETR#
يُعد RT-DETR خيارًا قويًا من أجل:
- أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
- السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
- اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.
متى تختار PP-YOLOE+#
يوصى باستخدام PP-YOLOE+ في الحالات التالية:
- التكامل مع منظومة PaddlePaddle: المؤسسات التي تمتلك بنية تحتية قائمة على إطار عمل وأدوات PaddlePaddle الخاصة بـBaidu.
- النشر الطرفي باستخدام Paddle Lite: النشر على عتاد مزود بنوى استدلال محسّنة بدرجة كبيرة خصيصًا لمحرك Paddle Lite أو محرك Paddle للاستدلال.
- الاكتشاف عالي الدقة من جانب الخادم: السيناريوهات التي تعطي الأولوية لأقصى دقة اكتشاف على خوادم GPU قوية، حيث لا يمثل الاعتماد على إطار العمل مصدر قلق.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
الخلاصة#
دفع كلٌّ من RTDETRv2 وPP-YOLOE+ حدود ما يمكن تحقيقه في الرؤية الحاسوبية، وأثبتا جدوى كلٍّ من معماريات Transformer وCNN المحسّنة بدرجة كبيرة. إلا أن تعقيد نشر قواعد الشيفرة البحثية المجزأة قد يعيق الجداول الزمنية للإنتاج.
بالنسبة إلى مهندسي الذكاء الاصطناعي المعاصرين، يوفر الاستفادة من منصة Ultralytics ميزة لا مثيل لها. ومن خلال الانتقال إلى نماذج متكاملة بسلاسة مثل YOLO11 أو YOLO26 المتطور، يمكن للفرق تحقيق أعلى نسب ممكنة بين الدقة والسرعة، مع تقليل متطلبات الذاكرة والأعباء التطويرية بدرجة كبيرة.