RTDETRv2 مقابل PP-YOLOE+#
أنتج مجال الرؤية الحاسوبية سريع التطور مناهج معمارية متنوعة لمعالجة تحديات اكتشاف الأجسام في الوقت الفعلي المعقدة. ومن أبرز التطورات الحديثة RTDETRv2 وPP-YOLOE+، وهما نموذجان قويان يتبعان فلسفتين تصميميتين مختلفتين جذريًا للتعرف البصري. ورغم أن كليهما يهدف إلى توفير كشف عالي الأداء، تختلف آلياته الأساسية ونُهج تدريبه وسيناريوهات النشر المثالية اختلافًا كبيرًا.
يتناول هذا الدليل الشامل التفاصيل التقنية الدقيقة لكلا النموذجين، ويقارن بين بنيتيهما ومقاييس أدائهما ودعم منظومتيهما البرمجيتين لمساعدة المطورين والباحثين على اختيار الحل الأمثل لاحتياجات النشر الخاصة بهم.
نظرة عامة على النماذج#
قبل تحليل بيانات الأداء، من المهم فهم نشأة كل نموذج وأهدافه المعمارية. فكلاهما من فرق بحثية في Baidu، لكنهما يمثلان فرعين مختلفين ضمن عائلة نماذج اكتشاف الأجسام.
RTDETRv2#
يمثل RTDETRv2 قفزة كبيرة في بنى الرؤية المعتمدة على Transformer. واستنادًا إلى محوّل الكشف الآني الأصلي، يجمع هذا النموذج بين بنية CNN أساسية ومشفّر هجين فعّال ومفكك ترميز من نوع Transformer. وأبرز ما يميزه قدرته الأصلية على التنبؤ الشامل، إذ يلغي تمامًا الحاجة إلى الكبت غير الأقصى (NMS) أثناء المعالجة اللاحقة.
- المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
- الجهة: Baidu
- التاريخ: 2024-07-24
- Arxiv: 2407.17140
- GitHub: مستودع RT-DETR
PP-YOLOE+#
يمثل PP-YOLOE+ إصدارًا متقدمًا من سلسلة YOLO، ومحسّنًا بدرجة كبيرة للتطبيقات الصناعية عالية الأداء. ويتميز ببنية CNN قابلة للتوسع ورأس كشف خالٍ من المراسي. وقد صُمم لتحقيق مفاضلات استثنائية بين السرعة والدقة، ويقدم تقنيات قوية مثل ET-head ودالة خسارة بؤرية معممة لتحسين اكتشاف الأجسام الصغيرة.
- المؤلفون: مؤلفو PaddlePaddle
- الجهة: Baidu
- التاريخ: 2022-04-02
- Arxiv: 2203.16250
- GitHub: مستودع PaddleDetection
تعرّف على المزيد حول PP-YOLOE+
على الرغم من امتلاك كلا النموذجين مستودعات أبحاث مستقلة، يمكنك بسهولة تجربة RT-DETR الأصلي مباشرةً ضمن حزمة Python الخاصة بـ Ultralytics، والاستفادة من واجهة API موحدة وخيارات تصدير مبسطة.
الاختلافات المعمارية#
يكمن الفرق الأساسي بين هذين النموذجين في طريقة معالجتهما للسياق المرئي وتوليد التنبؤات.
يستخدم PP-YOLOE+ بنية CNN أساسية تقليدية لكنها محسّنة للغاية. ويعتمد على مجالات الاستقبال المحلية لاستخراج السمات، ما يجعله سريعًا وفعالًا للغاية للنشر القياسي. لكنه لا يزال يتطلب المعالجة اللاحقة القياسية لـ NMS لتصفية مربعات الإحاطة المتداخلة، ما قد يؤدي إلى اختناقات في زمن الاستجابة في المشاهد الكثيفة.
في المقابل، يستخدم RTDETRv2 مشفّرًا هجينًا ومفكك ترميز من نوع Transformer. وهذا يمكّن النموذج من التقاط السياق الشامل عبر الصورة بأكملها في آنٍ واحد. وتفهم آليات الانتباه العلاقات بين الأجسام بطبيعتها، ما يمكّن النموذج من إخراج مربعات الإحاطة النهائية مباشرةً من دون NMS. ويضمن هذا النهج الشامل ثبات زمن الاستدلال بصرف النظر عن عدد الأجسام المكتشفة.
مقاييس الأداء والمقارنة#
عند تقييم مقاييس أداء YOLO، من الضروري الموازنة بين الدقة (mAP) والتكلفة الحاسوبية (FLOPs) وسرعة الاستدلال. ويسلط الجدول أدناه الضوء على أداء كلا النموذجين بأحجام مختلفة.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
رغم أن PP-YOLOE+x يحقق mAPval أعلى قليلًا، تبلغ 54.7% على مجموعة بيانات COCO، فإن نماذج RTDETRv2 توفر عمومًا دقة تنافسية، فضلًا عن زمن استجابة ثابت بفضل تصميمها الخالي من NMS. ومع ذلك، يتفوق PP-YOLOE+ بوضوح من حيث عدد المعلمات وFLOPs في النماذج الأصغر، ما يجعله فعالًا للغاية للنشر على الأجهزة الطرفية.
ميزة Ultralytics: ظهور YOLO26#
رغم قوة RTDETRv2 وPP-YOLOE+ كلٌ على حدة، واصل أحدث ما توصلت إليه التقنية تطوره. وللمطورين الباحثين عن أفضل توازن بين السرعة والدقة ودعم المنظومة البرمجية، تمثل Ultralytics YOLO26 المعيار الصناعي الجديد.
يجمع YOLO26 أفضل جوانب نماذج CNN وTransformer. ويتيح وضع استدلال اختياريًا شاملًا وخاليًا من NMS (nms=False) ابتكرته البنى الحديثة، فيزيل اختناقات المعالجة اللاحقة عند تفعيله. كما يقدم محسّن MuSGD الثوري، وهو نهج هجين مستوحى من ابتكارات تدريب نماذج LLM، ويضمن تدريبًا مستقرًا للغاية وتقاربًا سريعًا.
على خلاف نماذج Transformer الثقيلة التي تتطلب قدرًا كبيرًا من ذاكرة CUDA، يتميز YOLO26 بإزالة DFL (خسارة البؤرة التوزيعية)، وهو محسّن خصيصًا للحوسبة الطرفية، ويوفر استدلال CPU أسرع بنسبة تصل إلى 43% مقارنةً بالأجيال السابقة.
بالإضافة إلى ذلك، لا يقتصر YOLO26 على اكتشاف الأجسام البسيط. فهو متعدد الاستخدامات بطبيعته، ويدعم مباشرةً تجزئة الكائنات وتقدير الوضعية ومربعات الإحاطة الموجّهة (OBB)، بينما يركز PP-YOLOE+ أساسًا على اكتشاف مربعات الإحاطة.
منهجيات التدريب والمنظومة#
تتجلى كفاءة التدريب وسهولة الاستخدام بوضوح في منظومة Ultralytics مقارنةً بمستودعات الأبحاث المستقلة. فبينما يعتمد PP-YOLOE+ على إطار عمل PaddlePaddle، ويتطلب RTDETRv2 غالبًا إعدادات معقدة للبيئة، يتيح دمج النماذج عبر Ultralytics تجربة سلسة.
باستخدام واجهة API الخاصة بـ Ultralytics، تستفيد من متطلبات ذاكرة أقل أثناء التدريب، والتعامل الآلي مع مجموعات البيانات، وضبط مبسط للمعلمات الفائقة. وإضافةً إلى ذلك، يمكن نشر النماذج بتنسيقات الإنتاج مثل ONNX أو TensorRT باستخدام أمر واحد.
مثال برمجي: استدلال مبسّط#
فيما يلي عرض توضيحي لمدى سهولة استخدام RT-DETR إلى جانب نموذج YOLO26 الموصى به، باستخدام حزمة Python الخاصة بـ Ultralytics:
from ultralytics import RTDETR, YOLO
# تهيئة نموذج RT-DETR (يدعم Ultralytics النموذجين الأصليين RT-DETR-L وRT-DETR-X)
model_rtdetr = RTDETR("rtdetr-l.pt")
# تنفيذ استدلال خالٍ من NMS على صورة اختبار
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()
# للحصول على سرعة وتعدد استخدامات أكبر، هيّئ أحدث نموذج YOLO26
model_yolo26 = YOLO("yolo26n.pt")
# درّب نموذج YOLO26 بسهولة مع استخدام أمثل للذاكرة
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)
# التصدير إلى TensorRT للنشر على الأجهزة الطرفية
model_yolo26.export(format="engine")التطبيقات وحالات الاستخدام في العالم الحقيقي#
يعتمد الاختيار بين هذه البنى غالبًا على متطلبات الأجهزة والتطبيق المحددة.
- تتميّز RTDETRv2 في بيئات الخوادم وفهم المشاهد المعقدة. وتجعلها آلية الانتباه الشامل فعّالة للغاية في إدارة الحشود وتحليل الصور الطبية الكثيف، حيث تتسبب الكائنات المتداخلة عادةً في إخفاق خوارزميات NMS التقليدية.
- تُعد PP-YOLOE+ مناسبة جدًا للفحص الصناعي عالي السرعة والبيئات التي تعتمد بكثافة على منظومة PaddlePaddle. كما أن انخفاض عدد المعلمات في المقاييس الأصغر يجعلها خيارًا عمليًا لبعض تطبيقات الروبوتات.
- تُعد Ultralytics YOLO26 الحل الموصى به عالميًا للنشر التجاري الشامل. وبفضل وظيفتي ProgLoss + STAL المحسّنتين، تحسّن YOLO26 بدرجة كبيرة التعرّف على الكائنات الصغيرة، وهو أمر بالغ الأهمية لعمليات الطائرات المسيّرة الجوية ومراقبة حركة المرور في المدن الذكية.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين RT-DETR وPP-YOLOE+ على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار RT-DETR#
يُعد RT-DETR خيارًا قويًا في الحالات التالية:
- أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
- سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
- كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.
متى تختار PP-YOLOE+#
يوصى باستخدام PP-YOLOE+ في الحالات التالية:
- التكامل مع منظومة PaddlePaddle: المؤسسات التي تمتلك بنية تحتية قائمة مبنية على إطار العمل والأدوات PaddlePaddle من Baidu.
- النشر الطرفي عبر Paddle Lite: النشر على عتاد مزود بنوى استدلال محسّنة بدرجة عالية خصيصًا لمحرك Paddle Lite أو محرك الاستدلال Paddle.
- اكتشاف عالي الدقة على جانب الخادم: السيناريوهات التي تعطي الأولوية لأقصى دقة اكتشاف على خوادم GPU قوية، حيث لا يشكل الاعتماد على إطار عمل معين مصدر قلق.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
الخلاصة#
دفعت كل من RTDETRv2 وPP-YOLOE+ حدود الإمكانات في الرؤية الحاسوبية، وأثبتتا جدوى كل من بنى Transformer وبنى CNN المحسّنة للغاية. ومع ذلك، قد تعرقل صعوبة نشر قواعد الشيفرة البحثية المجزأة الجداول الزمنية للإنتاج.
يمنح استخدام منصة Ultralytics مهندسي الذكاء الاصطناعي المعاصرين ميزة لا تُضاهى. ومن خلال الانتقال إلى نماذج متكاملة بسلاسة مثل YOLO11 أو YOLO26 المتطور، تستطيع الفرق تحقيق أعلى نسب ممكنة بين الدقة والسرعة، مع تقليل متطلبات الذاكرة والأعباء الإضافية للتطوير بدرجة كبيرة.