PP-YOLOE+ مقابل YOLOX#
لقد تشكّل مشهد الرؤية الحاسوبية بدرجة كبيرة بفعل التطور السريع لنماذج اكتشاف الأجسام. ومن بين المحطات البارزة في هذا المسار PP-YOLOE+ وYOLOX، وهما بنيتان معماريتان دفعتا حدود الأداء والدقة في الوقت الفعلي. ويُعد فهم الفروق المعمارية الدقيقة بينهما، والمفاضلات المتعلقة بالأداء، وسيناريوهات النشر المثالية أمرًا بالغ الأهمية للباحثين والمطورين الذين يبنون الجيل التالي من أنظمة التعرّف البصري.
سلالة النموذج وتفاصيله#
قبل التعمق في البنى التقنية، من المفيد وضع أصول كلا النموذجين في سياقها. فقد طُوّر كل منهما لمعالجة اختناقات محددة في اكتشاف الأجسام، متأثرًا بدرجة كبيرة بالجهات التي تقف وراء تطويره.
تفاصيل PP-YOLOE+:
- المؤلفون: مؤلفو PaddlePaddle
- المنظمة: Baidu
- التاريخ: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- المستندات: ملف README لـ PaddleDetection PP-YOLOE+
تفاصيل YOLOX:
- المؤلفون: Zheng Ge وSongtao Liu وFeng Wang وZeming Li وJian Sun
- المنظمة: Megvii
- التاريخ: 2021-07-18
- Arxiv: https://arxiv.org/abs/2107.08430
- GitHub: https://github.com/Megvii-BaseDetection/YOLOX
- التوثيق: التوثيق الرسمي لـ YOLOX
الابتكارات المعمارية#
تتمثل الفروق الجوهرية بين كاشفي الأجسام هذين في منهجهما لاستخراج السمات والتنبؤ بالمربعات المحيطة.
YOLOX أحدث نقلة نوعية في عام 2021 من خلال تكييف عائلة YOLO بنجاح مع تصميم خالي من المراسي. وبإزالة مربعات المراسي، خفّض YOLOX بدرجة كبيرة عدد معلمات التصميم وعمليات الضبط الاستكشافية المطلوبة لمجموعات البيانات المخصصة. علاوة على ذلك، قدّم رأسًا مفككًا يفصل مهمتَي التصنيف وتحديد الموقع ضمن مسارين عصبيين متميزين. وقد أزال هذا الفصل التعارض المتأصل بين تصنيف الجسم وتقدير إحداثياته المكانية، مما أدى إلى تقارب أسرع أثناء التدريب.
طوّرت Baidu نموذج PP-YOLOE+، وهو محسّن بدرجة كبيرة لمنظومة PaddlePaddle. ويعتمد على سابقه PP-YOLOv2، مع تقديم استراتيجية ديناميكية لتعيين التسميات (TAL) وعمود فقري مبتكر يُسمى CSPRepResNet. ويستفيد هذا العمود الفقري من إعادة المعلمة البنيوية، مما يتيح للنموذج الاستفادة من بنيات معقدة متعددة الفروع أثناء التدريب، مع دمجها بسلاسة في شبكة سريعة أحادية المسار للاستدلال.
تتيح إعادة المعلمة البنيوية للنموذج التدريب باستخدام فروع متوازية متعددة، مما يحسّن تدفق التدرجات، ثم طيّ هذه الفروع رياضيًا في طبقة التفاف واحدة للنشر، الأمر الذي يعزز سرعات الاستدلال من دون التضحية بالدقة.
مقارنة الأداء والمقاييس#
عند مقارنة النموذجين مباشرة، يتضح أنهما يخدمان طرفين مختلفين قليلًا من طيف الأداء. يحقق PP-YOLOE+ عمومًا دقة مطلقة أعلى، بينما يتفوق YOLOX في توفير إصدارات خفيفة للغاية مناسبة للأجهزة ذات القيود الكبيرة.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
ملاحظة: أُبرزت القيم الأفضل أداءً في كل جزء ذي صلة من الأعمدة بخط عريض.
في حين يوفر YOLOX إصدارات nano وtiny التي تستهلك مساحة قرص أو ذاكرة CUDA تكاد لا تُذكر، يتوسع PP-YOLOE+ بكفاءة مذهلة على الأجهزة بمستوى الخوادم، مما يجعله خيارًا متينًا للتطبيقات الصناعية الثقيلة ضمن منظومة Baidu.
التطبيقات الواقعية#
غالبًا ما يعتمد الاختيار بين هذين الإطارين على متطلبات التكامل والأجهزة المستهدفة.
المجالات التي يتفوق فيها YOLOX#
بفضل طبيعته الخالية من المراسي وتوافر إصدارات فائقة الخفة للأجهزة الطرفية، يحظى YOLOX بشعبية في الروبوتات والنشر على المتحكمات الدقيقة. ويتيح مسار المعالجة اللاحقة البسيط نقله بسهولة أكبر إلى تنسيقات عتاد NPU المخصصة مثل TensorRT وNCNN.
المجالات التي يتفوق فيها PP-YOLOE+#
بالنسبة إلى المؤسسات المندمجة بعمق في مراكز التصنيع الآسيوية التي تستخدم حزمة تقنيات Baidu، يوفر PP-YOLOE+ مسارًا محسّنًا مسبقًا للنشر. ويتألق في سيناريوهات فحص الجودة عالية الدقة التي تعمل على رفوف خوادم قوية، حيث تسمح القيود الصارمة للوقت الفعلي بأوزان نماذج أثقل قليلًا.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين PP-YOLOE+ وYOLOX على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار PP-YOLOE+#
يُعد PP-YOLOE+ خيارًا قويًا من أجل:
- التكامل مع منظومة PaddlePaddle: المؤسسات التي تمتلك بنية تحتية قائمة على إطار عمل وأدوات PaddlePaddle الخاصة بـBaidu.
- النشر الطرفي باستخدام Paddle Lite: النشر على عتاد مزود بنوى استدلال محسّنة بدرجة كبيرة خصيصًا لمحرك Paddle Lite أو محرك Paddle للاستدلال.
- الاكتشاف عالي الدقة من جانب الخادم: السيناريوهات التي تعطي الأولوية لأقصى دقة اكتشاف على خوادم GPU قوية، حيث لا يمثل الاعتماد على إطار العمل مصدر قلق.
متى تختار YOLOX؟#
يوصى باستخدام YOLOX في الحالات التالية:
- أبحاث الاكتشاف دون مراسٍ: الأبحاث الأكاديمية التي تستخدم بنية YOLOX النظيفة المستغنية عن المراسي خط أساس للتجارب على رؤوس اكتشاف أو دوال خسارة جديدة.
- الأجهزة الطرفية فائقة الخفة: النشر على المتحكمات الدقيقة أو الأجهزة المحمولة القديمة التي تكون فيها البصمة الصغيرة للغاية لمتغير YOLOX-Nano (0.91M معلمة) أمرًا بالغ الأهمية.
- دراسات إسناد التسميات SimOTA: مشاريع بحثية تدرس استراتيجيات إسناد التسميات القائمة على النقل الأمثل وتأثيرها في تقارب التدريب.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
ميزة Ultralytics: تقديم YOLO26#
على الرغم من أن PP-YOLOE+ وYOLOX يمثلان محطتين بحثيتين ممتازتين، فإن مشهد النشر الحديث يتطلب تجربة أكثر تماسكًا وملاءمة للمطورين، مع كفاءة فائقة. وهنا يعيد Ultralytics YOLO26 تعريف معيار الذكاء الاصطناعي البصري الحديث بالكامل.
بالنسبة إلى الفرق التي تتطلع إلى الانتقال من مستودعات بحثية معزولة إلى أنظمة جاهزة للإنتاج، توفر Ultralytics منظومة قوية جيدة الصيانة. فلم يعد تدريب نموذج يتطلب إعداد بيئات معقدة؛ إذ أصبح الأمر بسيطًا مثل الوصول إلى واجهة Python API موحدة.
تشمل المزايا الرئيسية لـ Ultralytics YOLO26 ما يلي:
- تصميم شامل خالٍ من NMS: بخلاف كل من PP-YOLOE+ وYOLOX، اللذين يتطلبان كبت القيم غير العظمى (NMS) لتصفية المربعات المحيطة المكررة، يعمل YOLO26 أصلاً بطريقة شاملة من البداية إلى النهاية. وهذا يلغي اختناقات زمن الاستجابة ويبسط منطق النشر بدرجة كبيرة.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: من خلال إزالة خسارة البؤرة التوزيعية (DFL) بشكل استراتيجي، يحقق YOLO26 سرعات استدلال غير مسبوقة على أجهزة CPU، مما يجعله متفوقًا بكثير في الحوسبة الطرفية والأجهزة منخفضة الطاقة.
- محسن MuSGD: مستوحى من نموذج Kimi K2 التابع لشركة Moonshot AI، يجلب هذا المحسن الهجين استقرار تدريب نماذج اللغات الكبيرة إلى الرؤية الحاسوبية، مما يضمن تقارباً أسرع بكثير ويقلل من متطلبات الذاكرة أثناء مراحل التدريب.
- ProgLoss + STAL: توفر دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهي ميزة بالغة الأهمية لـعمليات الطائرات المسيّرة والصور الجوية شديدة التفصيل.
- تعدد الاستخدامات: بينما يركز PP-YOLOE+ وYOLOX على الاكتشاف فقط، يتعامل YOLO26 بسلاسة مع تجزئة المثيلات وتقدير الوضعيات والمربعات المحيطة الموجّهة (OBB) باستخدام الصياغة البديهية نفسها تمامًا.
تدريب مبسّط باستخدام Ultralytics#
لا تضاهى كفاءة نماذج Ultralytics من حيث الذاكرة وسرعة التدريب، إذ تتفوق بفارق كبير على البدائل القائمة على Transformer التي تتطلب قدرًا هائلًا من ذاكرة CUDA الإضافية. ويمكنك الاستفادة من قوة YOLO26 باستخدام بضعة أسطر من التعليمات البرمجية فقط:
from ultralytics import YOLO
# Load the highly efficient, end-to-end YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train on a custom dataset with built-in auto-batching and MuSGD optimization
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate the model's performance
metrics = model.val()
# Export seamlessly to ONNX or TensorRT
model.export(format="engine")بالنسبة إلى الفرق التي تبحث عن حل بلا برمجة، توفر منصة Ultralytics تدريبًا قائمًا على السحابة، وتعليقًا متكاملًا على مجموعات البيانات، ونشرًا بنقرة واحدة لجميع نماذج YOLO الخاصة بك.
الخلاصة#
حجز كل من PP-YOLOE+ وYOLOX مكانته في تاريخ الرؤية الحاسوبية، إذ يقدمان دقة عالية وتصميمات خفيفة خالية من المراسي، على التوالي. ومع ذلك، بالنسبة إلى المؤسسات التي تبني مستقبل الذكاء الاصطناعي في الزراعة والمدن الذكية وتجارة التجزئة، فإن الصيانة المستمرة وسهولة الاستخدام والبنية الأصلية الخالية من NMS في Ultralytics YOLO26 تجعله الخيار الواضح بلا منازع.
إذا كنت تستكشف بنيات بديلة لأج benchmarks محددة، فقد تجد فائدة أيضًا في مقارنة YOLO11 الأقدم أو الخيارات القائمة على Transformer مثل RT-DETR عبر وثائق Ultralytics الشاملة. ومن خلال الانتقال إلى منظومة Ultralytics الموحدة، يوفر المطورون وقتًا وموارد ثمينة، مع تحقيق نتائج متقدمة على أحدث مستوى في أي عملية نشر طرفية أو سحابية.