PP-YOLOE+ مقابل DAMO-YOLO#
أفضى التطور المستمر للرؤية الحاسوبية إلى ظهور مجموعة من البنى المتخصصة للغاية لاكتشاف الأجسام في الزمن الحقيقي. وعند تقييم النماذج للتطبيقات الصناعية والبحثية، يبرز غالبًا إطاران بارزان من عام 2022: PP-YOLOE+ من Baidu وDAMO-YOLO من Alibaba Group. وقد دفع كلا النموذجين حدود الكشف الذي لا يعتمد على المراسي، عبر تقديم أعمدة فقرية مبتكرة واستراتيجيات متقدمة لإسناد التسميات وتقنيات متخصصة لدمج الميزات.
يقدم هذا الدليل تحليلًا تقنيًا مفصلًا لـ PP-YOLOE+ وDAMO-YOLO، ويستكشف بنيتيهما ومنهجيات تدريبهما ونقاط قوتهما في النشر. كما سنبحث كيفية مقارنة هذين الإطارين بالحلول الحديثة مثل Ultralytics YOLO26، لمساعدتك على اختيار الأداة المناسبة لقيود النشر المحددة لديك.
PP-YOLOE+: اكتشاف الأجسام الصناعية المحسّن#
طُوّر PP-YOLOE+ ضمن منظومة Baidu، وهو تحسين تكراري للنموذج الأصلي PP-YOLOE، ومُحسّن بدرجة كبيرة لإطار التعلم العميق PaddlePaddle. وقد صُمم لتحقيق أقصى دقة وسرعة استدلال على عتاد بمستوى الخوادم، ما يجعله خيارًا قويًا للفحص الصناعي وتطبيقات البيع بالتجزئة الذكي.
ابتكارات البنية#
يقدم PP-YOLOE+ عدة تحسينات معمارية لتطوير كاشفات الأجسام السابقة التي لا تعتمد على المراسي:
- العمود الفقري CSPRepResNet: يستخدم هذا العمود الفقري بنية على غرار RepVGG ممزوجة بوصلات الأجزاء الجزئية عبر المراحل (CSP)، ما يوفر توازنًا قويًا بين القدرة على استخراج الميزات وزمن استجابة الاستدلال.
- التعلم لمواءمة المهام (TAL): يستخدم PP-YOLOE+ استراتيجية متقدمة وديناميكية لإسناد التسميات، توازن بين مهام التصنيف والانحدار أثناء التدريب، ما يقلل الفجوة بين أداء التدريب والاستدلال.
- رأس مواءمة المهام الفعال (ET-head): رأس كشف مبسط صُمم لمعالجة الميزات بسرعة دون التضحية بالدقة المكانية، وهو مفيد للغاية للحفاظ على ارتفاع مقاييس mAP.
تفاصيل PP-YOLOE+ :
- المؤلفون: مؤلفو PaddlePaddle
- الجهة: Baidu
- التاريخ: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
- الوثائق: وثائق PP-YOLOE+
تعرّف على المزيد حول PP-YOLOE+
DAMO-YOLO: البحث عن البنى العصبية على الأجهزة الطرفية#
أنشأته أكاديمية DAMO التابعة لـ Alibaba، ويتبع DAMO-YOLO نهجًا مختلفًا بوضوح. فبدلًا من تصميم العمود الفقري يدويًا، استخدم فريق البحث البحث عن البنى العصبية (NAS) لاكتشاف طوبولوجيات شبكية عالية الكفاءة ومصممة خصيصًا لقيود زمن الاستجابة الصارمة.
الميزات الأساسية ومسار التدريب#
يركز DAMO-YOLO على انخفاض زمن الاستجابة وارتفاع الدقة من خلال منهجية آلية تعتمد بكثافة على التقطير:
- أعمدة MAE-NAS الفقرية: باستخدام البحث عن البنى العصبية بأقصى إنتروبيا، ينشئ DAMO-YOLO أعمدة فقرية محسنة خصيصًا لـالمفاضلة بين عدد المعاملات والدقة.
- RepGFPN فعال: تتيح شبكة هرم الميزات المعممة المعاد تحديد معلماتها دمجًا قويًا للميزات متعددة المقاييس، ما يساعد النموذج على كشف الأجسام ذات الأحجام المختلفة جدًا في الإطار الواحد.
- تصميم ZeroHead: رأس كشف مبسط للغاية يقلل بدرجة كبيرة العبء الحاسوبي أثناء مرحلة الاستدلال.
- تعزيز التقطير: لتحسين أداء الإصدارات الأصغر، يعتمد DAMO-YOLO اعتمادًا كبيرًا على عملية معقدة لتقطير المعرفة، يوجه فيها نموذج معلم أكبر نموذجًا متعلمًا.
تفاصيل DAMO-YOLO:
- المؤلفون: Xianzhe Xu وYiqi Jiang وWeihua Chen وYilun Huang وYuan Zhang وXiuyu Sun
- المؤسسة: Alibaba Group
- التاريخ: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- التوثيق: توثيق DAMO-YOLO
اطّلع على مزيد من المعلومات حول DAMO-YOLO
على الرغم من أن PP-YOLOE+ وDAMO-YOLO يقدمان ابتكارات نظرية قوية، فإن ارتباطهما وثيق بإطارَي العمل الخاصين بهما (PaddlePaddle وبيئات Alibaba المحددة). وقد يؤدي ذلك إلى صعوبات عند محاولة نقل هذين النموذجين إلى عمليات نشر موحدة على السحابة أو الأجهزة الطرفية.
تحليل الأداء#
عند تقييم هذه النماذج، تحدد المفاضلة بين زمن الاستجابة والتعقيد الحاسوبي (FLOPs) ومتوسط الدقة (mAP) بيئة النشر المثالية لكل منها.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
يحقق DAMO-YOLOt زمن استجابة أقل على TensorRT من PP-YOLOE+t، كما أن DAMO-YOLO أدق في الأحجام الصغيرة جدًا والصغيرة، ما يجعله منافسًا قويًا لتدفقات الفيديو ذات معدل الإنتاجية المرتفع. ومع ذلك، يتوسع PP-YOLOE+ بكفاءة كبيرة إلى إصداره فائق الكبر (x)، محققًا دقة من الطراز الأول في الصور المعقدة التي يكون فيها زمن الاستدلال أقل أهمية.
ميزة Ultralytics: تجاوز بنى عام 2022#
على الرغم من أن PP-YOLOE+ وDAMO-YOLO شكّلا محطتين بارزتين، يتطلب التطوير الحديث تعددًا أكبر في الاستخدامات ومسارات تدريب أسهل ومتطلبات أقل للذاكرة. وتلبي منصة Ultralytics هذه الاحتياجات بتجربة سلسة تتفوق كثيرًا على عمليات التقطير المعقدة والإعدادات الخاصة بأطر العمل التي تتطلبها النماذج الأقدم.
للمطورين الساعين إلى تحقيق أفضل توازن للأداء اليوم، تقدم Ultralytics YOLO26 نقلة نوعية في كفاءة النشر في العالم الحقيقي.
لماذا يتصدر YOLO26 المجال#
بُني YOLO26، الذي أُطلق في أوائل عام 2026، على إرث YOLO11، وقدم تقنيات رائدة مصممة للإنتاج:
- تصميم متكامل لا يتطلب NMS: يستطيع YOLO26 تجاوز المعالجة اللاحقة لكبح القيم غير القصوى (NMS) بالكامل باستخدام رأسه الاختياري أحادي المطابقة (
nms=False). ويتيح ذلك منطق نشر أبسط وأزمنة استدلال ثابتة ويمكن التنبؤ بها بدرجة عالية. - مُحسِّن MuSGD: استلهامًا من تقنيات تدريب نماذج اللغة الكبيرة، يستخدم YOLO26 مُحسِّنًا هجينًا من MuSGD. وهذا يضمن تدريبًا مستقرًا للغاية وتقاربًا سريعًا، مع توفير ساعات ثمينة من وقت GPU.
- استدلال متفوق على CPU: من خلال إزالة خسارة البؤرة التوزيعية (DFL) وتحسين الرسم البياني للشبكة، يحقق YOLO26 استدلالًا أسرع على CPU بنسبة تصل إلى 43%، ما يجعله الخيار الأمثل لـأجهزة الذكاء الاصطناعي الطرفية.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لـعمليات الطائرات المسيّرة والاستشعار عن بُعد.
- تعدد استخدامات لا يُضاهى: على عكس PP-YOLOE+ الذي يركز حصريًا على الكشف، يدعم YOLO26 بسلاسة تقدير الوضعية وتجزئة المثيلات وتصنيف الصور ومربعات الإحاطة الموجّهة (OBB) دعمًا أصليًا.
سهولة الاستخدام وكفاءة التدريب#
يتطلب تدريب نموذج DAMO-YOLO إدارة مسار معقد لتقطير المعرفة بين المعلم والمتعلم. في المقابل، لا يتطلب تدريب نموذج Ultralytics سوى بضعة أسطر من Python، مع استهلاك أقل قدرًا من ذاكرة CUDA مقارنةً بالبنى المنافسة.
from ultralytics import YOLO
# أنشئ نموذج YOLO26 المتطور
model = YOLO("yolo26n.pt")
# درّب النموذج باستخدام مُحسِّن MuSGD
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, optimizer="MuSGD")
# أجرِ استدلالًا متكاملًا لا يتطلب NMS
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# صدّر إلى ONNX أو TensorRT بسلاسة
model.export(format="onnx")حالات الاستخدام المثالية والتوصيات#
يعتمد اختيار بنية الرؤية الحاسوبية المثلى بدرجة كبيرة على تكاملها مع منظومة فريقك وأهداف النشر.
- اختر PP-YOLOE+ إذا كان مسار عملك بأكمله مدمجًا بعمق في منظومة Baidu PaddlePaddle. ويظل خيارًا ممتازًا لتحليل الصور الثابتة على الخوادم القوية عندما يكون الهدف الأساسي تعظيم الدقة.
- اختر DAMO-YOLO إذا كنت تجري أبحاثًا محددة في خوارزميات البحث عن البنى العصبية، أو إذا كانت لديك الموارد الهندسية اللازمة لصيانة مسارات تقطير معقدة لتحقيق أهداف صارمة لزمن الاستجابة على TensorRT.
- اختر Ultralytics YOLO26 لمعظم سيناريوهات الإنتاج الحديثة. إذ توفر منظومة Ultralytics توثيقًا لا مثيل له ومتطلبات أقل للذاكرة وAPI مبسطة. سواء أكنت تبني أنظمة مراقبة الجودة المؤتمتة أم تشغّل التتبع في الزمن الحقيقي على Raspberry Pi، تضمن بنية YOLO26 التي لا تتطلب NMS نتائج سريعة ومستقرة ودقيقة للغاية منذ البداية.
للمطورين الذين يستكشفون حلولًا أخرى متطورة، توفر وثائق Ultralytics أيضًا موارد وافية حول YOLOv8 واسع الانتشار وYOLO11 القوي، لضمان امتلاكك النموذج المناسب لأي تحدٍ في الرؤية الحاسوبية.