Ultralytics YOLO27:
Get Started

PP-YOLOE+ مقابل RTDETRv2#

شهد مجال الرؤية الحاسوبية تطورًا هائلًا في السنوات الأخيرة، لا سيما في مجال اكتشاف الأجسام في الزمن الحقيقي. وقد يشكل اختيار البنية المناسبة للنشر الفرق بين تطبيق بطيء يستهلك قدرًا كبيرًا من الذاكرة ونظام سريع الاستجابة وعالي التحسين. في هذه المقارنة التقنية، نستكشف نموذجين بارزين من Baidu: PP-YOLOE+ القائم على CNN، وRTDETRv2 القائم على Transformer. وسنحلل بنيتيهما ومقاييس الأداء وحالات الاستخدام المثالية، مع استعراض كيفية مقارنتهما بمنصة Ultralytics YOLO26 المتطورة.

PP-YOLOE+: تطوير نهج CNN#

طُوّر PP-YOLOE+ بوصفه إصدارًا مطورًا عن أسلافه، ليوسّع حدود ما تستطيع الشبكات العصبية الالتفافية التقليدية (CNNs) تحقيقه في اكتشاف الأجسام. وهو كاشف قوي لا يعتمد على المراسي، يستند إلى الآليات الأساسية لسلسلة YOLO، مع تقديم تحسينات محددة لمنظومة PaddlePaddle.

تفاصيل النموذج:

البنية والمنهجيات#

يعتمد PP-YOLOE+ على عمود فقري محسن بدرجة كبيرة وشبكة هرمية مخصصة للميزات، لتجميع الميزات متعددة المقاييس بفعالية. ويستخدم تصميمًا لا يعتمد على المراسي، ما يبسط عملية الضبط الاستدلالي المطلوبة عادةً لإنشاء مربعات المراسي. إضافة إلى ذلك، تتضمن منهجيته التدريبية استراتيجيات متقدمة لإسناد التسميات، بهدف تحسين مطابقة التنبؤات مع مربعات الحقيقة الأرضية خلال مرحلة التعلم.

نقاط القوة وحالات الاستخدام#

تكمن نقطة القوة الأساسية في PP-YOLOE+ في أدائه القوي على عتاد الخوادم القياسي وتكامله الوثيق مع أدوات Baidu. وهو مناسب تمامًا لسير العمل الصناعي التقليدي، مثل اكتشاف العيوب الثابتة في بيئات التصنيع التي لا تفرض قيودًا كبيرة على العتاد.

تعرّف على المزيد حول PP-YOLOE+

اعتبارات المنظومة

على الرغم من دقة PP-YOLOE+ العالية، قد يتطلب نشره خارج منظومته الأصلية أحيانًا خطوات تحويل إضافية، على عكس تنسيقات التصدير الأصلية المتاحة بسهولة في مسارات عمل Ultralytics الحديثة.

RTDETRv2: محولات الاكتشاف في الوقت الفعلي#

يمثل RTDETRv2 (الإصدار الثاني من Transformer للكشف في الزمن الحقيقي)، ابتعادًا عن شبكات CNN الخالصة وانتقالًا إلى آليات قائمة على الانتباه لمهام الرؤية الحاسوبية. ويسعى إلى الجمع بين فهم السياق الشامل الذي توفره المحولات وزمن الاستجابة المنخفض المطلوب للتطبيقات الواقعية.

تفاصيل النموذج:

البنية والمنهجيات#

يستفيد RTDETRv2 من بنية هجينة تجمع بين عمود فقري من CNN لاستخراج الميزات ومشفّر-مفكّك ترميز مبسط من Transformer. ومن السمات المميزة لـ RTDETRv2 تصميمه الأصلي المتكامل الذي يتجاوز المعالجة اللاحقة التقليدية لكبح القيم غير القصوى (NMS). كما يقدم ميزات مثل الكشف متعدد المقاييس والتعامل مع المشاهد المعقدة، مستخدمًا الانتباه الذاتي لفهم العلاقات المكانية بين الأجسام المتباعدة.

نقاط القوة وحالات الاستخدام#

تجعل بنية Transformer من RTDETRv2 نموذجًا فعالًا للغاية في السيناريوهات التي يكون فيها فهم السياق الشامل بالغ الأهمية. ومع ذلك، تتطلب نماذج Transformer عادةً ذاكرة CUDA أكبر بكثير أثناء التدريب والاستدلال مقارنةً بنماذج CNN خفيفة الوزن. وهي الأنسب للبيئات التي لا تفرض قيودًا على العتاد، مثل تحليلات الفيديو القائمة على السحابة والتي تعمل على خوادم GPU قوية.

تعرّف على المزيد حول RTDETRv2

مقارنة الأداء والمقاييس#

عند تقييم هذه النماذج، تكون المفاضلة بين متوسط الدقة (mAP) والكلفة الحاسوبية (المقاسة بوحدات FLOPs وزمن استجابة الاستدلال) بالغة الأهمية. ويلخص الجدول أدناه المقاييس الأساسية لمختلف أحجام نموذجي PP-YOLOE+ وRTDETRv2.

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

على الرغم من أن RTDETRv2 يحقق mAP مرتفعًا مقابل زيادة عدد المعاملات وFLOPs، يواجه المطورون الراغبون في النشر على أجهزة طرفية محدودة الموارد اختناقات غالبًا بسبب متطلبات الذاكرة الكبيرة المعتادة في طبقات Transformer.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين PP-YOLOE+ وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.

متى تختار PP-YOLOE+#

يُعد PP-YOLOE+ خيارًا قويًا لـ:

  • التكامل مع منظومة PaddlePaddle: المؤسسات التي تمتلك بنية تحتية قائمة مبنية على إطار العمل والأدوات PaddlePaddle من Baidu.
  • النشر الطرفي عبر Paddle Lite: النشر على عتاد مزود بنوى استدلال محسّنة بدرجة عالية خصيصًا لمحرك Paddle Lite أو محرك الاستدلال Paddle.
  • اكتشاف عالي الدقة على جانب الخادم: السيناريوهات التي تعطي الأولوية لأقصى دقة اكتشاف على خوادم GPU قوية، حيث لا يشكل الاعتماد على إطار عمل معين مصدر قلق.

متى تختار RT-DETR#

يوصى بـRT-DETR في الحالات التالية:

  • أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
  • سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
  • كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
  • البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.

ميزة Ultralytics: تقديم YOLO26#

على الرغم من أن PP-YOLOE+ وRTDETRv2 يمثلان محطتين بارزتين، يحتاج المطورون اليوم إلى منظومة تحقق توازنًا مثاليًا بين الأداء الفائق وسهولة الاستخدام. وتقدم منصة Ultralytics ونموذج YOLO26 الرائد ذلك تحديدًا.

أُطلق YOLO26 في يناير 2026، وأرسى معيارًا جديدًا للذكاء الاصطناعي البصري المصمم أولًا للأجهزة الطرفية. فهو يعالج بسلاسة عقبات النشر المرتبطة بالبنى الأقدم، ويتفوق عليها في السرعة والدقة.

ابتكارات البنية#

يقدم YOLO26 عدة تحسينات رائدة تتفوق على شبكات CNN التقليدية ومحولات Transformer الضخمة:

  • تصميم متكامل لا يتطلب NMS: مثل RTDETRv2، يدعم YOLO26 الاستدلال المتكامل الأصلي. ومن خلال تجاوز المعالجة اللاحقة لكبح القيم غير القصوى (NMS) باستخدام رأسه الاختياري أحادي المطابقة (nms=False)، يتيح نشرًا أسرع وأبسط مع تقليل تذبذب زمن الاستجابة، وهو مثالي لتطبيقات الروبوتات والأنظمة الذاتية في الزمن الحقيقي.
  • استدلال أسرع على CPU بنسبة تصل إلى 43%: بفضل التحسينات المعمارية العميقة، يتفوق YOLO26 كثيرًا على النماذج المنافسة في الأجهزة الطرفية التي لا تحتوي على GPU منفصل، ما يجعله الخيار الأمثل لتطبيقات إنترنت الأشياء والمدن الذكية.
  • مُحسِّن MuSGD: استلهامًا من ابتكارات تدريب نماذج اللغة الكبيرة، يستخدم YOLO26 مزيجًا من SGD وMuon. ويوفر ذلك مسارات تدريب أكثر استقرارًا وتقاربًا أسرع بكثير، ما يقلل ساعات التدريب على GPU بدرجة كبيرة.
  • ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو مجال واجهت فيه نماذج مثل PP-YOLOE+ صعوبات تاريخيًا، ما يجعلها بالغة الأهمية لـالصور الجوية وتطبيقات الطائرات المسيّرة.
  • إزالة DFL: يؤدي حذف خسارة البؤرة التوزيعية إلى تبسيط عملية التصدير، وضمان التوافق السلس مع مختلف الأجهزة الطرفية ومنخفضة الطاقة.
تعدد الاستخدامات بحسب المهمة

على عكس كاشفات الأجسام المتخصصة، يتميز YOLO26 بتعدد استخداماته، إذ يدعم تجزئة المثيلات وتقدير الوضعية والتصنيف ومربعات الإحاطة الموجّهة (OBB). كما يتضمن تحسينات مخصصة مثل RLE لتقدير الوضعية ودالة خسارة زاوية متخصصة لـ OBB.

سهولة استخدام لا مثيل لها#

من أكبر عيوب اعتماد البنى المعقدة مثل RTDETRv2 منحنى التعلم الحاد وعمليات التكامل المجزأة. وتجرد منظومة Ultralytics هذه التعقيدات تمامًا من خلال API بديهية لـ Python ومنصة شاملة قائمة على الويب.

سواء أكنت تدرّب مجموعات بيانات مخصصة أم تجري استدلالًا سريعًا، فالعملية سلسة:

from ultralytics import RTDETR, YOLO

# ⁨تهيئة نموذج YOLO26 المتقدم⁩
model_yolo = YOLO("yolo26n.pt")

# ⁨أو بدلاً من ذلك، أنشئ نموذج RT-DETR باستخدام API البسيطة نفسها⁩
model_rtdetr = RTDETR("rtdetr-l.pt")

# ⁨أجرِ الاستدلال في الزمن الحقيقي بسهولة⁩
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()

# ⁨صدّر للنشر على الأجهزة الطرفية بسطر واحد⁩
model_yolo.export(format="engine", quantize=16)

تعني متطلبات الذاكرة الأقل المعتادة في نماذج Ultralytics YOLO إمكانية التدريب بسرعة أكبر والنشر على عتاد أقل كلفة مقارنةً بنظيراتها القائمة على Transformer. إضافة إلى ذلك، يضمن التطوير النشط والتوثيق العالمي المستوى استقرار مسارات الإنتاج لديك.

للفرق التي تدرس البدائل، يظل YOLO11 سلفًا مدعومًا على نطاق واسع وقويًا للغاية ضمن المنظومة، ويقدم خط أساس ممتازًا لعمليات التكامل مع العتاد القديم. وقد يفيدك أيضًا الاطلاع على مقارنتنا بين YOLO11 وRT-DETR.

الملخص#

أسهم PP-YOLOE+ وRTDETRv2 إسهامًا كبيرًا في تطور الرؤية الحاسوبية، وأثبتا على التوالي جدوى مسارات عمل CNN المتقدمة ومحولات Transformer في الزمن الحقيقي. ومع ذلك، توفر Ultralytics YOLO26 حلًا لا يُضاهى للمؤسسات التي تسعى إلى نشر تطبيقات رؤية حاسوبية قوية ومتعددة الاستخدامات ومحسنة بدرجة عالية في عام 2026. فالاستدلال الاختياري الذي لا يتطلب NMS، والاستدلال الأسرع بكثير على CPU، والمنظومة المبسطة، تمكّن المطورين من الانتقال من الفكرة إلى الإنتاج القابل للتوسع بسرعة أكبر من أي وقت مضى.

التعليقات