Ultralytics YOLO27:

PP-YOLOE+ مقابل RTDETRv2#

شهد مجال الرؤية الحاسوبية تطورًا هائلًا في السنوات الأخيرة، ولا سيما في مجال اكتشاف الأجسام في الوقت الفعلي. وقد يعني اختيار البنية المناسبة للنشر الفرق بين تطبيق بطيء وثقيل على الذاكرة ونظام عالي التحسين وسريع الاستجابة. في هذه المقارنة التقنية، نستعرض نموذجين بارزين من Baidu: النموذج PP-YOLOE+ القائم على CNN والنموذج RTDETRv2 القائم على Transformer. سنحلل بنيتهما، ومقاييس أدائهما، وحالات الاستخدام المثالية لهما، مع فحص كيفية مقارنتهما بمنصة Ultralytics YOLO26 المتقدمة.

PP-YOLOE+: تطوير نهج CNN#

طُوّر PP-YOLOE+ بوصفه تكرارًا لنماذجه السابقة، ويدفع حدود ما يمكن أن تحققه الشبكات العصبية الالتفافية التقليدية (CNNs) في اكتشاف الأجسام. وهو كاشف عالي القدرة لا يعتمد على المراسي، ويبني على الآليات الأساسية لسلسلة YOLO، مع تقديم تحسينات محددة لمنظومة PaddlePaddle.

تفاصيل النموذج:

البنية والمنهجيات#

يعتمد PP-YOLOE+ على شبكة أساسية محسّنة بدرجة كبيرة وشبكة هرمية مخصصة للميزات لتجميع الميزات متعددة المقاييس بفعالية. ويستخدم تصميمًا لا يعتمد على المراسي، مما يبسّط عملية الضبط الاستكشافي المطلوبة عادةً لإنشاء صناديق المراسي. علاوة على ذلك، تتضمن منهجية تدريبه استراتيجيات متقدمة لإسناد التسميات من أجل مواءمة التنبؤات مع الصناديق الحقيقة الأساسية بصورة أفضل أثناء مرحلة التعلم.

نقاط القوة وحالات الاستخدام#

تكمن نقطة القوة الأساسية في PP-YOLOE+ في أدائه المتين على عتاد الخوادم القياسي وتكامله العميق مع أدوات Baidu. وهو مناسب تمامًا لسير العمل الصناعي التقليدي، مثل اكتشاف العيوب الثابت في بيئات التصنيع التي لا تكون فيها قيود العتاد صارمة للغاية.

تعرف على المزيد حول PP-YOLOE+

اعتبارات المنظومة

على الرغم من أن PP-YOLOE+ يوفر دقة قوية، فإن نشره خارج منظومته الأصلية قد يتطلب أحيانًا خطوات تحويل إضافية، بخلاف تنسيقات التصدير الأصلية المتاحة بسهولة في مسارات Ultralytics الحديثة.

RTDETRv2: محولات الكشف في الوقت الفعلي#

بالابتعاد عن شبكات CNN الخالصة، يمثل RTDETRv2 (محوّل اكتشاف الأجسام في الوقت الفعلي، الإصدار 2) انتقالًا إلى آليات قائمة على الانتباه لمهام الرؤية الحاسوبية. وهو يحاول الجمع بين فهم السياق العام الذي توفره المحوّلات وزمن الاستجابة المنخفض المطلوب للتطبيقات الواقعية.

تفاصيل النموذج:

البنية والمنهجيات#

يستفيد RTDETRv2 من بنية هجينة تجمع بين شبكة أساسية من CNN لاستخراج الميزات ومشفّر-فك مشفّر انسيابي قائم على Transformer. ومن السمات المميزة لـ RTDETRv2 تصميمه الأصلي الشامل من البداية إلى النهاية، الذي يتجاوز المعالجة اللاحقة التقليدية لقمع غير الأقصى (NMS). كما يقدم ميزات مثل الاكتشاف متعدد المقاييس ومعالجة المشاهد المعقدة، مستخدمًا الانتباه الذاتي لفهم العلاقات المكانية بين الأجسام المتباعدة.

نقاط القوة وحالات الاستخدام#

تجعل بنية Transformer نموذج RTDETRv2 فعالًا للغاية في السيناريوهات التي يكون فيها فهم السياق العام أمرًا بالغ الأهمية. غير أن نماذج Transformer تتطلب عادةً قدرًا أكبر بكثير من ذاكرة CUDA أثناء التدريب والاستدلال مقارنةً بشبكات CNN خفيفة الوزن. وهو الأنسب للبيئات ذات العتاد غير المقيّد، مثل تحليلات الفيديو السحابية التي تعمل على خوادم GPU قوية.

مقارنة الأداء والمقاييس#

عند تقييم هذه النماذج، تكون المفاضلة بين متوسط الدقة (mAP) والتكلفة الحاسوبية، المقاسة بعدد عمليات الفاصلة العائمة (FLOPs) وزمن الاستدلال، بالغة الأهمية. يوضح الجدول أدناه المقاييس الرئيسية لمختلف أحجام كل من PP-YOLOE+ وRTDETRv2.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

مع أن RTDETRv2 يحقق قيمة mAP قوية على حساب ارتفاع عدد المعلمات وعمليات FLOPs، فإن المطورين الذين يتطلعون إلى النشر على أجهزة الحافة محدودة الموارد يواجهون غالبًا اختناقات بسبب متطلبات الذاكرة الكبيرة المعتادة في طبقات Transformer.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين PP-YOLOE+ وRT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلاتك المتعلقة بالمنظومة.

متى تختار PP-YOLOE+#

يُعد PP-YOLOE+ خيارًا قويًا من أجل:

  • التكامل مع منظومة PaddlePaddle: المؤسسات التي تمتلك بنية تحتية قائمة على إطار عمل وأدوات PaddlePaddle الخاصة بـBaidu.
  • النشر الطرفي باستخدام Paddle Lite: النشر على عتاد مزود بنوى استدلال محسّنة بدرجة كبيرة خصيصًا لمحرك Paddle Lite أو محرك Paddle للاستدلال.
  • الاكتشاف عالي الدقة من جانب الخادم: السيناريوهات التي تعطي الأولوية لأقصى دقة اكتشاف على خوادم GPU قوية، حيث لا يمثل الاعتماد على إطار العمل مصدر قلق.

متى تختار RT-DETR#

يوصى باستخدام RT-DETR في الحالات التالية:

  • أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
  • السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
  • اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

ميزة Ultralytics: تقديم YOLO26#

على الرغم من أن كلًا من PP-YOLOE+ وRTDETRv2 يمثلان إنجازين مهمين، فإن المطور العصري يحتاج إلى منظومة توازن تمامًا بين الأداء الفائق وسهولة الاستخدام الانسيابية. وتوفر منصة Ultralytics ونموذج YOLO26 الرائد ذلك بالضبط.

أُطلق YOLO26 في يناير 2026، ويضع معيارًا جديدًا للذكاء الاصطناعي في مجال الرؤية، مع إعطاء الأولوية لأجهزة الحافة. وهو يحل بأناقة عقبات النشر المرتبطة بالبنى الأقدم، متفوقًا عليها في السرعة والدقة معًا.

الابتكارات المعمارية#

يقدم YOLO26 عدة تحسينات رائدة تتفوق على شبكات CNN التقليدية وTransformers الثقيلة:

  • تصميم شامل من البداية إلى النهاية وخالٍ من NMS: مثل RTDETRv2، يتميز YOLO26 بتصميم أصلي شامل من البداية إلى النهاية. ومن خلال إلغاء المعالجة اللاحقة لقمع غير الأقصى (NMS)، يوفر نشرًا أسرع وأبسط مع تقليل تذبذب زمن الاستجابة، مما يجعله مثاليًا لـالروبوتات في الوقت الفعلي والأنظمة الذاتية التشغيل.
  • استدلال أسرع على CPU بنسبة تصل إلى 43%: من خلال تحسينات معمارية عميقة، يتفوق YOLO26 بفارق كبير على النماذج المنافسة في أجهزة الحافة التي تفتقر إلى GPU منفصل، مما يجعله الخيار الأمثل لتطبيقات إنترنت الأشياء والمدن الذكية.
  • مُحسِّن MuSGD: مستفيدًا من ابتكارات تدريب LLM، يستخدم YOLO26 مزيجًا من SGD وMuon. ويوفر ذلك مسارات تدريب أكثر استقرارًا وتقاربًا أسرع بدرجة ملحوظة، مما يقلل ساعات التدريب على GPU بشكل كبير.
  • ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو مجال تعاني فيه نماذج مثل PP-YOLOE+ تاريخيًا، مما يثبت أهميتها في الصور الجوية وتطبيقات الطائرات المسيّرة.
  • إزالة DFL: تؤدي إزالة Distribution Focal Loss إلى تبسيط عملية التصدير، مما يضمن توافقًا سلسًا عبر مختلف أجهزة الحافة والأجهزة منخفضة الطاقة.
تعدد الاستخدامات الخاص بالمهام

بخلاف كاشفات الأجسام المتخصصة، يتميز YOLO26 بتعدد استخدامات كبير، إذ يدعم تجزئة المثيلات، وتقدير الوضعية، والتصنيف، والمربعات المحيطة الموجّهة (OBB). كما يتضمن تحسينات مخصصة مثل RLE للوضعية ودالة خسارة متخصصة للزاوية في OBB.

سهولة استخدام لا مثيل لها#

تتمثل إحدى أكبر سلبيات اعتماد بنيات معقدة مثل RTDETRv2 في منحنى التعلم الحاد وعمليات التكامل المتفرقة. وتجرّد منظومة Ultralytics هذه التعقيدات بالكامل من خلال API لـ Python بديهي ومنصة شاملة قائمة على الويب.

سواء كنت تدرّب مجموعات بيانات مخصصة أو تجري استدلالًا سريعًا، فإن العملية سلسة:

from ultralytics import RTDETR, YOLO

# Initialize the state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Alternatively, initialize an RT-DETR model via the same simple API
model_rtdetr = RTDETR("rtdetr-l.pt")

# Run real-time inference effortlessly
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()

# Export for edge deployment in one line
model_yolo.export(format="engine", quantize=16)

تعني متطلبات الذاكرة الأقل المعتادة في نماذج Ultralytics YOLO أنه يمكنك التدريب بسرعة أكبر والنشر على عتاد أقل تكلفة مقارنةً بنظيراتها القائمة على Transformer. علاوة على ذلك، يضمن التطوير النشط والتوثيق عالمي المستوى بقاء مسارات الإنتاج لديك مستقرة.

بالنسبة للفرق التي تبحث عن بدائل، يظل YOLO11 نموذجاً سابقاً مدعوماً بشكل كبير وقادراً بشكل استثنائي داخل النظام البيئي، مما يوفر أساساً ممتازاً لتكاملات الأجهزة القديمة. قد تجد أيضاً أنه من المفيد قراءة مقارنتنا حول YOLO11 vs RT-DETR.

الملخص#

قدم كل من PP-YOLOE+ وRTDETRv2 إسهامات كبيرة في تطور الرؤية الحاسوبية، إذ أثبتا على التوالي جدوى مسارات CNN المتقدمة وTransformers في الوقت الفعلي. ومع ذلك، بالنسبة إلى المؤسسات التي تتطلع إلى نشر تطبيقات رؤية حاسوبية متينة ومتعددة الاستخدامات وعالية التحسين في عام 2026، يوفر Ultralytics YOLO26 حلًا لا مثيل له. وتمكّن بنيته الأصلية الخالية من NMS، واستدلاله الأسرع بكثير على CPU، ومنظومته الانسيابية المطورين من الانتقال من مرحلة التصور إلى الإنتاج القابل للتوسع بسرعة أكبر من أي وقت مضى.

التعليقات