RTDETRv2 مقابل EfficientDet#
يُعد اختيار البنية المثلى للشبكة العصبية قرارًا حاسمًا لأي مشروع في الرؤية الحاسوبية. تحلل هذه المقارنة التقنية الشاملة نموذجين مؤثرين لاكتشاف الكائنات: RTDETRv2، وهو كاشف متطور قائم على Transformer، وEfficientDet، وهي شبكة عصبية التفافية قابلة للتوسع بدرجة كبيرة. سنقيّم بنيتيهما المختلفتين ومقاييس الأداء ومنهجيات التدريب وسيناريوهات النشر المثالية لمساعدتك على اتخاذ قرارات مستندة إلى البيانات لمسارات عمل الذكاء الاصطناعي.
RTDETRv2: Transformer للكشف في الزمن الحقيقي#
استنادًا إلى نجاح RT-DETR الأصلي، تطوّر RTDETRv2 نهج اكتشاف الكائنات القائم على Transformer. ومن خلال تحسين بنيتي المُرمّز ومفكّك الترميز، تحقق دقة عالية مع الحفاظ على سرعات استدلال آنية، ما يسد الفجوة بفعالية بين نماذج CNN التقليدية وTransformers الخاصة بالرؤية.
تفاصيل النموذج
- المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
- الجهة: Baidu
- التاريخ: 2024-07-24
- الروابط: Arxiv، GitHub، الوثائق
البنية ونقاط القوة الأساسية#
تستخدم RTDETRv2 بنية هجينة تجمع عمودًا فقريًا قويًا من CNN (غالبًا ResNet أو HGNet) مع مفكّك ترميز Transformer فعّال. وتتمثل أبرز خصائص RTDETRv2 في قدرتها الأصلية على تجاوز كبت غير الأعظميات (NMS). تحتاج الكاشفات التقليدية إلى NMS لتصفية الصناديق المحيطة المكررة، ما يضيف تباينًا إلى زمن استدلالها أثناء المعالجة اللاحقة. وتصوغ RTDETRv2 عملية الكشف بوصفها مسألة تنبؤ مباشر بمجموعة، مستخدمةً المطابقة الثنائية لإخراج تنبؤات فريدة.
يتفوق هذا النموذج في عمليات النشر على الخوادم التي تتوفر فيها ذاكرة GPU بوفرة. وتوفر آلية الانتباه الشامل فيه وعيًا استثنائيًا بالسياق، ما يجعله بارعًا للغاية في فصل الكائنات المتداخلة في البيئات المكتظة والمزدحمة، مثل أنظمة الإنذار الأمني الآلية أو مراقبة الحشود الكثيفة.
القيود#
مع أن بنى Transformer قوية، فإنها تتطلب بطبيعتها ذاكرة CUDA أكبر أثناء التدريب مقارنةً بنماذج CNN القياسية. علاوةً على ذلك، قد يتطلب الضبط الدقيق لـRTDETRv2 أوقات تقارب أطول لـبيانات التدريب، ما يجعل النمذجة الأولية السريعة أكثر استهلاكًا للموارد قليلًا.
EfficientDet: نماذج CNN قابلة للتوسع وفعّالة#
قدمت EfficientDet عائلة من نماذج اكتشاف الكائنات المحسّنة لتحقيق الدقة والكفاءة عبر نطاق واسع من قيود الموارد. وتظل مثالًا كلاسيكيًا على التصميم القابل للتوسع في الرؤية الآلية.
تفاصيل النموذج
- المؤلفون: Mingxing Tan وRuoming Pang وQuoc V. Le
- الجهة: Google
- التاريخ: 2019-11-20
- الروابط: Arxiv، GitHub، الوثائق
البنية ونقاط القوة الأساسية#
يكمن الابتكار وراء EfficientDet في مجالين رئيسيين: شبكة هرم السمات ثنائية الاتجاه (BiFPN) وطريقة التحجيم المركب. تتيح BiFPN استخراج السمات متعدد المقاييس بسهولة وسرعة، وذلك بإضافة أوزان قابلة للتعلم لتحديد أهمية سمات الإدخال المختلفة، مع تطبيق دمج السمات متعدد المقاييس من الأعلى إلى الأسفل ومن الأسفل إلى الأعلى بصورة متكررة. وتعمل طريقة التحجيم المركب على تحجيم الدقة والعمق والعرض في الشبكة جميعًا بصورة موحدة وفي آن واحد.
تتدرج نماذج EfficientDet من D0 فائق الخفة إلى D7 الضخم. وهذا يجعلها متعددة الاستخدامات للغاية في عمليات نشر الذكاء الاصطناعي الطرفي، حيث يتعين على المطورين الموازنة بين ميزانيات الحوسبة المحدودة ومتطلبات الدقة، مثل تطبيقات الواقع المعزز المبكرة على الأجهزة المحمولة.
القيود#
EfficientDet بنية أقدم تعتمد بدرجة كبيرة على صناديق المراسي ومسار المعالجة اللاحقة التقليدي لـNMS. وتتطلب عملية إنشاء المراسي ضبطًا دقيقًا للمعلمات الفائقة، كما قد تؤدي خطوة NMS إلى اختناق النشر على الأجهزة المضمنة مثل Raspberry Pi. وتفتقر أيضًا إلى الدعم الأصلي للمهام الحديثة مثل تقدير الوضعيات أو الصناديق المحيطة الموجّهة (OBB).
تعرّف على المزيد عن EfficientDet
مقارنة الأداء والمقاييس#
يتطلب فهم المفاضلات الدقيقة بين هذه النماذج تحليل الإنتاجية وكفاءة المعلمات. يوضح الجدول أدناه مقارنة سلسلة RTDETRv2 الحديثة بعائلة EfficientDet القابلة للتوسع.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
كما يظهر أعلاه، تضاهي RTDETRv2 أو تتجاوز متوسط الدقة (mAP) لنماذج EfficientDet ذات الأحجام المماثلة، مع سرعة أعلى بكثير على GPU (على سبيل المثال، 53.4 mAP في 9.76 ms لـRTDETRv2-l مقابل 52.6 mAP في 89.29 ms لـEfficientDet-d6)، مستفيدةً إلى حد كبير من بنية Transformer لتعزيز الدقة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين RT-DETR وEfficientDet على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار RT-DETR#
يُعد RT-DETR خيارًا قويًا في الحالات التالية:
- أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
- سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
- كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.
متى تختار EfficientDet#
يوصى باستخدام EfficientDet في الحالات التالية:
- مسارات Google Cloud وTPU: الأنظمة المتكاملة بعمق مع واجهات Google Cloud Vision API أو البنية التحتية لـTPU، حيث يتمتع EfficientDet بتحسينات أصلية.
- أبحاث التحجيم المركب: المقارنات الأكاديمية التي تركز على دراسة آثار التوسيع المتوازن لعمق الشبكة وعرضها ودقتها.
- النشر على الأجهزة المحمولة عبر LiteRT: المشاريع التي تتطلب تحديدًا التصدير باستخدام LiteRT (المعروف سابقًا باسم TensorFlow Lite) لأجهزة Android أو أجهزة Linux المضمنة.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
بديل Ultralytics: تطوير أحدث التقنيات#
مع أن RTDETRv2 وEfficientDet يتمتعان بمزايا قوية، فإن تطوير الذكاء الاصطناعي الحديث يتطلب أطر عمل توفر تجربة تطوير سلسة إلى جانب أداء متقدم. ويوفر نظام Ultralytics المتكامل نهجًا أكثر سلاسة بدرجة كبيرة لمهام الرؤية الحاسوبية.
إذا كنت تستكشف أحدث تقنيات الكشف، فإن Ultralytics YOLO26 الذي أُطلق حديثًا يجمع أفضل جوانب الشبكات العصبية الالتفافية والمحولات.
يطبق YOLO26 تصميمًا اختياريًا شاملًا من دون NMS (nms=False)، ما ينقل بساطة النشر التي يوفرها RTDETRv2 إلى بنية YOLO فائقة الكفاءة. كما يقدم محسّن MuSGD المستوحى من ابتكارات تدريب النماذج اللغوية الكبيرة، لتحقيق استقرار أفضل في التدريب. وبفضل إزالة DFL (إزالة خسارة Distribution Focal Loss لتبسيط التصدير وتحسين التوافق مع الأجهزة الطرفية ومنخفضة الطاقة)، يوفر YOLO26 استدلالًا على CPU أسرع بنسبة تصل إلى 43% مقارنة بالأجيال السابقة، ما يجعله خيارًا استثنائيًا لـالحوسبة الطرفية مقارنة بالنماذج الأثقل. بالإضافة إلى ذلك، توفر ProgLoss + STAL دوال خسارة محسنة مع تحسينات ملحوظة في التعرف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لإنترنت الأشياء والروبوتات والصور الجوية.
لا مثيل لسهولة الاستخدام التي توفرها حزمة Ultralytics لـPython. إذ يمكن للمطورين تدريب النماذج والتحقق من صحتها وتصديرها باستخدام API بديهية تُخفي التعليمات البرمجية النمطية التي تتطلبها عادةً مستودعات الأبحاث.
from ultralytics import RTDETR
# حمّل نموذج RT-DETR مدرّبًا مسبقًا من منظومة Ultralytics
model = RTDETR("rtdetr-l.pt")
# تدريب النموذج على مجموعة بيانات COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# صدّر النموذج للاستدلال المحسّن على TensorRT
model.export(format="engine")تدعم نماذج Ultralytics مهامًا متعددة بصورة أصلية، بما فيها تقسيم المثيلات وتصنيف الصور، ما يوفر مجموعة أدوات متعددة الاستخدامات تلبي احتياجات قطاعات متنوعة. بالإضافة إلى ذلك، تؤدي إزالة Distribution Focal Loss (DFL) من نماذج Ultralytics الحديثة إلى تبسيط الرسم البياني الحسابي، ما يضمن تصديرًا أكثر سلاسة إلى وحدات NPU ووحدات TPU المضمنة.
لإجراء تعليق توضيحي على البيانات وإدارة النماذج بسلاسة، توفر منصة Ultralytics بيئة سحابية شاملة للإشراف على دورة حياة التعلم الآلي بأكملها، ما يجعلها الخيار الأمثل لنشر حلول الرؤية الحاسوبية الموثوقة في بيئات الإنتاج.