RTDETRv2 مقابل EfficientDet#
يُعد اختيار البنية المثلى للشبكة العصبية قرارًا محوريًا لأي مشروع في الرؤية الحاسوبية. تتناول هذه المقارنة التقنية الشاملة نموذجين مؤثرين لكشف الأجسام: RTDETRv2، وهو كاشف حديث قائم على Transformer، وEfficientDet، وهي شبكة عصبية التفافية قابلة للتوسع بدرجة كبيرة. سنقيّم بنيتيهما المتميزتين، ومقاييس الأداء، ومنهجيات التدريب، وسيناريوهات النشر المثالية لمساعدتك على اتخاذ قرارات قائمة على البيانات لمسارات الذكاء الاصطناعي لديك.
RTDETRv2: Transformer للكشف في الزمن الحقيقي#
استنادًا إلى نجاح RT-DETR الأصلي، يعمل RTDETRv2 على تحسين نهج كشف الأجسام القائم على Transformer. ومن خلال تحسين بنيتي المُرمّز وفاكّ الترميز، يحقق دقة عالية مع الحفاظ على سرعات استدلال آنية، ما يسد الفجوة بفاعلية بين شبكات CNN التقليدية وTransformers الخاصة بالرؤية.
تفاصيل النموذج
- المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- الروابط: Arxiv، GitHub، المستندات
البنية ونقاط القوة الأساسية#
يستخدم RTDETRv2 بنية هجينة تجمع بين جذع CNN قوي (غالبًا ResNet أو HGNet) وفاكّ ترميز فعال قائم على Transformer. وتتمثل السمة الأكثر تمييزًا لـ RTDETRv2 في قدرته الأصلية على تجاوز الكبت غير الأقصى (NMS). تتطلب الكواشف التقليدية استخدام NMS لتصفية صناديق الإحاطة المكررة، ما يضيف زمن استدلال متغيرًا أثناء المعالجة اللاحقة. ويصوغ RTDETRv2 عملية الكشف باعتبارها مسألة تنبؤ مباشر بمجموعة، مستخدمًا المطابقة الثنائية لإخراج تنبؤات فريدة.
يتفوق هذا النموذج في عمليات النشر على جانب الخادم حيث تتوافر ذاكرة GPU بكثرة. وتوفر آلية الانتباه الشامل لديه وعيًا استثنائيًا بالسياق، ما يجعله بارعًا للغاية في فصل الأجسام المتداخلة في البيئات الكثيفة والمزدحمة، مثل أنظمة إنذار الأمان المؤتمتة أو مراقبة الحشود الكثيفة.
القيود#
رغم قوتها، تتطلب بنيات Transformer بطبيعتها ذاكرة CUDA أكبر أثناء التدريب مقارنةً بشبكات CNN القياسية. علاوة على ذلك، قد يتطلب الضبط الدقيق لـ RTDETRv2 أوقات تقارب ممتدة لـبيانات التدريب، ما يجعل إنشاء النماذج الأولية سريعًا أكثر استهلاكًا للموارد قليلًا.
EfficientDet: شبكات CNN قابلة للتوسع وفعالة#
قدّم EfficientDet عائلة من نماذج كشف الأجسام المحسّنة لتحقيق الدقة والكفاءة على حد سواء عبر نطاق واسع من قيود الموارد. ولا يزال مثالًا كلاسيكيًا على تصميم قابل للتوسع لـالرؤية الآلية.
تفاصيل النموذج
- المؤلفون: Mingxing Tan وRuoming Pang وQuoc V. Le
- الجهة: Google
- التاريخ: 2019-11-20
- الروابط: Arxiv، GitHub، المستندات
البنية ونقاط القوة الأساسية#
يكمن الابتكار وراء EfficientDet في مجالين رئيسيين: شبكة هرم الميزات ثنائية الاتجاه (BiFPN) وطريقة التحجيم المركب. تتيح BiFPN استخراج الميزات متعدد المقاييس بطريقة بسيطة وسريعة، وذلك من خلال إدخال أوزان قابلة للتعلّم لتعلّم أهمية ميزات الإدخال المختلفة، مع تطبيق دمج الميزات متعدد المقاييس من أعلى إلى أسفل ومن أسفل إلى أعلى بصورة متكررة. وتعمل طريقة التحجيم المركب على تحجيم دقة الشبكة وعمقها وعرضها بالتزامن وبصورة موحّدة.
تتراوح نماذج EfficientDet من D0 فائق الخفة إلى D7 الضخم. وهذا يجعلها متعددة الاستخدامات للغاية في عمليات نشر الذكاء الاصطناعي الطرفي، حيث يتعين على المطورين تحقيق توازن بين الميزانيات الحسابية المحدودة ومتطلبات الدقة، كما في تطبيقات الواقع المعزز المحمولة المبكرة.
القيود#
EfficientDet بنية أقدم تعتمد بدرجة كبيرة على صناديق الارتساء ومسار المعالجة اللاحقة التقليدي لـ NMS. وتتطلب عملية إنشاء صناديق الارتساء ضبطًا دقيقًا للمعلمات الفائقة، كما قد تؤدي خطوة NMS إلى اختناق عملية النشر على العتاد المضمّن مثل Raspberry Pi. كما تفتقر إلى دعم أصلي لمهام حديثة مثل تقدير الوضعية أو صناديق الإحاطة الموجّهة (OBB).
مقارنة الأداء والمقاييس#
يتطلب فهم المفاضلات الدقيقة بين هذه النماذج تحليل معدل إنتاجيتها وكفاءة معلماتها. ويوضح الجدول أدناه كيفية مقارنة سلسلة RTDETRv2 الحديثة بعائلة EfficientDet القابلة للتوسع.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
كما يتضح أعلاه، يحقق RTDETRv2 متوسط دقة (mAP) أعلى بكثير عند أعداد معلمات مماثلة لنماذج EfficientDet متوسطة المستوى، مستفيدًا بدرجة كبيرة من بنية Transformer لتعزيز الدقة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين RT-DETR وEfficientDet على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلاتك المتعلقة بالنظام البيئي.
متى تختار RT-DETR#
يُعد RT-DETR خيارًا قويًا من أجل:
- أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
- السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
- اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.
متى تختار EfficientDet#
يوصى باستخدام EfficientDet في الحالات التالية:
- مسارات Google Cloud وTPU: الأنظمة المدمجة بعمق مع واجهات Google Cloud Vision API أو البنية التحتية لـTPU، حيث يتمتع EfficientDet بتحسين أصلي.
- أبحاث التحجيم المركّب: المقارنات الأكاديمية التي تركز على دراسة تأثيرات تحجيم عمق الشبكة وعرضها ودقتها بصورة متوازنة.
- النشر على الأجهزة المحمولة عبر TFLite: المشروعات التي تتطلب تحديدًا تصدير TensorFlow Lite إلى أجهزة Android أو أجهزة Linux المضمنة.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
بديل Ultralytics: الارتقاء بأحدث ما توصلت إليه التقنية#
رغم أن لكل من RTDETRv2 وEfficientDet مزايا قوية، فإن تطوير الذكاء الاصطناعي الحديث يتطلب أُطرًا توفر تجربة مطور سلسة إلى جانب أداء متطور. ويوفر النظام البيئي لـ Ultralytics نهجًا أكثر انسيابية بكثير لمهام الرؤية الحاسوبية.
إذا كنت تستكشف أحدث تقنيات الكشف، فإن Ultralytics YOLO26 المطروح حديثًا يجمع أفضل جوانب كل من شبكات CNN وTransformers.
يطبّق YOLO26 تصميمًا شاملًا من البداية إلى النهاية وخاليًا من NMS، جامعًا بساطة نشر RTDETRv2 مع بنية YOLO فائقة الكفاءة. علاوة على ذلك، يقدّم مُحسِّن MuSGD—المستلهم من ابتكارات تدريب LLM—لتحقيق استقرار فائق أثناء التدريب. ومع إزالة DFL (إزالة Distribution Focal Loss لتبسيط التصدير وتحسين التوافق مع الأجهزة الطرفية ومنخفضة الطاقة)، يحقق YOLO26 استدلالًا على CPU أسرع بنسبة تصل إلى 43% من الأجيال السابقة، ما يجعله خيارًا استثنائيًا لـالحوسبة الطرفية مقارنةً بالنماذج الأثقل. بالإضافة إلى ذلك، يوفر ProgLoss + STAL دوال خسارة محسّنة مع تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لإنترنت الأشياء والروبوتات والصور الجوية.
لا تُضاهى سهولة الاستخدام التي توفرها حزمة Ultralytics Python. إذ يستطيع المطورون تدريب النماذج والتحقق منها وتصديرها باستخدام API بديهية تخفي التعليمات البرمجية المتكررة التي تتطلبها عادةً مستودعات الأبحاث.
from ultralytics import RTDETR
# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export for optimized inference on TensorRT
model.export(format="engine")تدعم نماذج Ultralytics أصليًا مهام متعددة، بما في ذلك تجزئة المثيلات وتصنيف الصور، ما يوفر مجموعة أدوات متعددة الاستخدامات لتلبية احتياجات القطاعات المتنوعة. علاوة على ذلك، تؤدي إزالة Distribution Focal Loss (DFL) في نماذج Ultralytics الحديثة إلى تبسيط الرسم البياني الحسابي، ما يضمن تصديرًا أكثر سلاسة إلى NPUs وTPUs المضمّنة.
لتوفير وسم البيانات وإدارة النماذج بسلاسة، توفر منصة Ultralytics بيئة سحابية شاملة للإشراف على دورة حياة تعلّم الآلة بأكملها، ما يرسخ مكانتها بوصفها الخيار الرائد لنشر حلول قوية للرؤية الحاسوبية في بيئات الإنتاج.