مقارنة بين RTDETRv2 وYOLOv9#
شهد مجال الرؤية الحاسوبية تباينًا لافتًا في الفلسفات المعمارية، ولا سيما بين الشبكات العصبية الالتفافية (CNNs) والنماذج القائمة على Transformer. وعند مقارنة RTDETRv2 وYOLOv9، يقيّم المطورون فعليًا المفاضلات بين آليات الانتباه الشامل ومعلومات التدرج القابلة للبرمجة. ويمثل كلا النموذجين قمة paradigms الخاصة بهما، إذ يدفعان حدود اكتشاف الأجسام في الوقت الفعلي.
مقدمة إلى النماذج#
RTDETRv2: Transformer للكشف في الوقت الفعلي#
طوّر باحثون في Baidu نموذج RTDETRv2، الذي يبني على RT-DETR الأصلي من خلال تقديم مجموعة من التحسينات المجانية لتعزيز Transformer الأساسي للكشف في الوقت الفعلي. ويعالج عنق الزجاجة التقليدي في نماذج Transformer، أي سرعة الاستدلال، مما يجعلها صالحة للتطبيقات في الوقت الفعلي.
- المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- الروابط: Arxiv، GitHub
من السمات المميزة لـ RTDETRv2 تصميمه الأصلي الشامل من البداية إلى النهاية والخالي من NMS. فمن خلال إزالة قمع غير الأعظمي (NMS) بالكامل أثناء المعالجة اللاحقة، يحقق النموذج استقرارًا في زمن استجابة الاستدلال ويبسط مسار النشر. وتتيح آلية الانتباه الشامل للنموذج التفوق في فهم المشاهد المعقدة والحشود الكثيفة، إذ يقيّم سياق الصورة بأكمله في الوقت نفسه.
YOLOv9: المعلومات القابلة للبرمجة للتدرجات#
يعالج YOLOv9، وهو بنية فعالة للغاية قائمة على CNN، مشكلة عنق زجاجة المعلومات المتأصلة في الشبكات العصبية العميقة. ويقدم معلومات التدرج القابلة للبرمجة (PGI) وشبكة تجميع الطبقات الفعالة المعممة (GELAN).
- المؤلفون: Chien-Yao Wang وHong-Yuan Mark Liao
- الجهة: معهد علوم المعلومات، أكاديمية سينيكا
- التاريخ: 21 فبراير 2024
- الروابط: Arxiv، GitHub
يعتمد YOLOv9 على أسس الشبكات العصبية الالتفافية المثبتة، لكنه يزيد إلى أقصى حد من كفاءة المعاملات. ومن خلال الاحتفاظ بالمعلومات الجوهرية أثناء عملية التمرير الأمامي، يضمن تحديثات موثوقة للأوزان، مما ينتج عنه نموذج خفيف للغاية وعالي الدقة. ومع ذلك، وعلى خلاف RTDETRv2، لا يزال YOLOv9 يعتمد على المعالجة اللاحقة القياسية باستخدام NMS.
الأداء وكفاءة الموارد#
عند تقييم هذه النماذج للاستخدام في الإنتاج، من الضروري تحقيق توازن بين متوسط الدقة (mAP) والتكلفة الحاسوبية. يوضح الجدول أدناه أداءها على مجموعة بيانات MS COCO.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
متطلبات الذاكرة وكفاءة التدريب#
تشتهر نماذج Transformer مثل RTDETRv2 باستهلاكها المكثف للذاكرة أثناء التدريب، إذ تتطلب غالبًا قدرًا كبيرًا من ذاكرة CUDA وجداول تدريب أطول حتى تصل إلى التقارب الكامل. وعلى العكس، توفر بنيات CNN مثل YOLOv9 وغيرها من نماذج Ultralytics YOLO استخدامًا أقل بكثير للذاكرة، مما يتيح للمطورين التدريب بأحجام دفعات أكبر على أجهزة متاحة للمستهلكين.
لتحقيق أقصى استفادة من موارد الأجهزة، فكّر في استخدام منصة Ultralytics لتدريب سحابي مبسط. فهي تتولى تلقائيًا إعداد البيئة وتحديد حجم الدفعة الأمثل.
ميزة Ultralytics: النظام البيئي وسهولة الاستخدام#
قد يكون البحث في المستودعات المستقلة، مثل صفحات GitHub الرسمية الخاصة بـ RTDETRv2 أو YOLOv9، مفيدًا للغاية من الناحية التعليمية، إلا أن بيئات الإنتاج تتطلب الاستقرار وسهولة الاستخدام ونظامًا بيئيًا يحظى بصيانة جيدة. ويوفر دمج هذه النماذج عبر Ultralytics Python API تجربة سلسة للمطورين.
واجهة API موحدة وتعدد الاستخدامات#
يجرّد إطار Ultralytics تعقيدات تحميل البيانات وزيادتها والتدريب الموزع. علاوة على ذلك، بينما يركز RTDETRv2 الأصلي حصريًا على الاكتشاف، يتيح النظام البيئي لـ Ultralytics للمستخدمين الانتقال بسهولة بين اكتشاف الأجسام وتجزئة المثيلات وتقدير الوضعيات.
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model on custom data
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)
# Easily switch to RT-DETR for complex scene evaluation
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")
# Export to production-ready formats like TensorRT
model_yolo.export(format="engine")بفضل التوثيق المتين، والتتبع التلقائي للتجارب، وإمكانات التصدير السلسة إلى صيغ مثل ONNX وTensorRT وOpenVINO، يقلل Ultralytics بدرجة كبيرة الوقت اللازم للانتقال من النموذج الأولي إلى الإنتاج.
حالات الاستخدام المثالية#
المجالات التي يتفوق فيها RTDETRv2#
بفضل آلية الانتباه الشامل، يُعد RTDETRv2 قويًا للغاية في المعالجة من جهة الخادم والبيئات التي يكون فيها السياق الشامل أمرًا بالغ الأهمية. ويتفوق في:
- التصوير الطبي: تحديد الحالات الشاذة الدقيقة التي يكون فيها السياق المحيط بالغ الأهمية.
- المراقبة الجوية: رصد الأجسام الصغيرة في لقطات الطائرات المسيّرة عالية الدقة دون التحيزات المكانية لعمليات الالتفاف التقليدية في CNN.
- تحليل الحشود الكثيفة: تتبع الأفراد في الحالات التي يؤدي فيها الت遮ية الشديد عادةً إلى إرباك النماذج القائمة على المراسي.
المجالات التي يتفوق فيها YOLOv9#
يُعد YOLOv9 رائدًا في عمليات النشر الطرفية المقيّدة بالموارد. وتجعل كفاءته الحاسوبية منه خيارًا مثاليًا لـ:
- الروبوتات: الملاحة في الوقت الفعلي وتجنب العوائق حيث تكون الحاجة إلى زمن استجابة منخفض للغاية.
- إنترنت الأشياء للمدن الذكية: النشر على أجهزة طرفية مثل NVIDIA Jetson لمراقبة حركة المرور.
- الفحص الصناعي: مراقبة الجودة على خطوط التجميع عالية السرعة، التي تتطلب معدلًا مرتفعًا من الإطارات في الثانية (FPS).
المستقبل: ظهور Ultralytics YOLO26#
رغم أن YOLOv9 وRTDETRv2 يمثلان قفزات هائلة إلى الأمام، فقد تطور المشهد بسرعة. وبالنسبة إلى عمليات النشر الحديثة، يمثل Ultralytics YOLO26 الذي أُطلق حديثًا التآزر الأمثل بين كلتا الفلسفتين المعماريتين.
ومن خلال الجمع بين أفضل جوانب Transformer وCNN، يضع YOLO26 معيارًا جديدًا:
- تصميم شامل من البداية إلى النهاية وخالٍ من NMS: مثل RTDETRv2، يتمتع YOLO26 بطبيعة شاملة من البداية إلى النهاية، إذ يلغي تمامًا المعالجة اللاحقة باستخدام NMS لتحقيق مسارات نشر أسرع وأبسط وقابلة للتنبؤ بدرجة عالية.
- مُحسِّن MuSGD: استلهامًا من تقنيات تدريب نماذج اللغة الكبيرة (LLM)، مثل Kimi K2 من Moonshot AI، يستخدم YOLO26 مزيجًا هجينًا من SGD وMuon. ويوفر ذلك استقرارًا تدريبيًا وتقاربًا سريعًا لا مثيل لهما في الرؤية الحاسوبية.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: بخلاف نماذج Transformer الثقيلة، حُسّن YOLO26 بدرجة كبيرة للحوسبة الطرفية والأجهزة التي لا تحتوي على GPU.
- إزالة DFL: تؤدي إزالة خسارة التركيز التوزيعية إلى تبسيط مخطط النموذج بدرجة كبيرة، مما يضمن تصديرًا سلسًا إلى الأجهزة الطرفية منخفضة الطاقة ووحدات معالجة الشبكات العصبية المضمنة (NPUs).
- ProgLoss + STAL: تعزز دوال الخسارة المحسّنة هذه بدرجة كبيرة التعرّف على الأجسام الصغيرة، وهي ميزة مهمة لمجموعات بيانات إنترنت الأشياء والبيانات الجوية.
بالنسبة إلى الفرق التي تتطلع إلى بدء مشروع جديد في الرؤية الحاسوبية، نوصي بشدة بتقييم YOLO26. فهو يوفر أناقة Transformer الخالية من NMS مع السرعة الفائقة وكفاءة التدريب التي تتميز بها بنية YOLO المحسّنة بدرجة كبيرة.
الملخص#
يعتمد الاختيار بين RTDETRv2 وYOLOv9 إلى حد كبير على أجهزة النشر واحتياجات الدقة المحددة. يوفر RTDETRv2 دقة متطورة ووعيًا بالسياق للتطبيقات المدعومة بالخوادم، بينما يوفر YOLOv9 كفاءة استثنائية للأجهزة الطرفية.
ومع ذلك، من خلال الاستفادة من النظام البيئي الناضج لـ Ultralytics، يمكن للمطورين تجربة كليهما بسهولة. علاوة على ذلك، ومع طرح نماذج أحدث مثل YOLO11 وYOLO26 الشامل من البداية إلى النهاية، أصبح العثور على التوازن المثالي بين الاستدلال عالي السرعة ودعم المهام المتنوع وانخفاض استهلاك الذاكرة أسهل من أي وقت مضى.