Ultralytics YOLO27:
Get Started

RTDETRv2 مقابل YOLOv9#

شهد مجال الرؤية الحاسوبية تباينًا مثيرًا للاهتمام في الفلسفات المعمارية، ولا سيما بين الشبكات العصبية الالتفافية (CNNs) والنماذج القائمة على Transformer. عند مقارنة RTDETRv2 وYOLOv9، يقيّم المطوّرون فعليًا المفاضلات بين آليات الانتباه الشامل ومعلومات التدرج القابلة للبرمجة. ويمثّل كلا النموذجين قمة الأداء في النهجين اللذين ينتمي إليهما، ويدفعان حدود اكتشاف الكائنات الآني.

مقدمة عن النماذج#

RTDETRv2: Transformer للاكتشاف الآني#

طوّر باحثون في Baidu نموذج RTDETRv2 استنادًا إلى RT-DETR الأصلي، وأضافوا إليه «Bag-of-Freebies» لتحسين Transformer الأساسي للاكتشاف الآني. ويعالج النموذج الاختناق التقليدي في Transformers، أي سرعة الاستدلال، ما يجعل استخدامها ممكنًا في التطبيقات الآنية.

  • المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
  • الجهة: Baidu
  • التاريخ: 2024-07-24
  • الروابط: Arxiv، GitHub

من السمات المميزة لـRTDETRv2 تصميمه الشامل والخالي من NMS أصليًا. ومن خلال إزالة الكبت غير الأقصى (NMS) تمامًا أثناء المعالجة اللاحقة، يثبّت النموذج زمن استدلال الاستجابة ويبسط مسار النشر. وتتيح آلية الانتباه الشامل للنموذج التفوق في فهم المشاهد المعقدة والحشود الكثيفة، لأنه يقيّم سياق الصورة بأكمله في الوقت نفسه.

تعرّف على المزيد حول RTDETRv2

YOLOv9: معلومات التدرج القابلة للبرمجة#

يعالج YOLOv9، وهو بنية فعالة جدًا قائمة على CNN، مشكلة اختناق المعلومات المتأصلة في الشبكات العصبية العميقة. ويقدّم معلومات التدرج القابلة للبرمجة (PGI) وشبكة تجميع الطبقات الفعالة المعممة (GELAN).

يعتمد YOLOv9 على أسس الشبكات العصبية الالتفافية المثبتة، مع زيادة كفاءة المعلمات إلى أقصى حد. ومن خلال الاحتفاظ بالمعلومات الأساسية أثناء عملية التمرير الأمامي، يضمن تحديثات موثوقة للأوزان، ما ينتج عنه نموذج خفيف للغاية ودقيق بدرجة عالية. لكن، على عكس RTDETRv2، لا يزال YOLOv9 يعتمد على المعالجة اللاحقة القياسية باستخدام NMS.

تعرّف على المزيد عن YOLOv9

الأداء وكفاءة الموارد#

عند تقييم هذه النماذج للإنتاج، من الضروري الموازنة بين متوسط الدقة المتوسط (mAP) والتكلفة الحاسوبية. يوضّح الجدول أدناه أداءها على مجموعة بيانات MS COCO.

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

متطلبات الذاكرة وكفاءة التدريب#

من المعروف أن Transformers مثل RTDETRv2 تستهلك قدرًا كبيرًا من الذاكرة أثناء التدريب، وغالبًا ما تتطلب ذاكرة CUDA كبيرة وجداول تدريب أطول حتى تحقق التقارب الكامل. وعلى النقيض، تستهلك بنى CNN مثل YOLOv9 وغيرها من نماذج Ultralytics YOLO ذاكرة أقل بكثير، ما يتيح للمطوّرين التدريب بأحجام دفعات أكبر على أجهزة استهلاكية.

تدريب فعال

لتحقيق أقصى استفادة من الأجهزة، فكّر في استخدام منصة Ultralytics لتبسيط التدريب السحابي. فهي تتولى تلقائيًا إعداد البيئة واختيار حجم الدفعة الأمثل.

ميزة Ultralytics: المنظومة وسهولة الاستخدام#

قد يكون البحث في مستودعات مستقلة، مثل صفحات GitHub الرسمية لـRTDETRv2 أو YOLOv9، مفيدًا جدًا من الناحية التعليمية، لكن بيئات الإنتاج تتطلب الاستقرار وسهولة الاستخدام ومنظومة تحظى بصيانة جيدة. ويوفّر دمج هذه النماذج عبر واجهة Python API من Ultralytics تجربة تطوير سلسة.

واجهة API موحّدة وتعدد الاستخدامات#

يجرّد إطار عمل Ultralytics تحميل البيانات وزيادتها والتدريب الموزع من التعقيدات. وإضافةً إلى ذلك، بينما يركّز RTDETRv2 الأصلي على الاكتشاف فقط، تتيح منظومة Ultralytics للمستخدمين الانتقال بسهولة بين اكتشاف الكائنات وتقسيم المثيلات وتقدير الوضعية.

from ultralytics import RTDETR, YOLO

# ⁨تدريب نموذج YOLOv9 على بيانات مخصصة⁩
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)

# ⁨التبديل بسهولة إلى RT-DETR لتقييم المشاهد المعقدة⁩
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

# ⁨التصدير إلى تنسيقات جاهزة للإنتاج مثل TensorRT⁩
model_yolo.export(format="engine")

بفضل الوثائق الشاملة، والتتبع التلقائي للتجارب، وإمكانات التصدير السلسة إلى تنسيقات مثل ONNX وTensorRT وOpenVINO، تقلّص Ultralytics بدرجة كبيرة الوقت اللازم للانتقال من النموذج الأولي إلى الإنتاج.

حالات الاستخدام المثالية#

المجالات التي يتألق فيها RTDETRv2#

بفضل آلية الانتباه الشامل، يُعد RTDETRv2 خيارًا قويًا لـ المعالجة على الخوادم والبيئات التي يكون فيها السياق الشامل بالغ الأهمية. ويتألق في:

  • التصوير الطبي: اكتشاف الحالات الشاذة الدقيقة التي يكون فيها السياق المحيط حاسمًا.
  • المراقبة الجوية: رصد الأجسام الصغيرة في لقطات الطائرات المسيّرة عالية الدقة، دون الانحيازات المكانية التي تسببها التفافات CNN التقليدية.
  • تحليل الحشود الكثيفة: تتبّع الأفراد في الحالات التي يؤدي فيها الاحتجاب الشديد عادةً إلى إرباك النماذج القائمة على المراسي.

المجالات التي يتألق فيها YOLOv9#

يتميز YOLOv9 في عمليات النشر الطرفية ذات الموارد المحدودة. وتجعله كفاءته الحاسوبية مثاليًا لما يلي:

  • الروبوتات: الملاحة الآنية وتجنب العوائق عند الحاجة إلى زمن استجابة أدنى.
  • إنترنت الأشياء في المدن الذكية: النشر على الأجهزة الطرفية مثل NVIDIA Jetson لمراقبة حركة المرور.
  • الفحص الصناعي: مراقبة جودة خطوط التجميع عالية السرعة التي تتطلب معدلًا مرتفعًا للإطارات في الثانية (FPS).

المستقبل: ظهور Ultralytics YOLO26#

مع أن YOLOv9 وRTDETRv2 يمثلان قفزات هائلة إلى الأمام، فقد تطور المجال بسرعة. وبالنسبة إلى عمليات النشر الحديثة، يمثّل Ultralytics YOLO26 الذي أُطلق حديثًا التناغم الأمثل بين الفلسفتين المعماريتين.

من خلال الجمع بين أفضل جوانب Transformer وCNN، يضع YOLO26 معيارًا جديدًا:

  • تصميم شامل من البداية إلى النهاية، دون NMS: مثل RTDETRv2، يدعم YOLO26 الاستدلال الأصلي الشامل من البداية إلى النهاية، ويتجاوز المعالجة اللاحقة لـ NMS باستخدام nms=False لإنشاء مسارات نشر أسرع وأبسط وأكثر قابلية للتنبؤ.
  • محسّن MuSGD: استلهامًا من تقنيات تدريب نماذج اللغة الكبيرة (LLM)، مثل Kimi K2 من Moonshot AI، يستخدم YOLO26 مزيجًا من SGD وMuon. ويوفر ذلك استقرارًا غير مسبوق في التدريب وتقاربًا سريعًا في مجال الرؤية الحاسوبية.
  • استدلال أسرع على CPU بنسبة تصل إلى 43%: خلافًا لنماذج Transformer الثقيلة، جرى تحسين YOLO26 بدرجة كبيرة للحوسبة الطرفية والأجهزة التي لا تحتوي على GPU.
  • إزالة DFL: تؤدي إزالة Distribution Focal Loss إلى تبسيط مخطط النموذج بدرجة كبيرة، ما يضمن تصديرًا سلسًا إلى الأجهزة الطرفية منخفضة الطاقة ووحدات المعالجة العصبية المضمنة (NPU).
  • ProgLoss + STAL: تعزز دوال الخسارة المحسّنة هذه بدرجة كبيرة التعرّف على الأجسام الصغيرة، وهي ميزة أساسية لمجموعات بيانات إنترنت الأشياء والتصوير الجوي.

نوصي بشدة الفرق التي ترغب في بدء مشروع جديد للرؤية الحاسوبية بتقييم YOLO26. فهو يجمع بين أناقة Transformer الاختيارية الخالية من NMS وسرعة YOLO الفائقة وكفاءة التدريب التي توفرها بنية محسّنة بدرجة كبيرة.

الملخص#

يعتمد الاختيار بين RTDETRv2 وYOLOv9 بدرجة كبيرة على عتاد النشر ومتطلبات الدقة المحددة. يوفر RTDETRv2 دقة متقدمة ووعيًا بالسياق للتطبيقات المدعومة بالخوادم، بينما يقدم YOLOv9 كفاءة استثنائية للأجهزة الطرفية.

لكن بالاستفادة من منظومة Ultralytics الناضجة، يستطيع المطورون تجربة YOLOv9 وRT-DETR الأصلي بسهولة. علاوة على ذلك، ومع طرح نماذج أحدث مثل YOLO11 وYOLO26 الشامل أصليًا من البداية إلى النهاية، أصبح العثور على التوازن المثالي بين الاستدلال عالي السرعة، ودعم المهام المتعددة، وانخفاض استهلاك الذاكرة أسهل من أي وقت مضى.

التعليقات