رؤية YOLO 2026:

مقارنة بين RTDETRv2 و YOLOv9#

شهد مجال الرؤية الحاسوبية تباعداً رائعاً في الفلسفات المعمارية، وتحديداً بين الشبكات العصبية التلافيفية (CNNs) والنماذج القائمة على Transformer. عند مقارنة RTDETRv2 و YOLOv9، يقوم المطورون عملياً بتقييم المفاضلات بين آليات الانتباه العالمية ومعلومات التدرج القابلة للبرمجة. يمثل كلا النموذجين قمة نماذجهم الخاصة، مما يدفع حدود اكتشاف الكائنات في الوقت الفعلي.

مقدمة عن النماذج#

RTDETRv2: محول اكتشاف في الوقت الفعلي#

تم تطوير RTDETRv2 بواسطة باحثين في Baidu، وهو يعتمد على RT-DETR الأصلي من خلال تقديم "مجموعة من الهدايا" (Bag-of-Freebies) لتعزيز محول اكتشاف الوقت الفعلي الأساسي. وهو يعالج عنق الزجاجة التقليدي للمحولات - سرعة الاستنتاج - مما يجعلها قابلة للتطبيق في الوقت الفعلي.

  • المؤلفون: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, و Yi Liu
  • المنظمة: Baidu
  • التاريخ: 24-07-2024
  • الروابط: Arxiv، GitHub

من الخصائص المميزة لـ RTDETRv2 تصميمه الأصلي المعتمد على المعالجة الشاملة بدون NMS. فمن خلال إزالة قمع غير الحد الأقصى (NMS) تماماً أثناء المعالجة اللاحقة، يعمل النموذج على تثبيت زمن انتقال الاستنتاج وتبسيط خط أنابيب النشر. تسمح آلية الانتباه العالمية للنموذج بالتفوق في فهم المشاهد المعقدة والحشود الكثيفة، حيث يقوم بتقييم سياق الصورة بالكامل في وقت واحد.

اعرف المزيد عن RTDETRv2

YOLOv9: معلومات التدرج القابلة للبرمجة#

يعالج YOLOv9، وهو بنية معمارية عالية الكفاءة تعتمد على CNN، مشكلة اختناق المعلومات المتأصلة في الشبكات العصبية العميقة. وهو يقدم معلومات التدرج القابلة للبرمجة (PGI) وشبكة تجميع الطبقات العامة الفعالة (GELAN).

يعتمد YOLOv9 على أساسيات شبكة العصبون التلافيفية المثبتة ولكنه يحقق أقصى قدر من كفاءة المعلمات. من خلال الاحتفاظ بالمعلومات الحيوية أثناء عملية التغذية الأمامية، فإنه يضمن تحديثات موثوقة للأوزان، مما ينتج عنه نموذج خفيف الوزن بشكل لا يصدق ولكنه عالي الدقة. ومع ذلك، على عكس RTDETRv2، لا يزال YOLOv9 يعتمد على المعالجة اللاحقة القياسية NMS.

اعرف المزيد عن YOLOv9

الأداء وكفاءة الموارد#

عند تقييم هذه النماذج للإنتاج، يعد موازنة متوسط دقة التنبؤ (mAP) مقابل التكلفة الحسابية أمراً بالغ الأهمية. يوضح الجدول أدناه أداؤهم على مجموعة بيانات MS COCO.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

متطلبات الذاكرة وكفاءة التدريب#

تشتهر المحولات مثل RTDETRv2 بأنها تستهلك ذاكرة كثيفة أثناء التدريب، وغالباً ما تتطلب ذاكرة CUDA كبيرة وجداول زمنية أطول للتدريب للتقارب بشكل كامل. على العكس من ذلك، توفر معماريات CNN مثل YOLOv9 ونماذج Ultralytics YOLO الأخرى استخداماً أقل بكثير للذاكرة، مما يسمح للمطورين بالتدريب بأحجام دفعات أكبر على الأجهزة الاستهلاكية.

التدريب الفعال

لتعظيم استخدام الأجهزة، فكر في استخدام منصة Ultralytics للتدريب السحابي المبسط. فهي تتعامل تلقائياً مع إعداد البيئة وتحديد حجم الدفعة الأمثل.

ميزة Ultralytics: النظام البيئي وسهولة الاستخدام#

على الرغم من أن البحث في المستودعات المستقلة مثل صفحات GitHub الرسمية لـ RTDETRv2 أو YOLOv9 يمكن أن يكون تعليمياً للغاية، إلا أن بيئات الإنتاج تتطلب الاستقرار وسهولة الاستخدام ونظاماً البيئيّاً مُداراً جيداً. يوفر دمج هذه النماذج من خلال واجهة برمجة تطبيقات Python من Ultralytics تجربة مطور سلسة.

واجهة برمجة تطبيقات موحدة وتعدد الاستخدامات#

يعمل إطار عمل Ultralytics على إخفاء تعقيدات تحميل البيانات، والتحسينات، والتدريب الموزع. علاوة على ذلك، في حين أن RTDETRv2 الأصلي يركز حصرياً على الاكتشاف، فإن النظام البيئي لـ Ultralytics يسمح للمستخدمين بالانتقال بسهولة بين اكتشاف الكائنات، وتجزئة المثيلات، وتقدير الوضعية.

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model on custom data
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)

# Easily switch to RT-DETR for complex scene evaluation
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

# Export to production-ready formats like TensorRT
model_yolo.export(format="engine")

مع التوثيق القوي، والتتبع التلقائي للتجارب، وإمكانيات التصدير السلسة إلى تنسيقات مثل ONNX، وTensorRT، وOpenVINO، تقلل Ultralytics بشكل جذري من الوقت المستغرق من النموذج الأولي إلى الإنتاج.

حالات الاستخدام المثالية#

أين يتفوق RTDETRv2#

بفضل آلية الانتباه العالمية، يعد RTDETRv2 قوة هائلة لـ المعالجة من جانب الخادم والبيئات التي يكون فيها السياق العالمي أمراً بالغ الأهمية. وهو يتفوق في:

  • التصوير الطبي: تحديد الشذوذات الدقيقة حيث يكون السياق المحيط أمراً بالغ الأهمية.
  • المراقبة الجوية: اكتشاف الكائنات الصغيرة في لقطات الطائرات بدون طيار عالية الدقة دون التحيزات المكانية لتلافيف CNN التقليدية.
  • تحليل الحشود الكثيفة: تتبع الأفراد حيث يؤدي الانسداد الشديد عادةً إلى إرباك النماذج القائمة على المرساة (anchor-based).

أين يتفوق YOLOv9#

يعد YOLOv9 بطلاً في عمليات النشر على الحافة المقيدة بالموارد. تجعله كفاءته الحسابية مثالياً لـ:

  • الروبوتات: الملاحة في الوقت الفعلي وتجنب العوائق حيث يتطلب الأمر حداً أدنى من زمن الاستجابة.
  • إنترنت الأشياء للمدن الذكية: النشر على الأجهزة الطرفية مثل NVIDIA Jetson لمراقبة حركة المرور.
  • التفتيش الصناعي: مراقبة جودة خط التجميع عالي السرعة الذي يتطلب معدل إطارات مرتفع في الثانية (FPS).

المستقبل: مرحباً بـ Ultralytics YOLO26#

في حين أن YOLOv9 وRTDETRv2 يمثلان قفزات هائلة إلى الأمام، فقد تطور المشهد بسرعة. بالنسبة للنشر الحديث، يمثل الإصدار الجديد Ultralytics YOLO26 التآزر النهائي لكلا الفلسفتين المعماريتين.

من خلال أخذ أفضل جوانب المحولات و CNNs، يضع YOLO26 معياراً جديداً:

  • تصميم أصلي شامل بدون NMS: مثل RTDETRv2، يعمل YOLO26 بشكل أصلي وشامل، مما يلغي تماماً معالجة NMS اللاحقة للحصول على خطوط أنابيب نشر أسرع وأبسط وأكثر قابلية للتنبؤ.
  • مُحسِّن MuSGD: مستوحى من تقنيات تدريب النماذج اللغوية الكبيرة (LLM) (مثل Kimi K2 من Moonshot AI)، يستخدم YOLO26 مزيجاً من SGD و Muon. وهذا يجلب استقراراً لا مثيل له في التدريب وتقارباً سريعاً في الرؤية الحاسوبية.
  • أسرع بنسبة تصل إلى 43% في استنتاج وحدة المعالجة المركزية (CPU): على عكس المحولات الثقيلة، تم تحسين YOLO26 بشكل كبير لحوسبة الحافة والأجهزة التي لا تحتوي على وحدات معالجة رسوميات (GPUs).
  • إزالة DFL: تعمل إزالة خسارة البؤرة للتوزيع (Distribution Focal Loss) على تبسيط رسم بياني للنموذج بشكل كبير، مما يضمن تصديراً لا تشوبه شائبة إلى أجهزة الحافة منخفضة الطاقة ووحدات المعالجة العصبية المدمجة (NPUs).
  • ProgLoss + STAL: تعمل دوال الخسارة المحسنة هذه على تعزيز التعرف على الكائنات الصغيرة بشكل كبير، وهي ميزة بالغة الأهمية لمجموعات بيانات إنترنت الأشياء والبيانات الجوية.

بالنسبة للفرق التي تتطلع إلى بدء مشروع رؤية حاسوبية جديد، نوصي بشدة بتقييم YOLO26. فهو يوفر أناقة المحول الخالية من NMS مع السرعة الفائقة وكفاءة التدريب لبنية YOLO عالية التحسين.

تعرف على المزيد حول YOLO26

ملخص#

يعتمد الاختيار بين RTDETRv2 و YOLOv9 إلى حد كبير على أجهزة النشر الخاصة بك واحتياجات الدقة المحددة. يوفر RTDETRv2 أحدث دقة ووعياً بالسياق للتطبيقات المدعومة بالخادم، بينما يوفر YOLOv9 كفاءة استثنائية لأجهزة الحافة.

ومع ذلك، من خلال الاستفادة من نظام Ultralytics البيئي الناضج، يمكن للمطورين التجربة بسهولة مع كليهما. علاوة على ذلك، مع إدخال نماذج أحدث مثل YOLO11 وYOLO26 المتكامل أصلاً من البداية إلى النهاية، لم يكن العثور على التوازن المثالي بين الاستدلال عالي السرعة، ودعم المهام المتعددة، واستهلاك الذاكرة المنخفض أسهل من أي وقت مضى.

التعليقات