RTDETRv2 مقابل YOLOv5#
تحدد تطور الرؤية الحاسوبية إلى حد كبير بالسعي المتواصل لتحقيق التوازن بين الدقة وسرعة الاستدلال الآني. وعند المقارنة بين RTDETRv2 وUltralytics YOLOv5، يوازن المطورون فعليًا بين قدرات السياق الشامل المتقدمة لبنى Transformer وكفاءة الشبكات العصبية الالتفافية (CNNs) المحسّنة للغاية والمجرّبة ميدانيًا.
يقدم هذا الدليل تحليلًا تقنيًا متعمقًا لهاتين البنيتين البارزتين، ويوضح مقاييس الأداء ومنهجيات التدريب ومتطلبات الذاكرة وسيناريوهات النشر المثالية لمساعدتك على اختيار نموذج اكتشاف الأجسام الأنسب لحالة الاستخدام الخاصة بك.
RTDETRv2: نهج Transformer للكشف الآني#
استنادًا إلى محوّل الكشف الآني (RT-DETR) الأصلي، يقدم RTDETRv2 مجموعة من «المزايا المجانية» لتحسين البنية الأساسية من دون التضحية بزمن الاستدلال.
- المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
- الجهة: Baidu
- التاريخ: 2024-07-24
- روابط: ورقة Arxiv، مستودع GitHub
البنية والإمكانات#
يستفيد RTDETRv2 من بنية هجينة تجمع CNN وTransformer. تعمل CNN بوصفها بنية أساسية لاستخراج السمات المرئية الدقيقة، بينما تعالج طبقات Transformer الخاصة بالمشفّر ومفكك الترميز خريطة السمات بأكملها لفهم السياق الشامل. ومن السمات البارزة لـ RTDETRv2 تصميمه الشامل الذي يلغي تمامًا الحاجة إلى المعالجة اللاحقة لـ الكبت غير الأقصى (NMS).
على الرغم من الدقة المذهلة التي يحققها RTDETRv2—خصوصًا في المشاهد المعقدة والكثيفة التي تتداخل فيها الأجسام—فإن له بعض المفاضلات المهمة. وتتطلب آلية الانتباه المتأصلة في نماذج Transformer ذاكرة CUDA أكبر بكثير أثناء التدريب مقارنةً بنماذج CNN القياسية. وإضافةً إلى ذلك، يؤدي أداءً جيدًا على وحدات GPU المتطورة مثل NVIDIA A100 أو T4، لكن بنيته أبطأ بوضوح على وحدات CPU القياسية، وتواجه قيودًا شديدة على الأجهزة الطرفية محدودة الموارد.
Ultralytics YOLOv5: معيار الكفاءة في القطاع#
غيّر Ultralytics YOLOv5 جذريًا مشهد التعلم الآلي التطبيقي عند إصداره، إذ أتاح الرؤية الحاسوبية عالية الأداء للمطورين في جميع أنحاء العالم عبر إطار عمل سهل الاستخدام على نحو استثنائي.
- المؤلف: Glenn Jocher
- المؤسسة: Ultralytics
- التاريخ: 26 يونيو 2020
- الروابط: الوثائق الرسمية، مستودع GitHub
التوازن بين المنظومة البرمجية والأداء#
بُني YOLOv5 بالكامل على إطار عمل PyTorch، ويعتمد على بنية CNN فائقة الكفاءة. وصُمم من البداية لتحقيق سهولة الاستخدام، إذ يتميز بواجهة API مبسطة وبعض أشمل الوثائق في مجال الذكاء الاصطناعي.
تتمثل أكبر مزايا YOLOv5 في تعدد استخداماته الذي لا يُضاهى ومتطلباته المنخفضة للذاكرة. ويتطلب تدريب نموذج YOLOv5 مقدارًا أقل بكثير من VRAM مقارنةً بالنماذج المعتمدة على Transformer، ما يجعله متاحًا للباحثين والمهندسين ذوي ميزانيات الأجهزة المحدودة. وإضافةً إلى ذلك، فبينما يركز RTDETRv2 حصريًا على اكتشاف مربعات الإحاطة، تطور YOLOv5 ليصبح نموذجًا متعدد الاستخدامات يدعم تجزئة الكائنات وتصنيف الصور.
للاستفادة من سير العمل الأكثر انسيابية، يمكنك تدريب YOLOv5 والتحقق منه ونشره مباشرةً باستخدام منصة Ultralytics. وتوفر المنصة إمكانات التدريب السحابي ومسارات نشر لا تتطلب كتابة أي تعليمات برمجية.
مقارنة الأداء والمقاييس#
عند تحليل الأداء الخام على مجموعة بيانات COCO القياسية، نلاحظ اختلافات واضحة في كيفية ترتيب هذه النماذج لأولويات الموارد.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
تحليل المفاضلات#
تكشف البيانات أن RTDETRv2-x يحقق ذروة متوسط الدقة (mAP) تبلغ 54.3%، متفوقًا قليلًا على YOLOv5x الذي يحقق 50.7%. لكن هذا التحسن الطفيف في الدقة يأتي بتكلفة حاسوبية باهظة. ويتميز YOLOv5x بزمن استجابة أقل (11.89 ms مقابل 15.03 ms على TensorRT)، ويتطلب جزءًا ضئيلًا من الذاكرة. أما في عمليات النشر الطرفية منخفضة الطاقة للغاية، فيظل YOLOv5n (Nano) بلا منافس؛ إذ ينجز الاستدلال خلال 1.12ms فقط، مع بنية صغيرة تضم 1.9M من المعلمات—وهي فئة لا يحاول RTDETRv2 منافستها أصلًا.
كفاءة التدريب وبساطة التعليمات البرمجية#
تتمثل إحدى نقاط القوة الرئيسية لمنظومة Ultralytics في واجهة API الموحدة. وحتى إن اخترت استخدام بنية Transformer في RT-DETR لمهمة محددة تتطلب قدرة حاسوبية كبيرة، فيمكنك تنفيذ ذلك بالكامل ضمن حزمة Python الخاصة بـ Ultralytics، والتبديل بين النماذج بسلاسة باستخدام سطر واحد من التعليمات البرمجية.
from ultralytics import RTDETR, YOLO
# تحميل نموذج Ultralytics YOLOv5 الصغير
model_yolo = YOLO("yolov5su.pt") # YOLOv5u: أوزان YOLOv5 الخالية من المراسي لحزمة ultralytics
# تحميل نموذج RT-DETR الكبير عبر Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")
# تدريب YOLOv5 بسهولة على بياناتك المخصصة
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# إجراء الاستدلال بسلاسة باستخدام كلا النموذجين
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo[0].show()باستخدام مكتبة Ultralytics، يحصل المطورون تلقائيًا على منظومة برمجية تحظى بصيانة جيدة، وتضم عمليات تكامل لتتبع التجارب (مثل Weights & Biases وComet ML)، وخيارات تصدير بنقرة واحدة إلى تنسيقات النشر مثل ONNX وOpenVINO.
التطبيقات الواقعية وحالات الاستخدام المثالية#
مواطن تألق RTDETRv2#
يلائم RTDETRv2 البيئات التي لا تفرض فيها الأجهزة أي قيود، ويكون الهدف الوحيد هو تحقيق أعلى دقة ممكنة.
- التصوير الطبي على الخوادم: اكتشاف الشذوذات المجهرية في صور الأشعة السينية عالية الدقة.
- صور الأقمار الصناعية: تتبع الأجسام الكثيفة والمتداخلة في مهام المراقبة الجوية باستخدام مجموعات سحابية قوية.
مواطن تفوق YOLOv5#
لا شك أن YOLOv5 هو الخيار الأفضل للنشر العملي في العالم الحقيقي عبر مجموعة متنوعة من الأجهزة.
- أجهزة الذكاء الاصطناعي الطرفية: نشر أنظمة الإنذار الأمني على Raspberry Pi أو أجهزة NVIDIA Jetson حيث تكون الذاكرة محدودة للغاية.
- تطبيقات الأجهزة المحمولة: تنفيذ استدلال سريع وآني لمربعات الإحاطة والتجزئة مباشرةً على الهواتف الذكية عبر CoreML أو LiteRT.
- التصنيع الصناعي عالي السرعة: فحص القطع على خطوط الإنتاج السريعة التي يكون فيها زمن الاستجابة بالمللي ثانية ضروريًا لنجاح العمليات.
على الرغم من مكانة YOLOv5 كنموذج أسطوري، تواصل منظومة Ultralytics دفع حدود الذكاء الاصطناعي. وإذا كنت تقارن النماذج لمشروع جديد في عام 2026، فمن المستحسن استكشاف أحدث ما توصلت إليه التقنية، وهو Ultralytics YOLO26. يضم YOLO26 تصميمًا شاملًا خاليًا من NMS أصليًا عبر رأس اختياري من نوع واحد إلى واحد (nms=False)، على غرار نماذج Transformer ولكن بسرعة CNN، ويتميز بمحسّن MuSGD الثوري الذي يتيح تدريبًا مستقرًا للغاية، كما يوفر استدلال CPU أسرع بنسبة تصل إلى 43%. وبدلًا من ذلك، يظل YOLO11 خيارًا ممتازًا ومدعومًا على نطاق واسع لعمليات النشر متعددة الاستخدامات التي تتطلب تقدير الوضعية واكتشاف OBB.
في نهاية المطاف، رغم أن RTDETRv2 يرفع سقف الدقة باستخدام طبقات Transformer، يوفر إطار عمل Ultralytics YOLO توازنًا لا يضاهى بين السرعة ومتطلبات الذاكرة المنخفضة وتجربة المطور المصممة ببراعة، ما يقلص كثيرًا الوقت اللازم للانتقال من النموذج الأولي إلى الإنتاج.