Ultralytics YOLO27:

مقارنة بين RTDETRv2 وYOLOv5#

لقد تحدد تطور الرؤية الحاسوبية إلى حد كبير بالسعي الدؤوب إلى تحقيق التوازن بين الدقة وسرعة الاستدلال في الوقت الفعلي. وعند مقارنة RTDETRv2 وUltralytics YOLOv5، يوازن المطورون أساسًا بين قدرات فهم السياق الشامل المتقدمة في بنيات Transformer والكفاءة عالية التحسين والمختبرة ميدانيًا للشبكات العصبية الالتفافية (CNNs).

يقدم هذا الدليل تحليلًا تقنيًا متعمقًا لهاتين البنيتين البارزتين، مع توضيح مقاييس الأداء ومنهجيات التدريب ومتطلبات الذاكرة وسيناريوهات النشر المثالية لمساعدتك على اختيار أفضل نموذج لـاكتشاف الأجسام لحالة الاستخدام الخاصة بك.

RTDETRv2: نهج Transformer للكشف في الوقت الفعلي#

استنادًا إلى Transformer للكشف في الوقت الفعلي (RT-DETR) الأصلي، يقدم RTDETRv2 سلسلة من «المزايا المجانية» لتحسين البنية الأساسية دون التضحية بزمن استدلالها.

  • المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
  • المنظمة: Baidu
  • التاريخ: 2024-07-24
  • الروابط: ورقة Arxiv، مستودع GitHub

البنية والقدرات#

يستفيد RTDETRv2 من بنية هجينة تجمع بين CNN وTransformer. تعمل CNN كعمود فقري لاستخراج السمات البصرية الدقيقة، بينما تعالج طبقات المُرمّز-فكّاك الترميز في Transformer خريطة السمات بأكملها لفهم السياق الشامل. ومن أبرز سمات RTDETRv2 طبيعته الشاملة من البداية إلى النهاية، إذ يلغي تمامًا الحاجة إلى المعالجة اللاحقة لـقمع القيم غير العظمى (NMS).

رغم أن RTDETRv2 يحقق دقة مذهلة، ولا سيما في المشاهد المعقدة والكثيفة التي تتداخل فيها الأجسام، فإنه ينطوي على مقايضات ملحوظة. إذ تتطلب آلية الانتباه المتأصلة في بنى Transformer قدرًا أكبر بكثير من ذاكرة CUDA أثناء التدريب مقارنةً بـCNNs القياسية. علاوة على ذلك، ورغم أدائه الجيد على وحدات GPU المتطورة مثل NVIDIA A100 أو T4، فإن بنيته تكون أبطأ بوضوح على وحدات CPU القياسية، كما تواجه قيودًا شديدة على الأجهزة الطرفية محدودة الموارد.

تعرّف على المزيد حول RTDETRv2

Ultralytics YOLOv5: المعيار الصناعي للكفاءة#

غيّر Ultralytics YOLOv5 مشهد تعلّم الآلة التطبيقي تغييرًا جوهريًا عند إصداره، إذ أتاح الرؤية الحاسوبية عالية الأداء للمطورين حول العالم من خلال إطار عمل سهل الاستخدام بصورة استثنائية.

التوازن بين المنظومة والأداء#

بُني YOLOv5 بالكامل على إطار عمل PyTorch، ويعتمد على بنية CNN عالية الكفاءة إلى حد كبير. وقد صُمم من الأساس ليسهّل الاستخدام، إذ يتضمن API مبسطة وبعضًا من أشمل الوثائق في مجال الذكاء الاصطناعي.

تكمن أعظم مزايا YOLOv5 في تعدد استخداماته الذي لا يُضاهى ومتطلباته المنخفضة من الذاكرة. ويتطلب تدريب نموذج YOLOv5 قدرًا أقل بكثير من VRAM مقارنةً بالنماذج القائمة على Transformer، ما يجعله متاحًا للباحثين والمهندسين ذوي الميزانيات المحدودة للأجهزة. علاوة على ذلك، بينما يركز RTDETRv2 حصريًا على اكتشاف مربعات الإحاطة، تطور YOLOv5 ليصبح أداة متعددة الاستخدامات تدعم تقسيم الكائنات وتصنيف الصور.

إدارة نماذج المؤسسات

للاستفادة من سير العمل الأكثر انسيابية، يمكنك تدريب YOLOv5 والتحقق منه ونشره مباشرةً باستخدام منصة Ultralytics. توفر المنصة إمكانات التدريب السحابي ومسارات نشر دون الحاجة إلى كتابة أي تعليمات برمجية.

مقارنة الأداء والمقاييس#

عند تحليل الأداء الخام على مجموعة بيانات COCO القياسية، يمكننا ملاحظة فروق واضحة في كيفية تحديد هذه النماذج لأولويات الموارد.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

تحليل المفاضلات#

تكشف البيانات أن RTDETRv2-x يحقق قيمة قصوى تبلغ 54.3% من متوسط الدقة (mAP)، متفوقًا قليلًا على قيمة YOLOv5x البالغة 50.7%. غير أن هذا التحسن الطفيف في الدقة يأتي بتكلفة حسابية هائلة. إذ يعمل YOLOv5x بزمن استجابة أقل (11.89 مللي ثانية مقابل 15.03 مللي ثانية على TensorRT)، ويتطلب جزءًا بسيطًا من حجم الذاكرة. وبالنسبة إلى عمليات النشر الطرفية فائقة الانخفاض في استهلاك الطاقة، يظل YOLOv5n (نانو) بلا منافس، إذ يُكمل عمليات الاستدلال في 1.12 مللي ثانية فقط مع حجم ضئيل يبلغ 2.6 مليون معلمة، وهي فئة لا يحاول RTDETRv2 منافستها أصلًا.

كفاءة التدريب وبساطة التعليمات البرمجية#

تتمثل إحدى نقاط القوة الرئيسية في منظومة Ultralytics في API الموحدة. وحتى إذا قررت استخدام بنية Transformer الخاصة بـRT-DETR لمهمة محددة كثيفة الحوسبة، يمكنك القيام بذلك بالكامل ضمن حزمة Ultralytics Python، مع تبديل النماذج بسلاسة من خلال سطر واحد من التعليمات البرمجية.

from ultralytics import RTDETR, YOLO

# Load the Ultralytics YOLOv5 small model
model_yolo = YOLO("yolov5s.pt")

# Load the RT-DETR large model via Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")

# Train YOLOv5 effortlessly on your custom data
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with both models seamlessly
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")

results_yolo[0].show()

من خلال الاستفادة من مكتبة Ultralytics، يحصل المطورون تلقائيًا على إمكانية الوصول إلى منظومة جيدة الصيانة، تتضمن تكاملات تتبع التجارب (مثل Weights & Biases وComet ML)، وعمليات تصدير بنقرة واحدة إلى تنسيقات النشر مثل ONNX وOpenVINO.

التطبيقات الواقعية وحالات الاستخدام المثالية#

متى يتفوق RTDETRv2#

يناسب RTDETRv2 على أفضل وجه البيئات التي لا تفرض فيها قيود الأجهزة أي عائق، وتكون فيها أعلى دقة ممكنة هي الهدف الوحيد.

  • التصوير الطبي على الخوادم: اكتشاف الحالات الشاذة المجهرية في صور الأشعة السينية عالية الدقة.
  • الصور الساتلية: تتبع الأجسام الكثيفة والمتداخلة في مهام المراقبة الجوية على عناقيد سحابية قوية.

متى يهيمن YOLOv5#

يُعد YOLOv5 البطل بلا منازع للنشر العملي في العالم الحقيقي عبر مجموعة متنوعة من الأجهزة.

  • أجهزة الذكاء الاصطناعي الطرفية: نشر أنظمة إنذار الأمان على أجهزة Raspberry Pi أو NVIDIA Jetson حيث تكون الذاكرة محدودة بشدة.
  • تطبيقات الأجهزة المحمولة: تشغيل استدلال سريع وفوري لمربعات الإحاطة والتقسيم مباشرةً على الهواتف الذكية عبر CoreML أو TFLite.
  • التصنيع الصناعي عالي السرعة: فحص القطع على خطوط إنتاج سريعة، حيث يُعد زمن الاستجابة بالمللي ثانية أمرًا حاسمًا للنجاح التشغيلي.
استكشاف نماذج Ultralytics الأخرى

رغم أن YOLOv5 نموذج أسطوري، تواصل منظومة Ultralytics دفع حدود الذكاء الاصطناعي. وإذا كنت تقارن بين نماذج لمشروع جديد في عام 2026، فعليك التفكير في استكشاف Ultralytics YOLO26 المتطور. يدمج YOLO26 تصميمًا أصليًا شاملًا من البداية إلى النهاية وخاليًا من NMS (على غرار Transformers ولكن بسرعة CNN)، ويتضمن مُحسِّن MuSGD الثوري لتدريب مستقر للغاية، ويوفر استدلالًا أسرع على CPU بنسبة تصل إلى 43%. وبدلًا من ذلك، يظل YOLO11 خيارًا ممتازًا ومدعومًا بدرجة كبيرة لعمليات النشر متعددة الاستخدامات التي تتطلب تقدير الوضعية واكتشاف OBB.

في نهاية المطاف، بينما يدفع RTDETRv2 سقف الدقة باستخدام طبقات Transformer، يوفر إطار عمل Ultralytics YOLO توازنًا لا يُضاهى بين السرعة ومتطلبات الذاكرة الخفيفة وتجربة المطورين المصممة ببراعة، ما يقلل بدرجة كبيرة الوقت اللازم للانتقال من النموذج الأولي إلى الإنتاج.

التعليقات