YOLO Vision 2026:

RTDETRv2 مقابل YOLOv5#

لقد تم تحديد تطور computer vision إلى حد كبير من خلال السعي الدؤوب لتحقيق التوازن بين الدقة وسرعة الاستدلال في الوقت الفعلي. عند مقارنة RTDETRv2 و Ultralytics YOLOv5، يوازن المطورون بشكل أساسي بين قدرات السياق العالمي المتطورة لبنيات المحولات (Transformer) مقابل الكفاءة العالية والمختبرة في المعركة للشبكات العصبية التلافيفية (CNN).

يوفر هذا الدليل تحليلاً تقنياً متعمقاً هاتين البنيتين البارزتين، تفصيلاً لمقاييس أدائهما، ومنهجيات التدريب، ومتطلبات الذاكرة، وسيناريوهات النشر المثالية لمساعدتك في اختيار أفضل نموذج object detection لحالة الاستخدام الخاصة بك.

RTDETRv2: نهج المحولات (Transformer) للكشف في الوقت الفعلي#

بناءً على نموذج Real-Time Detection Transformer (RT-DETR) الأصلي، يقدم RTDETRv2 سلسلة من "مجموعة الإضافات المجانية" (bag-of-freebies) لتحسين البنية الأساسية دون التضحية بزمن انتقال الاستدلال.

  • المؤلفون: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, و Yi Liu
  • المنظمة: Baidu
  • التاريخ: 24-07-2024
  • الروابط: ورقة Arxiv، مستودع GitHub

الهيكلية والقدرات#

يستفيد RTDETRv2 من بنية هجينة تجمع بين CNN وTransformer. تعمل CNN كعمود فقري لاستخراج الميزات المرئية دقيقة الحبيبات، بينما تعالج طبقات مُشفر-مُفكك (encoder-decoder) الخاصة بالمحولات خريطة الميزات بأكملها لفهم السياق العالمي. ومن السمات الرئيسية لـ RTDETRv2 طبيعته المتكاملة من البداية إلى النهاية، مما يلغي تماماً الحاجة إلى معالجة لاحقة لـ Non-Maximum Suppression (NMS).

بينما يحقق RTDETRv2 دقة مثيرة للإعجاب - خاصة في المشاهد المعقدة والمزدحمة حيث تتداخل الكائنات - إلا أنه يأتي بتضحيات ملحوظة. تتطلب attention mechanism المتاصلة في المحولات ذاكرة CUDA أعلى بكثير أثناء التدريب مقارنة بشبكات CNN القياسية. علاوة على ذلك، وعلى الرغم من أداء النموذج الجيد على وحدات معالجة الرسوميات المتطورة مثل NVIDIA A100 أو T4، فإن بنيته أبطأ بشكل ملحوظ على وحدات المعالجة المركزية القياسية وأجهزة الحافة المقيدة بشدة.

اعرف المزيد عن RTDETRv2

Ultralytics YOLOv5: معيار الصناعة للكفاءة#

لقد غير Ultralytics YOLOv5 المشهد الأساسي للتعلم الآلي التطبيقي عند إصداره، مما جعل رؤية الحاسوب عالية الأداء في متناول المطورين في جميع أنحاء العالم من خلال إطار عمل بديهي بشكل استثنائي.

التوازن بين النظام البيئي والأداء#

تم بناء YOLOv5 بالكامل على إطار عمل PyTorch ويعتمد على بنية CNN فعالة للغاية. لقد تم تصميمه من الألف إلى الياء لسهولة الاستخدام، ويتميز بواجهة برمجة تطبيقات (API) مبسطة وبعض الوثائق الأكثر شمولاً في صناعة الذكاء الاصطناعي.

تكمن الميزة الكبرى لـ YOLOv5 في تنوعه التي لا تضاهى ومتطلبات الذاكرة المنخفضة. يتطلب تدريب نموذج YOLOv5 ذاكرة VRAM أقل بكثير مقارنة بالنماذج القائمة على المحولات، مما يجعله في متناول الباحثين والمهندسين ذوي ميزانيات الأجهزة المحدودة. علاوة على ذلك، وبينما يركز RTDETRv2 حصرياً على اكتشاف حدود الصناديق (bounding box)، فقد تطور YOLOv5 ليصبح قوة متعددة الاستخدامات تدعم instance segmentation وimage classification.

إدارة نماذج المؤسسات

لتجربة سير العمل المبسط النهائي، يمكنك تدريب، والتحقق من صحة، ونشر YOLOv5 مباشرة باستخدام Ultralytics Platform. توفر المنصة إمكانيات التدريب السحابي ومسارات النشر بدون رموز برمجية.

اعرف المزيد عن YOLOv5

مقارنة الأداء والمقاييس#

عند تحليل الأداء الخام على COCO dataset القياسي، يمكننا أن نرى تمييزات واضحة في كيفية إعطاء هذه النماذج الأولوية للموارد.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

تحليل المقايضات#

تظهر البيانات أن RTDETRv2-x يحقق ذروة mean AveragePrecision (mAP) تبلغ 54.3%، متفوقاً قليلاً على YOLOv5x البالغ 50.7%. ومع ذلك، فإن مكسب الدقة البسيط هذا يأتي بتكلفة حسابية هائلة. يعمل YOLOv5x بزمن وصول أقل (11.89 مللي ثانية مقابل 15.03 مللي ثانية على TensorRT) ويتطلب جزءاً بسيطة من بصمة الذاكرة. بالنسبة لنشرات الحافة منخفضة الطاقة للغاية، يظل YOLOv5n (Nano) بلا منازع، حيث يكمل الاستدلالات في 1.12 مللي ثانية فقط مع بصمة معاملات صغيرة تبلغ 2.6M - وهي فئة لا يحاول RTDETRv2 حتى منافستها.

كفاءة التدريب وبساطة الكود#

إحدى نقاط القوة الرئيسية لنظام Ultralytics البيئي هي واجهة البرمجة الموحدة (Unified API). حتى إذا قررت استخدام بنية Transformer لنموذج RT-DETR لمهمة معينة تتطلب حسابات مكثفة، يمكنك القيام بذلك بالكامل داخل حزمة Ultralytics Python، مع تبديل النماذج بسلاسة بسطر واحد فقط من الكود.

from ultralytics import RTDETR, YOLO

# Load the Ultralytics YOLOv5 small model
model_yolo = YOLO("yolov5s.pt")

# Load the RT-DETR large model via Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")

# Train YOLOv5 effortlessly on your custom data
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with both models seamlessly
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")

results_yolo[0].show()

من خلال الاستفادة من مكتبة Ultralytics، يحصل المطورون تلقائياً على إمكانية الوصول إلى نظام بيئي مُدار جيداً يضم experiment tracking integrations (مثل Weights & Biases وComet ML) وعمليات تصدير بنقرة واحدة إلى تنسيقات نشر مثل ONNX وOpenVINO.

تطبيقات العالم الحقيقي وحالات الاستخدام المثالية#

أين يتألق RTDETRv2#

يعد RTDETRv2 الأنسب للبيئات التي لا توجد فيها قيود على الأجهزة، ويكون تحقيق أقصى دقة ممكنة هو الهدف الوحيد.

  • التصوير الطبي في جانب الخادم: اكتشاف التشوهات المجهرية في صور الأشعة السينية عالية الدقة.
  • صور الأقمار الصناعية: تتبع الكائنات الكثيفة والمتداخلة في مهام aerial surveillance على مجموعات سحابية قوية.

أين يسيطر YOLOv5#

YOLOv5 هو البطل الذي لا جدال فيه للنشر العملي في العالم الحقيقي عبر أجهزة متنوعة.

  • أجهزة الحافة للذكاء الاصطناعي: نشر security alarm systems على أجهزة Raspberry Pi أو NVIDIA Jetson حيث تكون الذاكرة محدودة بشكل صارم.
  • تطبيقات الهاتف المحمول: تشغيل استدلال سريع في الوقت الفعلي لمربعات الإحاطة والتجزئة مباشرة على الهواتف الذكية عبر CoreML أو TFLite.
  • التصنيع الصناعي عالي السرعة: فحص الأجزاء على خطوط الإنتاج السريعة حيث يكون زمن الانتقال بالمللي ثانية أمراً حاسماً للنجاح التشغيلي.
استكشاف نماذج Ultralytics الأخرى

بينما يُعد YOLOv5 نموذجاً أسطورياً، إلا أن النظام البيئي لـ Ultralytics يدفع باستمرار حدود الذكاء الاصطناعي. إذا كنت تقارن النماذج لمشروع جديد في عام 2026، فيجب عليك التفكير في استكشاف Ultralytics YOLO26 الأحدث من نوعه. يدمج YOLO26 تصميم End-to-End NMS-Free Design أصلي (مشابه للمحولات ولكن بسرعة CNN)، ويتميز بمحسن MuSGD Optimizer الثوري لتدريب مستقر بشكل لا يصدق، ويوفر استدلال وحدة معالجة مركزية أسرع بنسبة تصل إلى 43%. بدلاً من ذلك، يظل YOLO11 خياراً رائعاً وعالي الدعم للنشرات المتعددة الاستخدامات التي تتطلب Pose Estimation وOBB detection.

في النهاية، بينما يرفع RTDETRv2 سقف الدقة باستخدام طبقات Transformer، يوفر إطار عمل Ultralytics YOLO توازناً لا مثيل له بين السرعة ومتطلبات الذاكرة خفيفة الوزن وتجربة مطور هندسية ببراعة تقلل بشكل كبير من الوقت المستغرق من النموذج الأولي إلى الإنتاج.

التعليقات