Ultralytics YOLO27:
Get Started

YOLOv5 مقابل DAMO-YOLO#

يشهد مجال الرؤية الحاسوبية في الوقت الفعلي تطورًا متواصلًا، إذ يسعى الباحثون والمهندسون إلى تحقيق التوازن المثالي بين الدقة والسرعة وسهولة الاستخدام. ومن أبرز النماذج التي شكلت هذا المسار Ultralytics YOLOv5 وDAMO-YOLO من Alibaba.

يقدم هذا الدليل تحليلًا تقنيًا معمقًا لبنيتي النموذجين ومقاييس أدائهما ومنهجيات تدريبهما، لمساعدتك على اختيار النموذج المناسب لعملية النشر التالية.

نبذة عن النموذجين#

قبل الخوض في التفاصيل التقنية، من المهم فهم أصول كل نموذج من نموذجي الرؤية المؤثرين وفلسفة تصميمه الأساسية.

Ultralytics YOLOv5#

طوّر Glenn Jocher وفريق Ultralytics نموذج YOLOv5، الذي أصبح معيارًا في الصناعة منذ إصداره. وقد بُني مباشرةً على إطار عمل PyTorch، مع إعطاء الأولوية لتجربة مطور مبسطة وقدرات نشر قوية جاهزة للاستخدام.

DAMO-YOLO#

أنشأ باحثون في مجموعة Alibaba نموذج DAMO-YOLO، الذي يركز بدرجة كبيرة على البحث عن بنية الشبكة العصبية (NAS) وتقنيات التقطير المتقدمة. ويدفع هذا النموذج الحدود النظرية للأداء الخاص بالأجهزة، مع التركيز على بيئات الأبحاث والأجهزة الطرفية التي تتطلب ضبطًا دقيقًا للغاية.

تعرّف على المزيد حول DAMO-YOLO

ابتكارات البنية#

يستفيد كلا النموذجين من مفاهيم بنيوية فريدة لتحقيق أدائهما في الوقت الفعلي، لكن نهجيهما يختلفان اختلافًا كبيرًا.

YOLOv5: الاستقرار وتعدد الاستخدامات#

يستخدم YOLOv5 عمودًا فقريًا معدلًا من CSP (الجزئي عبر المراحل)، مقترنًا بعنق PANet (شبكة تجميع المسارات). وتتميز هذه البنية بكفاءة عالية، إذ تقلل استخدام ذاكرة CUDA أثناء التدريب والاستدلال.

من أبرز نقاط قوة YOLOv5 تعدد استخداماته عبر المهام. فإلى جانب التنبؤ بمربعات الإحاطة، يوفر بنيات مخصصة لـتجزئة الصور وتصنيف الصور، ما يتيح للمطورين توحيد مسارات عمل الرؤية لديهم ضمن إطار عمل واحد متكامل.

يتمثل الابتكار الأساسي في DAMO-YOLO في العمود الفقري MAE-NAS. وباستخدام بحث موجّه بأقصى إنتروبيا، اكتشف فريق Alibaba أعمدةً فقرية توازن ديناميكيًا بين دقة الاكتشاف وسرعة الاستدلال.

إضافة إلى ذلك، يتضمن عنق Efficient RepGFPN لتحسين دمج السمات، وهو مفيد للغاية للتفاوتات المعقدة في المقاييس التي تظهر غالبًا في تحليل صور الأقمار الصناعية. أما تصميم ZeroHead فيبسط طبقات التنبؤ النهائية لتقليل زمن الاستجابة، لكن هذا التوليد البنيوي المعقد قد يجعل البنية جامدة ويصعّب تعديلها للتطبيقات المخصصة.

متطلبات الذاكرة

غالبًا ما تواجه البنى القائمة على Transformer صعوبة بسبب استهلاكها الكبير لذاكرة VRAM. يستخدم كل من YOLOv5 وDAMO-YOLO تصميمات التفافية فعالة للحفاظ على انخفاض استهلاك الذاكرة، لكن نماذج Ultralytics محسّنة على نحو ملحوظ لوحدات GPU الاستهلاكية، ما يجعلها أيسر استخدامًا بكثير للباحثين المستقلين والشركات الناشئة.

الأداء والمقاييس#

يتطلب تقييم كواشف الأجسام في الوقت الفعلي النظر إلى مجموعة من mAP (متوسط الدقة) وسرعة الاستدلال ومعلمات حجم النموذج.

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

مع أن DAMO-YOLO يحقق درجات mAP تنافسية للغاية عند أعداد معينة من المعلمات، يُظهر YOLOv5 باستمرار سرعات استثنائية في TensorRT وأعدادًا منخفضة للغاية من المعلمات في إعدادات nano وsmall. ويضمن هذا التوازن في الأداء تشغيل YOLOv5 بكفاءة عبر سيناريوهات متنوعة للنشر الطرفي.

كفاءة التدريب والمنظومة#

لا تتجاوز الدقة النظرية للنموذج جودة قابليته للتطبيق عمليًا. وهنا يتباين النموذجان اختلافًا كبيرًا.

تعقيد التقطير#

يعتمد DAMO-YOLO بدرجة كبيرة على منهجية تدريب متعددة المراحل. فهو يجمع بين تعيين التسميات باستخدام AlignedOTA وتقنية تقطير المعرفة بين المعلم والطالب. ومع أن ذلك يستخلص أقصى أداء من نموذج الطالب، فإنه يتطلب تدريب نموذج معلم ضخم في البداية. ويؤدي هذا إلى زيادة كبيرة في وقت الحوسبة وتكاليف الطاقة ومتطلبات الأجهزة، ما يشكل عنق زجاجة لفرق تعلم الآلة الرشيقة.

ميزة Ultralytics: سهولة الاستخدام#

في المقابل، يشتهر نظام Ultralytics البيئي عالميًا بواجهات API البديهية وكفاءة التدريب. وبفضل التطوير النشط ومجتمع المصادر المفتوحة الهائل، يمكن للمطورين تدريب النماذج والتحقق من صحتها ونشرها بسلاسة.

from ultralytics import YOLO

# ⁨تحميل نموذج YOLOv5 مدرّب مسبقًا⁩
model = YOLO("yolov5su.pt")  # ⁨YOLOv5u: أوزان YOLOv5 الخالية من المراسي لحزمة ultralytics⁩

# ⁨التدريب بسهولة على مجموعة بيانات مخصصة⁩
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# ⁨صدّر إلى تنسيق ONNX للنشر⁩
model.export(format="onnx")

توفر Ultralytics أيضًا دعمًا مدمجًا لـتتبّع التجارب باستخدام أدوات مثل Weights & Biases وComet ML، ما يتيح سير عمل سلسًا.

حالات الاستخدام في العالم الحقيقي#

  • يتفوق YOLOv5 في بيئات الإنتاج سريعة الوتيرة. وتجعل سهولة تصديره منه الخيار الأول في تحليلات البيع بالتجزئة الذكية، واكتشاف عيوب التصنيع بسرعة عالية، والدمج في تطبيقات الأجهزة المحمولة عبر CoreML.
  • DAMO-YOLO مناسب للغاية للمعايير الأكاديمية الصارمة وللسيناريوهات التي تتوفر فيها موارد حوسبة هائلة لتنفيذ عمليات تدريب طويلة ومقطّرة، بهدف انتزاع تحسينات طفيفة في mAP لأهداف أجهزة محددة وثابتة.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv5 وDAMO-YOLO على متطلبات مشروعك المحددة وقيود النشر وتفضيلات النظام البيئي.

متى تختار YOLOv5#

يُعد YOLOv5 خيارًا قويًا لما يلي:

  • أنظمة إنتاج مُجرّبة: عمليات النشر القائمة التي تُقدّر سجل YOLOv5 الطويل في الاستقرار ووثائقه الشاملة ودعم مجتمعه الكبير.
  • التدريب مع موارد محدودة: البيئات التي تعاني من محدودية موارد GPU، حيث يكون مسار التدريب الفعّال في YOLOv5 ومتطلباته الأقل للذاكرة مفيدين.
  • دعم واسع لتنسيقات التصدير: المشاريع التي تتطلب النشر بتنسيقات عديدة، منها ONNX وTensorRT وCoreML وLiteRT.

متى تختار DAMO-YOLO#

يوصى باستخدام DAMO-YOLO في الحالات التالية:

  • تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو ذات معدل إطارات مرتفع على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند batch-1 المقياس الأساسي.
  • خطوط التصنيع الصناعي: السيناريوهات ذات قيود زمن استجابة صارمة على GPU ضمن أجهزة مخصصة، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
  • أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والعمود الفقري الفعال المعاد تحديد معلماته على أداء الكشف.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
  • البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.

التطور التالي: YOLO26#

إذا كنت تبدأ مشروعًا جديدًا، فمن المستحسن بشدة التطلع إلى المستقبل. يبني Ultralytics YOLO26 على الأساس المذهل لـ YOLOv5، ويضم تطورات ثورية تعيد تعريف أحدث ما توصل إليه الذكاء الاصطناعي للرؤية.

لماذا الترقية إلى YOLO26؟

حظي YOLO26 بإشادة واسعة عند إصداره، وهو شامل من البداية إلى النهاية بطبيعته. ويتضمن تصميمًا شاملًا من البداية إلى النهاية وخاليًا من NMS (nms=False) يتجاوز المعالجة اللاحقة الخاصة بقمع غير الحد الأقصى، ما يجعل النشر أسرع وأسهل بدرجة كبيرة.

تشمل الابتكارات الرئيسية في YOLO26:

  • محسّن MuSGD: يستلهم هذا المحسّن الهجين بين SGD وMuon من ابتكارات تدريب LLM، ويضمن تدريبًا مستقرًا للغاية وتقاربًا سريعًا.
  • استدلال أسرع بنسبة تصل إلى 43% على CPU: محسّن بدرجة كبيرة للحوسبة الطرفية، ما يجعله مثاليًا لأجهزة إنترنت الأشياء التي تعمل من دون وحدات GPU مخصصة.
  • ProgLoss + STAL: دوال خسارة متقدمة تحسن كثيرًا التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لصور الطائرات المسيّرة الجوية والروبوتات.
  • تحسينات خاصة بالمهام: من خسارة الزاوية المتخصصة لـمربعات الإحاطة الموجّهة (OBB) إلى تقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لتحسين دقة تقدير الوضعية، يتعامل YOLO26 بسهولة مع المجالات المعقدة.

الخلاصة#

رسّخ كل من YOLOv5 وDAMO-YOLO مكانته في تاريخ اكتشاف الأجسام. ولا يزال DAMO-YOLO دراسة مثيرة للاهتمام في البحث عن بنية الشبكة العصبية والتقطير. لكن نماذج Ultralytics تظل بلا منافس للمؤسسات التي تعطي الأولوية لـنظام بيئي مُصان جيدًا وسهولة الاستخدام ومسار سريع نحو الإنتاج.

نوصي بشدة باستخدام منصة Ultralytics لوضع التعليقات التوضيحية على الجيل التالي من النماذج وتدريبه ونشره، مثل YOLO26، لضمان أن يكون مسار عمل الرؤية الحاسوبية لديك مواكبًا للمستقبل وسريعًا ودقيقًا على نحو ملحوظ.

قراءات إضافية#

  • استكشف RT-DETR القائم على Transformer للتطبيقات عالية الدقة.
  • تعرّف على نموذج الجيل السابق YOLO11.
  • اكتشف كيفية تحسين عمليات النشر باستخدام OpenVINO.

التعليقات