Ultralytics YOLO27:

مقارنة بين YOLOv5 وDAMO-YOLO#

يتطور مجال الرؤية الحاسوبية في الوقت الفعلي باستمرار، إذ يسعى الباحثون والمهندسون إلى تحقيق التوازن المثالي بين الدقة والسرعة وسهولة الاستخدام. ومن أبرز النموذجين اللذين أسهما في رسم ملامح هذا المسار Ultralytics YOLOv5 وDAMO-YOLO من Alibaba.

يقدم هذا الدليل تحليلًا تقنيًا متعمقًا لبنيتهما ومقاييس أدائهما ومنهجيات تدريبهما، لمساعدتك على اختيار النموذج المناسب لعملية النشر التالية.

خلفيات النماذج#

قبل التعمق في التفاصيل التقنية، من المهم فهم أصول كل نموذج من نماذج الرؤية المؤثرة هذه وفلسفة تصميمه الأساسية.

Ultralytics YOLOv5#

طوّر Glenn Jocher وفريق Ultralytics نموذج YOLOv5، الذي أصبح معيارًا صناعيًا منذ إطلاقه. وقد بُني أصلاً على إطار عمل PyTorch، مع إعطاء الأولوية لتجربة مطور مبسطة وقدرات نشر قوية منذ البداية.

DAMO-YOLO#

أنشأه باحثون في Alibaba Group، ويركز DAMO-YOLO بدرجة كبيرة على البحث الآلي عن البنية المعمارية (NAS) وتقنيات التقطير المتقدمة. وهو يدفع الحدود النظرية لأداء الأجهزة المتخصصة، مع تلبية احتياجات بيئات البحث والحافة التي تتطلب ضبطًا بالغ الدقة.

تعرف على المزيد حول DAMO-YOLO

الابتكارات المعمارية#

يستفيد كلا النموذجين من مفاهيم بنيوية فريدة لتحقيق أدائهما في الوقت الفعلي، إلا أن نهجيهما يختلفان اختلافًا كبيرًا.

YOLOv5: الاستقرار وتعدد الاستخدامات#

يستخدم YOLOv5 عمودًا فقريًا مُعدّلًا من نوع CSP (التجزئة الجزئية عبر المراحل)، مقترنًا بعنق PANet (شبكة تجميع المسارات). وتتميز هذه البنية بكفاءة عالية، إذ تقلل استخدام ذاكرة CUDA أثناء التدريب والاستدلال على حد سواء.

تتمثل إحدى أعظم نقاط قوة YOLOv5 في تعدد استخداماته عبر المهام. فإلى جانب تنبؤات مربعات الإحاطة، يوفر بنيات مخصصة لـتجزئة الصور وتصنيف الصور، مما يتيح للمطورين توحيد مسارات الرؤية لديهم حول إطار عمل واحد متماسك.

DAMO-YOLO: البحث الآلي عن البنية المعمارية#

الابتكار الأساسي لـ DAMO-YOLO هو الهيكل الفقري MAE-NAS Backbone. باستخدام البحث الموجه بالإنتروبيا القصوى، اكتشف فريق علي بابا هياكل فقرية توازن بين دقة الكشف وسرعة الاستدلال بشكل ديناميكي.

بالإضافة إلى ذلك، يضم عنق Efficient RepGFPN لتحسين دمج السمات، وهو مفيد للغاية للتباينات المعقدة في المقاييس التي تظهر غالبًا في تحليل الصور الملتقطة بالأقمار الصناعية. ويبسّط تصميم ZeroHead طبقات التنبؤ النهائية لتقليل زمن الاستجابة، إلا أن هذا التوليد البنيوي المعقد قد يجعل البنية جامدة ويصعّب تعديلها للتطبيقات المخصصة.

متطلبات الذاكرة

غالبًا ما تواجه البنى المعمارية القائمة على Transformer صعوبة بسبب استهلاكها المرتفع لذاكرة VRAM. ويستخدم كل من YOLOv5 وDAMO-YOLO تصميمات التفافية فعّالة للحفاظ على انخفاض البصمة الذاكرية، إلا أن نماذج Ultralytics محسّنة بصورة ملحوظة لوحدات GPU المخصصة للمستهلكين، مما يجعلها أكثر سهولة بكثير أمام الباحثين المستقلين والشركات الناشئة.

الأداء والمقاييس#

يتطلب تقييم كواشف الأجسام في الوقت الفعلي النظر في مصفوفة من معلمات mAP (متوسط الدقة المتوسطة)، وسرعة الاستدلال، وحجم النموذج.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

في حين يحقق DAMO-YOLO درجات mAP تنافسية للغاية عند أعداد معينة من المعلمات، يبرهن YOLOv5 باستمرار على سرعات استثنائية باستخدام TensorRT وأعداد منخفضة للغاية من المعلمات في تهيئتيه nano وsmall. ويضمن هذا التوازن في الأداء تشغيل YOLOv5 بكفاءة عبر سيناريوهات نشر متنوعة على الحافة.

كفاءة التدريب والمنظومة#

لا تكون الدقة النظرية للنموذج جيدة إلا بقدر قابليته للتنفيذ عمليًا. وهنا يتباعد النموذجان بدرجة كبيرة.

تعقيد التقطير#

تعتمد DAMO-YOLO بشدة على منهجية تدريب متعددة المراحل. وهي تقرن تعيين التسميات المعتمد على AlignedOTA بتقنية تقطير المعرفة بين المعلم والطالب. وفي حين أن هذا يستخلص أقصى أداء من نموذج الطالب، فإنه يتطلب في البداية تدريب نموذج معلم ضخم. وهذا يزيد بشكل كبير من وقت الحوسبة، وتكاليف الطاقة، والأجهزة المطلوبة، مما يمثل عنق زجاجة لفرق تعلم الآلة السريعة.

ميزة Ultralytics: سهولة الاستخدام#

وعلى العكس، تشتهر منظومة Ultralytics عالميًا بواجهات API البديهية وكفاءة التدريب. وبفضل التطوير النشط ومجتمع المصادر المفتوحة الضخم، يستطيع المطورون تدريب النماذج والتحقق منها ونشرها بسلاسة.

from ultralytics import YOLO

# Load a pretrained YOLOv5 model
model = YOLO("yolov5s.pt")

# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export to ONNX format for deployment
model.export(format="onnx")

توفر Ultralytics أيضًا دعمًا مدمجًا لـتتبع التجارب عبر أدوات مثل Weights & Biases وComet ML، مما ينشئ سير عمل سلسًا.

حالات الاستخدام الواقعية#

  • يتفوق YOLOv5 في بيئات الإنتاج سريعة الوتيرة. وتجعل قابليته المباشرة للتصدير منه الخيار الأمثل لـتحليلات البيع بالتجزئة الذكي، والكشف عن عيوب التصنيع عالي السرعة، والدمج في تطبيقات الأجهزة المحمولة عبر CoreML.
  • يُعد DAMO-YOLO مناسبًا للغاية للمقارنات الأكاديمية الصارمة والسيناريوهات التي تتوفر فيها موارد حوسبة واسعة لتنفيذ عمليات تدريب طويلة بالتقطير، بهدف انتزاع تحسينات جزئية في mAP لأهداف محددة وثابتة من الأجهزة.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv5 وDAMO-YOLO على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات المنظومة.

متى تختار YOLOv5#

يُعد YOLOv5 خيارًا قويًا من أجل:

  • أنظمة الإنتاج المجربة: عمليات النشر الحالية التي تُقدّر سجل YOLOv5 الطويل من الاستقرار، ووثائقه الشاملة، والدعم الواسع من المجتمع.
  • التدريب في ظل قيود الموارد: البيئات ذات موارد GPU المحدودة، حيث توفر مسارات تدريب YOLOv5 الفعالة ومتطلبات الذاكرة الأقل مزايا مهمة.
  • دعم موسّع لتنسيقات التصدير: المشاريع التي تتطلب النشر عبر العديد من التنسيقات، بما في ذلك ONNX وTensorRT وCoreML وTFLite.

متى تختار DAMO-YOLO#

يوصى باستخدام DAMO-YOLO في الحالات التالية:

  • تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو عالية FPS على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند حجم الدفعة 1 هي المقياس الأساسي.
  • خطوط التصنيع الصناعية: السيناريوهات ذات القيود الصارمة على زمن استجابة GPU ضمن عتاد مخصص، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
  • أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والشبكات الأساسية المعاد تمثيلها بكفاءة على أداء الاكتشاف.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

التطور التالي: YOLO26#

إذا كنت تبدأ مشروعًا جديدًا، فمن الموصى به بشدة التطلع إلى المستقبل. إذ يبني Ultralytics YOLO26 على الأساس المذهل لـYOLOv5، ويضم تطورات ثورية تعيد تعريف أحدث ما توصل إليه الذكاء الاصطناعي للرؤية.

لماذا الترقية إلى YOLO26؟

أُطلق YOLO26 وسط إشادة واسعة، وهو يعمل أصلاً من البداية إلى النهاية. ويتميز بتصميم من البداية إلى النهاية خالٍ من NMS، إذ يلغي تمامًا المعالجة اللاحقة لقمع عدم القيم العظمى، مما يتيح نشرًا أسرع وأبسط بكثير.

تشمل الابتكارات الرئيسية في YOLO26 ما يلي:

  • مُحسِّن MuSGD: مستوحى من ابتكارات تدريب LLM، ويضمن هذا المزيج من SGD وMuon تدريبًا مستقرًا للغاية وتقاربًا سريعًا.
  • استدلال أسرع بنسبة تصل إلى 43% على CPU: مُحسّن بدرجة كبيرة للحوسبة الطرفية، مما يجعله مثاليًا لأجهزة إنترنت الأشياء التي تعمل دون وحدات GPU مخصصة.
  • ProgLoss + STAL: دوال خسارة متقدمة تحسن بدرجة كبيرة التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لـالصور الجوية الملتقطة بالطائرات المسيّرة والروبوتات.
  • تحسينات خاصة بالمهام: بدءًا من دالة خسارة الزاوية المتخصصة لـمربعات الإحاطة الموجّهة (OBB)، وصولًا إلى تقدير الاحتمالية اللوغاريتمية المتبقية (RLE) من أجل تقدير الوضعية بدقة، يتعامل YOLO26 مع المجالات المعقدة بسهولة.

الخلاصة#

رسّخ كل من YOLOv5 وDAMO-YOLO مكانته في تاريخ كشف الأجسام. ولا يزال DAMO-YOLO يمثل دراسة رائعة في البحث الآلي عن البنية المعمارية والتقطير. ومع ذلك، تظل نماذج Ultralytics بلا منافس للمؤسسات التي تعطي الأولوية لـمنظومة جيدة الصيانة وسهولة الاستخدام ومسار سريع إلى الإنتاج.

نوصي بشدة باستخدام منصة Ultralytics لوضع تعليقات توضيحية على الجيل التالي من النماذج، مثل YOLO26، وتدريبها ونشرها، بما يضمن أن يكون مسار الرؤية الحاسوبية لديك مواكبًا للمستقبل وسريعًا ودقيقًا بصورة استثنائية.

قراءات إضافية#

  • استكشف RT-DETR القائم على Transformer لتطبيقات الدقة العالية.
  • تعرّف على نموذج الجيل السابق YOLO11.
  • اكتشف كيفية تحسين عمليات النشر باستخدام OpenVINO.

التعليقات