مقارنة بين DAMO-YOLO وYOLOv5#
اتسم تطور الرؤية الحاسوبية بالابتكار المستمر في مجال اكتشاف الأجسام في الزمن الحقيقي. ويواجه المطورون والباحثون اليوم عددًا هائلًا من الخيارات المعمارية عند تصميم مسارات معالجة الرؤية. تستكشف هذه المقارنة التقنية الشاملة الفروق الدقيقة بين DAMO-YOLO وUltralytics YOLOv5، مع تسليط الضوء على معماريتيهما، ومنهجيات التدريب، ومقاييس الأداء، وسيناريوهات النشر المثالية لكل منهما.
مقدمة إلى DAMO-YOLO#
أطلقت مجموعة Alibaba نموذج DAMO-YOLO، الذي قدّم عدة تقنيات مبتكرة تهدف إلى دفع حدود سرعة الاكتشاف ودقته.
- المؤلفون: Xianzhe Xu، وYiqi Jiang، وWeihua Chen، وYilun Huang، وYuan Zhang، وXiuyu Sun
- الجهة: Alibaba Group
- التاريخ: 23 نوفمبر 2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- الوثائق: README.md
الابتكارات المعمارية#
تم بناء DAMO-YOLO على أساس البحث المعماري للشبكات العصوية (NAS). استخدم المؤلفون MAE-NAS لتصميم الهياكل الأساسية تلقائياً بما يحقق التوازن بين زمن الانتقال والدقة. يقدم النموذج شبكة هرمية للميزات المعممة المُعاد صياغتها (RepGFPN) بكفاءة عالية، مما يوثق دمج الميزات عبر المقاييس المختلفة. علاوة على ذلك، يدمج DAMO-YOLO تصميماً يعتمد على "ZeroHead"، متخلصاً من رؤوس التنبؤ المعقدة متعددة الفروع لصالح هيكل أبسط وأكثر كفاءة يعتمد بشكل كبير على إعادة المعلمات أثناء الاستدلال.
لتحسين التدريب، يستخدم النموذج AlignedOTA لإسناد التسميات، إلى جانب عملية تعزيز بالتقطير المكثف، حيث يوجّه نموذج أكبر يُسمى "المعلّم" نموذجًا أصغر يُسمى "الطالب" لتحقيق دقة أعلى.
مقدمة إلى Ultralytics YOLOv5#
يُعد Ultralytics YOLOv5 أحد أكثر معماريات الرؤية اعتمادًا في العالم، ويشتهر باستقراره وسهولة استخدامه واتساع منظومة النشر الخاصة به.
- المؤلفون: Glenn Jocher
- المنظمة: Ultralytics
- التاريخ: 26 يونيو 2020
- GitHub: ultralytics/yolov5
- التوثيق: وثائق YOLOv5
المعيار القياسي للمنظومة#
أعاد YOLOv5 تعريف معيار سهولة الاستخدام في القطاع. وقد بُني أصلاً باستخدام PyTorch، ويستخدم شبكة أساسية CSPNet محسّنة بدرجة كبيرة وعنق PANet لتجميع السمات بمتانة. وعلى الرغم من ظهوره قبل الاتجاه نحو النماذج الخالية من المراسي الذي انتشر في النماذج اللاحقة، فإن نهجه القائم على المراسي، والمصقول بدرجة كبيرة، إلى جانب التعلم التلقائي للمراسي، يضمن أداءً ممتازًا مباشرةً بعد التثبيت.
تكمن القوة الحقيقية لـ YOLOv5 في منظومته المُدارة جيدًا. فهو يتكامل بسلاسة مع أدوات التتبع مثل Comet وWeights & Biases، ويدعم التصدير بنقرة واحدة إلى تنسيقات مثل ONNX وTensorRT وCoreML.
من السهل للغاية تدريب YOLOv5 على مجموعات بيانات مخصصة. وتقلل واجهة API المبسطة الاحتكاك بين النموذج الأولي والإنتاج، ما يجعله خيارًا مفضلًا لدى فرق الهندسة الرشيقة.
مقارنة الأداء والمقاييس#
عند مقارنة هذه النماذج، من الضروري النظر في التوازن بين متوسط الدقة (mAP)، وسرعة الاستدلال، وعدد المعلمات.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
تحليل المفاضلات#
يحقق DAMO-YOLO درجات mAP مثيرة للإعجاب مقارنةً بأحجام معلماته، مستفيدًا بدرجة كبيرة من مرحلة التدريب بالتقطير. إلا أن ذلك يأتي على حساب كفاءة التدريب. إذ تتطلب عملية التقطير متعددة المراحل تدريب نموذج معلّم ثقيل أولًا، ما يزيد بدرجة كبيرة من وقت حوسبة GPU الضروري واستخدام VRAM.
وعلى العكس، يوفّر YOLOv5 متطلبات ذاكرة ممتازة. وتشتهر نماذج Ultralytics YOLO بانخفاض استهلاك الذاكرة أثناء التدريب والاستدلال على حد سواء، مقارنةً بمسارات التقطير المعقدة أو النماذج القائمة على Transformer مثل RT-DETR. ويتيح ذلك تدريب YOLOv5 بكفاءة على العتاد المخصص للمستهلكين أو في بيئات سحابية ميسورة مثل Google Colab.
التطبيقات الواقعية وتعدد الاستخدامات#
غالبًا ما يعتمد اختيار البنية المناسبة على بيئة النشر.
المجالات التي يتفوق فيها DAMO-YOLO#
يُعد DAMO-YOLO نموذجاً صارماً لـ اكتشاف الكائنات. إنه خيار ممتاز للبحث الأكاديمي، لا سيما للفرق التي تدرس البحث المعماري للشبكات العصوية أو تلك التي تهدف إلى إعادة إنتاج تقنيات إعادة المعلمات المفصلة في الورقة البحثية. إذا كان المشروع يمتلك موارد حسابية واسعة النطاق لتنفيذ مرحلة تدريب التقطير وكان يركز حصرياً على انتزاع النسبة الأخير من الدقة لمربعات الإحاطة ثنائية الأبعاد، فإن DAMO-YOLO يُعد مرشحاً قوياً.
ميزة Ultralytics#
أما في الإنتاج الواقعي، فتجعل سهولة الاستخدام وتعدد الاستخدامات في نماذج Ultralytics منها الخيار المفضل. وبينما يظل YOLOv5 خيارًا أساسيًا لاكتشاف الأجسام وتصنيف الصور، تتيح منظومة Ultralytics الأوسع للمطورين التبديل بسهولة بين المهام.
فعلى سبيل المثال، تدعم الإصدارات الأحدث ضمن عائلة Ultralytics أصلاً تجزئة الكائنات، وتقدير الوضعيات، واكتشاف مربع الإحاطة الموجّه (OBB). وتضمن هذه القدرة متعددة المهام إمكانية استخدام الفرق لواجهة Python API واحدة وموحّدة لمسارات المعالجة المعقدة، مثل الجمع بين التعرّف التلقائي على لوحات المركبات وتجزئة المركبات.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO وYOLOv5 على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات المنظومة.
متى تختار DAMO-YOLO#
يُعد DAMO-YOLO خيارًا قويًا من أجل:
- تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو عالية FPS على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند حجم الدفعة 1 هي المقياس الأساسي.
- خطوط التصنيع الصناعية: السيناريوهات ذات القيود الصارمة على زمن استجابة GPU ضمن عتاد مخصص، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والشبكات الأساسية المعاد تمثيلها بكفاءة على أداء الاكتشاف.
متى تختار YOLOv5#
يوصى باستخدام YOLOv5 في الحالات التالية:
- أنظمة الإنتاج المجربة: عمليات النشر الحالية التي تُقدّر سجل YOLOv5 الطويل من الاستقرار، ووثائقه الشاملة، والدعم الواسع من المجتمع.
- التدريب في ظل قيود الموارد: البيئات ذات موارد GPU المحدودة، حيث توفر مسارات تدريب YOLOv5 الفعالة ومتطلبات الذاكرة الأقل مزايا مهمة.
- دعم موسّع لتنسيقات التصدير: المشاريع التي تتطلب النشر عبر العديد من التنسيقات، بما في ذلك ONNX وTensorRT وCoreML وTFLite.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
المستقبل: الانتقال إلى YOLO26#
رغم أن YOLOv5 أسطوري وأن DAMO-YOLO يقدم رؤى أكاديمية مهمة، فقد تطورت أحدث التقنيات. وقد أُطلق Ultralytics YOLO26 في يناير 2026، ويمثل قفزة هائلة إلى الأمام لمجتمع الرؤية الحاسوبية.
يعالج YOLO26 الاختناقات التقليدية في النشر على الأجهزة الطرفية وعدم استقرار التدريب:
- تصميم شامل خالٍ من NMS: يلغي YOLO26 أصلاً المعالجة اللاحقة الخاصة بقمع الحدود القصوى. ويبسّط هذا الإنجاز منطق النشر ويخفض بدرجة كبيرة تباين زمن الاستجابة، ما يجعله مثاليًا لـالروبوتات والأنظمة الذاتية عالية السرعة.
- مُحسِّن MuSGD: مستلهمًا من ابتكارات تدريب نماذج LLM (مثل Kimi K2 من Moonshot AI)، يستخدم YOLO26 مُحسِّن MuSGD، وهو مزيج هجين من SGD وMuon. ويضمن ذلك عمليات تدريب مستقرة بدرجة كبيرة وتقاربًا أسرع على نحو ملحوظ.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: من خلال إزالة Distribution Focal Loss (DFL) بصورة استراتيجية، يحقق YOLO26 سرعات أعلى بكثير على وحدات CPU والأجهزة الطرفية مقارنةً بأسلافه مثل YOLO11 وYOLOv8.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لتحليل الصور الجوية الملتقطة بالطائرات المسيّرة وتغذيات مستشعرات إنترنت الأشياء.
مثال برمجي: البساطة موضع التنفيذ#
تتيح حزمة Ultralytics تدريب النماذج ونشرها باستخدام بضعة أسطر فقط من التعليمات البرمجية. وسواء كنت تستخدم YOLOv5 أو تنتقل إلى YOLO26 الموصى به، تظل الواجهة متسقة وبديهية.
from ultralytics import YOLO
# Load the state-of-the-art YOLO26 small model
model = YOLO("yolo26s.pt")
# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on an image and display results
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()
# Export the model for edge deployment
model.export(format="onnx")الخلاصة#
أسهم كل من DAMO-YOLO وYOLOv5 إسهامًا كبيرًا في مجال الرؤية الحاسوبية. ويعرض DAMO-YOLO قوة البحث عن البنية العصبية والتقطير، ما يجعله موضوعًا مثيرًا للاهتمام للباحثين. ومع ذلك، يظل YOLOv5 قوة عملية نظرًا إلى توازن الأداء، وانخفاض متطلبات الذاكرة، وسهولة استخدامه التي لا تضاهى.
بالنسبة إلى المطورين الذين يبدؤون مشاريع جديدة اليوم، تتمثل التوصية في الاستفادة من منصة Ultralytics واعتماد YOLO26. فهو يجمع بين منظومة YOLOv5 المحبوبة وسهلة الاستخدام والتطورات المعمارية الرائدة، ما يضمن دقة من الطراز الأول واستدلالًا فائق السرعة لتطبيقات الذكاء الاصطناعي السحابية والطرفية على حد سواء. وقد يرغب المطورون أيضًا في استكشاف نماذج فعّالة أخرى مثل YOLOv6 أو YOLOX، تبعًا لقيود العتاد القديم المحددة.