DAMO-YOLO مقابل YOLOv5#
اتسم تطور الرؤية الحاسوبية بالابتكار المستمر في كشف الأجسام الآني. ويواجه المطورون والباحثون اليوم خيارات بنيوية كثيرة عند تصميم مسارات الرؤية. تستكشف هذه المقارنة التقنية الشاملة أوجه الاختلاف الدقيقة بين DAMO-YOLO وUltralytics YOLOv5، مع إبراز بنيتيهما ومنهجيات تدريبهما ومقاييس أدائهما وسيناريوهات النشر المثالية لكل منهما.
مقدمة عن DAMO-YOLO#
قدمت Alibaba Group نموذج DAMO-YOLO، الذي استحدث تقنيات عدة تهدف إلى تجاوز حدود سرعة الكشف ودقته.
- المؤلفون: Xianzhe Xu وYiqi Jiang وWeihua Chen وYilun Huang وYuan Zhang وXiuyu Sun
- المؤسسة: Alibaba Group
- التاريخ: 23 نوفمبر 2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- الوثائق: README.md
اطّلع على مزيد من المعلومات حول DAMO-YOLO
ابتكارات البنية#
يرتكز DAMO-YOLO على البحث عن البنى العصبية (NAS). استخدم مؤلفوه MAE-NAS لتصميم أعمدة فقارية تلقائيًا توازن بين زمن الاستجابة والدقة. ويقدم النموذج شبكة هرم السمات العامة المعاد تمثيلها والفعّالة (RepGFPN)، التي تحسن دمج السمات عبر المقاييس المختلفة. كما يدمج DAMO-YOLO تصميم «ZeroHead»، مستغنيًا عن رؤوس التنبؤ المعقدة متعددة الفروع لصالح بنية أبسط وأكثر كفاءة تعتمد بدرجة كبيرة على إعادة المعلمات أثناء الاستدلال.
لتحسين التدريب، يستخدم النموذج AlignedOTA لتعيين التسميات وعملية تعزيز مكثفة بالتقطير، إذ يوجه نموذج «معلم» أكبر نموذج «طالب» أصغر لتحقيق دقة أعلى.
مقدمة عن Ultralytics YOLOv5#
يُعد Ultralytics YOLOv5 من أكثر بنى الرؤية اعتمادًا في العالم، ويشتهر باستقراره وسهولة استخدامه واتساع منظومة النشر الخاصة به.
- المؤلف: Glenn Jocher
- الجهة: Ultralytics
- التاريخ: 26 يونيو 2020
- GitHub: ultralytics/yolov5
- الوثائق: وثائق YOLOv5
معيار المنظومة#
أعاد YOLOv5 تعريف معيار سهولة الاستخدام في القطاع. وقد بُني أصليًا باستخدام PyTorch، ويستخدم عمودًا فقريًا CSPNet محسّنًا للغاية وعنق PANet لتجميع السمات بموثوقية. وعلى الرغم من ظهوره قبل الاتجاه نحو النماذج الخالية من المراسي الذي تبنته النماذج اللاحقة، فإن نهجه المعتمد على المراسي، والمنقح بدرجة كبيرة والمقترن بالتعلم التلقائي للمراسي، يضمن أداءً ممتازًا فور الاستخدام.
تكمن القوة الحقيقية لـYOLOv5 في منظومته التي تتم صيانتها جيدًا. فهو يتكامل بسلاسة مع أدوات التتبع مثل Comet وWeights & Biases، ويدعم التصدير بنقرة واحدة إلى تنسيقات مثل ONNX وTensorRT وCoreML.
من السهل جدًا تدريب YOLOv5 على مجموعات بيانات مخصصة. وتقلل واجهة API المبسطة العقبات بين النموذج الأولي والإنتاج، ما يجعله خيارًا مفضلًا لدى فرق الهندسة المرنة.
مقارنة الأداء والمقاييس#
عند مقارنة هذه النماذج، من الضروري النظر إلى التوازن بين متوسط الدقة (mAP) وسرعة الاستدلال وعدد المعلمات.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
تحليل المفاضلات#
يحقق DAMO-YOLO درجات mAP لافتة مقارنة بعدد معلماته، مستفيدًا كثيرًا من مرحلة التدريب بالتقطير. لكن ذلك يأتي على حساب كفاءة التدريب. إذ تتطلب عملية التقطير متعددة المراحل تدريب نموذج معلم ضخم أولًا، ما يزيد بدرجة كبيرة وقت الحوسبة على GPU وVRAM اللازمين.
في المقابل، يوفر YOLOv5 متطلبات ذاكرة ممتازة. وتشتهر نماذج Ultralytics YOLO بانخفاض استهلاك الذاكرة أثناء التدريب والاستدلال مقارنة بمسارات التقطير المعقدة أو النماذج المعتمدة على Transformer مثل RT-DETR. ويتيح ذلك تدريب YOLOv5 بكفاءة على عتاد المستهلكين أو البيئات السحابية المتاحة مثل Google Colab.
التطبيقات الواقعية وتعدد الاستخدامات#
غالبًا ما يعتمد اختيار البنية المناسبة على بيئة النشر.
مواضع تميز DAMO-YOLO#
DAMO-YOLO نموذج مخصص حصرًا لـكشف الأجسام. وهو خيار ممتاز للأبحاث الأكاديمية، ولا سيما للفرق التي تدرس البحث عن البنى العصبية أو تسعى إلى إعادة إنتاج تقنيات إعادة المعلمات الموضحة في الورقة البحثية. وإذا كان المشروع يملك موارد حوسبة كبيرة لتنفيذ مرحلة التدريب بالتقطير ويركز حصرًا على انتزاع آخر قدر من الدقة للصناديق المحيطة ثنائية الأبعاد، فإن DAMO-YOLO منافس قوي.
ميزة Ultralytics#
في بيئات الإنتاج الواقعية، تجعل سهولة الاستخدام وتعدد الاستخدامات في نماذج Ultralytics منها الخيار المفضل. وعلى الرغم من أن YOLOv5 لا يزال ركيزةً في الكشف وتصنيف الصور، تتيح منظومة Ultralytics الأوسع للمطورين الانتقال بسهولة بين المهام.
فعلى سبيل المثال، تدعم الإصدارات الأحدث من عائلة Ultralytics أصليًا تجزئة الكائنات وتقدير الوضعية وكشف الصناديق المحيطة الموجّهة (OBB). وتضمن هذه القدرة متعددة المهام إمكانية استخدام الفرق واجهة API موحدة في Python لمسارات العمل المعقدة، مثل الجمع بين التعرف الآلي على لوحات الأرقام وتجزئة المركبات.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO وYOLOv5 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار DAMO-YOLO#
يُعد DAMO-YOLO خيارًا قويًا في الحالات التالية:
- تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو ذات معدل إطارات مرتفع على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند batch-1 المقياس الأساسي.
- خطوط التصنيع الصناعي: السيناريوهات ذات قيود زمن استجابة صارمة على GPU ضمن أجهزة مخصصة، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والعمود الفقري الفعال المعاد تحديد معلماته على أداء الكشف.
متى تختار YOLOv5#
يُنصح بـ YOLOv5 في الحالات التالية:
- أنظمة إنتاج مُجرّبة: عمليات النشر القائمة التي تُقدّر سجل YOLOv5 الطويل في الاستقرار ووثائقه الشاملة ودعم مجتمعه الكبير.
- التدريب مع موارد محدودة: البيئات التي تعاني من محدودية موارد GPU، حيث يكون مسار التدريب الفعّال في YOLOv5 ومتطلباته الأقل للذاكرة مفيدين.
- دعم واسع لتنسيقات التصدير: المشاريع التي تتطلب النشر بتنسيقات عديدة، منها ONNX وTensorRT وCoreML وLiteRT.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
المستقبل: الانتقال إلى YOLO26#
على الرغم من المكانة الأسطورية لـYOLOv5 وما يقدمه DAMO-YOLO من رؤى أكاديمية مهمة، فقد تطورت التقنيات المتقدمة. ويمثل Ultralytics YOLO26، الذي صدر في يناير 2026، قفزة هائلة إلى الأمام لمجتمع الرؤية.
يعالج YOLO26 اختناقات النشر الطرفي التقليدية ومشكلات عدم استقرار التدريب:
- تصميم شامل خالٍ من NMS: يلغي الرأس الشامل الاختياري في YOLO26 (
nms=False) المعالجة اللاحقة الخاصة بكبت غير الأعظميات. ويسهل هذا الإنجاز منطق النشر ويقلل بدرجة كبيرة تفاوت زمن الاستجابة، ما يجعله مثاليًا لـالروبوتات عالية السرعة والأنظمة ذاتية التشغيل. - محسّن MuSGD: استلهامًا من ابتكارات تدريب نماذج اللغة الكبيرة (مثل Kimi K2 من Moonshot AI)، يستخدم YOLO26 محسّن MuSGD (مزيجًا من SGD وMuon). ويضمن ذلك عمليات تدريب مستقرة للغاية وتقاربًا أسرع بكثير.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: من خلال إزالة خسارة البؤرة التوزيعية (DFL) بطريقة استراتيجية، يعمل YOLO26n أسرع بنسبة تصل إلى 43% من YOLO11n على CPU باستخدام ONNX، محققًا سرعات أعلى على وحدات CPU والأجهزة الطرفية مقارنة بالنماذج السابقة مثل YOLO11 وYOLOv8.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لتحليل الصور الملتقطة بالطائرات المسيّرة وبيانات مستشعرات إنترنت الأشياء.
مثال برمجي: البساطة في التطبيق#
تتيح حزمة Ultralytics تدريب النماذج ونشرها باستخدام بضعة أسطر من الشفرة فقط. وسواء كنت تستخدم YOLOv5 أو ترقي إلى YOLO26 الموصى به، تظل الواجهة متسقة وسهلة الاستخدام.
from ultralytics import YOLO
# تحميل نموذج YOLO26 الصغير المتطور
model = YOLO("yolo26s.pt")
# التدريب بسهولة على مجموعة بيانات مخصصة
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# تشغيل الاستدلال على صورة وعرض النتائج
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()
# تصدير النموذج للنشر على الأجهزة الطرفية
model.export(format="onnx")الخلاصة#
أسهم كل من DAMO-YOLO وYOLOv5 إسهامًا كبيرًا في مجال الرؤية الحاسوبية. ويبرز DAMO-YOLO قوة البحث عن البنى العصبية والتقطير، ما يجعله موضوعًا مثيرًا للاهتمام للباحثين. ومع ذلك، يظل YOLOv5 خيارًا عمليًا قويًا بفضل توازن الأداء ومتطلبات الذاكرة المنخفضة وسهولة استخدامه التي لا تُضاهى.
بالنسبة إلى المطورين الذين يبدأون مشاريع جديدة اليوم، نوصي بالاستفادة من منصة Ultralytics واعتماد YOLO26. فهو يجمع بين منظومة YOLOv5 المحبوبة والسهلة الاستخدام والتطورات المعمارية الرائدة، ما يضمن دقة رفيعة المستوى واستدلالًا فائق السرعة لتطبيقات الذكاء الاصطناعي السحابية والطرفية. وقد يرغب المطورون أيضًا في استكشاف نماذج أخرى فعّالة مثل YOLOv6 أو YOLOX، وفقًا لقيود العتاد القديم المحددة.