DAMO-YOLO مقابل YOLOv10#
شهد مجال الرؤية الحاسوبية تطورًا سريعًا في بنيات كشف الأجسام في الزمن الحقيقي. عند مقارنة DAMO-YOLO وYOLOv10، نلاحظ اختلافًا واضحًا في فلسفة تصميم النماذج: البحث الآلي عن البنية مقابل التحسين الشامل الخالي من NMS. وعلى الرغم من أن كليهما يدفع حدود الدقة والسرعة، فإن بنيتيهما الأساسيتين وحالات الاستخدام المثالية تختلفان اختلافًا كبيرًا.
DAMO-YOLO: البحث عن البنى العصبية على نطاق واسع#
ظهر DAMO-YOLO، الذي طورته مجموعة Alibaba، بوصفه كاشفًا قويًا يركز على الاستفادة من الاكتشاف الآلي لتحقيق الكفاءة البنيوية.
- المؤلفون: Xianzhe Xu وYiqi Jiang وWeihua Chen وYilun Huang وYuan Zhang وXiuyu Sun
- التاريخ: 23 نوفمبر 2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
أبرز السمات المعمارية#
يعتمد DAMO-YOLO بدرجة كبيرة على البحث عن البنية العصبية (NAS) لتحقيق التوازن بين الأداء وزمن الاستجابة. ويستخدم عموده الفقري، المسمى MAE-NAS، بحثًا موجهًا بأقصى إنتروبيا ضمن ميزانيات حوسبة صارمة لتحديد العمق والعرض الأمثلين للطبقات.
لمعالجة دمج الميزات عبر المقاييس، يستخدم النموذج شبكة هرمية للميزات معممة معاد تحديد معالمها (RepGFPN) وفعالة. ويبرع هذا التصميم ذو العنق الكبير خصوصًا في استخراج التسلسلات الهرمية المكانية المعقدة، ما يجعله مفيدًا في سيناريوهات مثل تحليل الصور الجوية. وإضافة إلى ذلك، يقدم DAMO-YOLO تصميم ZeroHead، وهو رأس كشف مبسط يقلل بدرجة كبيرة تعقيد طبقات التنبؤ النهائية، ويعتمد على عملية تعزيز قوية بالتقطير أثناء التدريب.
غالبًا ما يستخدم DAMO-YOLO عملية تقطير معرفة متعددة المراحل. ويتطلب تدريب نموذج «معلّم» أكبر لتوجيه نموذج «متعلّم» أصغر، ما يرفع mAP (متوسط الدقة) ويزيد بدرجة كبيرة وقت الحوسبة على GPU المطلوب.
تعرّف على المزيد حول DAMO-YOLO
YOLOv10: ريادة اكتشاف الأجسام الشامل من البداية إلى النهاية#
بعد عام ونصف من ذلك، أحدث YOLOv10 تحولًا جذريًا بإلغاء الحاجة تمامًا إلى قمع غير الأقصى (NMS) أثناء الاستدلال.
- المؤلفون: Ao Wang وHui Chen وLihao Liu وآخرون
- الجهة: جامعة تسينغهوا
- التاريخ: 23 مايو 2024
- Arxiv: 2405.14458
- الوثائق: Ultralytics YOLOv10
أبرز السمات المعمارية#
تتمثل الميزة الأبرز في YOLOv10 في الإسناد المزدوج المتسق للتدريب الخالي من NMS. تتنبأ الكواشف التقليدية بصناديق إحاطة متعددة متداخلة للجسم الواحد، ما يستلزم استخدام NMS لتصفية التكرارات. وتؤدي خطوة المعالجة اللاحقة هذه إلى اختناق، خصوصًا على أجهزة الحافة. ويعالج YOLOv10 ذلك بإتاحة التنبؤ الطبيعي بصندوق إحاطة واحد ودقيق لكل جسم.
ركز المؤلفون أيضًا على تصميم شامل للنموذج يوازن بين الكفاءة والدقة. ومن خلال التحليل الدقيق للتكرار الحسابي في البنى القائمة، حسّنوا العمود الفقري والرأس لتقليل عدد FLOPs والمعلمات. ويضمن هذا التصميم خفيف الوزن أن يحقق YOLOv10 زمن استدلال استثنائيًا عند تصديره إلى تنسيقات مثل TensorRT أو OpenVINO.
الأداء ومعايير التقييم#
يوضح الجدول أدناه مقاييس الأداء الخام على مجموعة بيانات COCO. وقد أُبرزت أفضل القيم الإجمالية في كل عمود بخط عريض.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
يحافظ DAMO-YOLO على قدرته التنافسية من حيث الدقة، إلا أن YOLOv10 يحقق دقة أعلى عند أحجام مماثلة، مع أوزان نموذج أصغر بكثير. فعلى سبيل المثال، يحقق YOLOv10s قيمة mAP أعلى قليلًا (46.3%) من DAMO-YOLOs (46.0%)، مع استخدام أقل من نصف عدد المعلمات (7.2M مقابل 16.3M). وتجعل متطلبات الذاكرة الأقل من YOLOv10 خيارًا متعدد الاستخدامات على نحو استثنائي للأنظمة المضمنة.
كفاءة التدريب وسهولة الاستخدام#
عند الانتقال من البحث الأكاديمي إلى الإنتاج، تكون سهولة الاستخدام بالغة الأهمية. وقد تشكل عملية التقطير متعددة المراحل وإعدادات NAS المعقدة في DAMO-YOLO تحديًا كبيرًا أمام فرق الهندسة.
في المقابل، يستفيد YOLOv10 كثيرًا من تكامله الكامل مع حزمة Ultralytics البرمجية لـPython. ولا يتطلب تدريب نموذج مخصص سوى قدر ضئيل من الشيفرة التمهيدية. وتتولى Ultralytics تلقائيًا زيادة البيانات وضبط المعلمات الفائقة وتتبع التجارب.
from ultralytics import YOLO
# حمّل نموذج YOLOv10 nano مدرّبًا مسبقًا
model = YOLO("yolov10n.pt")
# درّب النموذج على مجموعة بيانات مخصصة مع التحقق المضمن
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# تشغيل الاستدلال على صورة بسلاسة
prediction = model("path/to/image.jpg")
prediction[0].show()يتيح استخدام منظومة Ultralytics للمطورين الانتقال من نموذج أولي إلى نموذج ONNX مُصدّر بالكامل باستخدام بضعة أسطر من الشيفرة فحسب، متجاوزين بذلك إعدادات البيئة المعقدة التي تتطلبها أطر العمل الأقدم.
حالات الاستخدام في العالم الحقيقي#
- البيع بالتجزئة الذكي (DAMO-YOLO): تلائم دقة DAMO-YOLO بيئات الخوادم عالية الكثافة التي تحلل سلوك العملاء، حيث تتوفر وحدات GPU بكثرة ويمكن التعامل مع اختناقات NMS في الزمن الحقيقي.
- المركبات ذاتية القيادة (YOLOv10): تضمن البنية الخالية من NMS زمن استجابة حتميًا ويمكن التنبؤ به، وهو أمر بالغ الأهمية لأنظمة السلامة في القيادة الذاتية.
- الأتمتة الصناعية (YOLOv10): يتطلب كشف العيوب على خطوط التجميع سريعة الحركة نماذج تزيد سرعات الاستدلال في الزمن الحقيقي إلى أقصى حد دون استهلاك قدر هائل من VRAM، ما يجعل YOLOv10 خيارًا مثاليًا للنشر على الحافة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO وYOLOv10 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار DAMO-YOLO#
يُعد DAMO-YOLO خيارًا قويًا في الحالات التالية:
- تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو ذات معدل إطارات مرتفع على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند batch-1 المقياس الأساسي.
- خطوط التصنيع الصناعي: السيناريوهات ذات قيود زمن استجابة صارمة على GPU ضمن أجهزة مخصصة، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والعمود الفقري الفعال المعاد تحديد معلماته على أداء الكشف.
متى تختار YOLOv10#
يوصى بـ YOLOv10 في الحالات التالية:
- الكشف الآني دون NMS: التطبيقات التي تستفيد من الكشف الشامل من البداية إلى النهاية من دون الكبت غير الأقصى، مما يقلل تعقيد النشر.
- موازنة السرعة والدقة: المشاريع التي تتطلب توازناً جيداً بين سرعة الاستدلال ودقة الكشف عبر مقاييس نماذج متعددة.
- التطبيقات ذات زمن الاستجابة الثابت: سيناريوهات النشر التي تتطلب أوقات استدلال قابلة للتنبؤ، مثل الروبوتات أو الأنظمة ذاتية التشغيل.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
الجيل التالي: تعرف على Ultralytics YOLO26#
رغم أن YOLOv10 مهد الطريق للكشف الخالي من NMS، فقد تطورت التقنية بسرعة. ويوفر نموذج Ultralytics YOLO26 للتطبيقات الحديثة أداءً وسهولة استخدام لا مثيل لهما، إذ يجمع أفضل ما في الأجيال السابقة ويحسّنه لبيئات الإنتاج.
يتميز YOLO26 بوضع شامل أصيل (nms=False) يتجاوز المعالجة اللاحقة لـNMS لتبسيط مسارات النشر على أجهزة الحافة. علاوة على ذلك، حسّنت إزالة خسارة البؤرة التوزيعية (DFL) التوافق بدرجة كبيرة مع أجهزة الذكاء الاصطناعي الطرفي منخفضة الطاقة.
على صعيد التدريب، يقدم YOLO26 محسّن MuSGD، وهو محسّن هجين مستوحى من تقنيات تدريب النماذج اللغوية الكبيرة (LLM). وهذا يضمن تدريبًا أكثر استقرارًا وتقاربًا أسرع. وبالاقتران مع دوال الخسارة ProgLoss + STAL، يُظهر YOLO26 تحسنًا ملحوظًا في التعرف على الأجسام الصغيرة، وهي ميزة أساسية لـالحفاظ على الحياة البرية وعمليات الطائرات المسيّرة.
والأهم أن YOLO26 ليس مجرد كاشف للأجسام. فهو يقدم تحسينات مخصصة للمهام على امتداد المنظومة، ويدعم أصليًا تقسيم الكائنات، وتقدير الوضعية باستخدام تقدير الاحتمالية اللوغاريتمية المتبقية (RLE)، وخسائر زاوية متخصصة لـالصناديق المحيطة الموجّهة (OBB). وبفضل استدلال على CPU أسرع بنسبة تصل إلى 43% مقارنة بأسلافه، يُعد الخيار الأمثل لفرق الهندسة سريعة الحركة.
توفر منصة Ultralytics واجهة سهلة الاستخدام تبسط دورة حياة الرؤية الحاسوبية بأكملها، وتتيح الإدارة المركزية ووضع التسميات والتدريب السحابي لنماذج YOLO26.
يمكن للمطورين المهتمين باستكشاف تطورات حديثة أخرى تقييم Ultralytics YOLO11 أو إطار RT-DETR القائم على Transformer، للسيناريوهات التي تتطلب حلولًا معمارية مختلفة.