DAMO-YOLO مقابل YOLOv10#
شهد مجال الرؤية الحاسوبية تطورًا سريعًا في بنيات اكتشاف الكائنات في الوقت الفعلي. عند مقارنة DAMO-YOLO وYOLOv10، نلاحظ فلسفتين متميزتين في تصميم النماذج: البحث الآلي عن البنية مقابل التحسين الشامل من البداية إلى النهاية والخالي من NMS. وعلى الرغم من أن كليهما يدفع حدود الدقة والسرعة، فإن بنيتيهما الأساسيتين وحالات الاستخدام المثالية لهما تختلفان اختلافًا كبيرًا.
DAMO-YOLO: البحث عن البنية العصبية على نطاق واسع#
طوّرته مجموعة Alibaba، وبرز DAMO-YOLO بوصفه كاشفًا قويًا يركّز على الاستفادة من الاكتشاف الآلي لتحقيق الكفاءة الهيكلية.
- المؤلفون: Xianzhe Xu، وYiqi Jiang، وWeihua Chen، وYilun Huang، وYuan Zhang، وXiuyu Sun
- التاريخ: 23 نوفمبر 2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
أبرز معالم البنية المعمارية#
يعتمد DAMO-YOLO بشكل كبير على البحث في بنية الشبكات العصبيّة (NAS) لتحقيق التوازن بين الأداء ووقت الاستجابة. يستخدم العمود الفقري الخاص به، والذي يُسمى MAE-NAS، بحثاً موجهاً بأقصى إنتروبيا في ظل ميزانيات حسابية صارمة للعثور على عمق الطبقة وعرضها الأمثل.
لمعالجة دمج السمات عبر المقاييس، يستخدم النموذج RepGFPN (شبكة هرم السمات العامة المُعاد تحديد معلماتها) بكفاءة. ويتميز هذا التصميم ذي العنق الثقيل بقدرته على استخراج التسلسلات الهرمية المكانية المعقدة، مما يجعله مفيدًا في سيناريوهات مثل تحليل الصور الجوية. بالإضافة إلى ذلك، يقدّم DAMO-YOLO وحدة ZeroHead، وهي رأس كشف مبسّط يقلل بدرجة كبيرة من تعقيد طبقات التنبؤ النهائية، مع الاعتماد على عملية تعزيز قوية بالتقطير أثناء التدريب.
غالبًا ما يستخدم DAMO-YOLO عملية تقطير معرفة متعددة المراحل. ويتطلب ذلك تدريب نموذج «معلّم» أكبر حجمًا لتوجيه نموذج «طالب» أصغر حجمًا، يستخلص mAP (متوسط الدقة) أعلى، لكنه يزيد بدرجة كبيرة زمن الحوسبة على GPU المطلوب.
YOLOv10: الريادة في اكتشاف الكائنات من البداية إلى النهاية#
بعد عام ونصف، قدّم YOLOv10 تحولًا جذريًا في النهج من خلال إلغاء الحاجة تمامًا إلى الكبت غير الأقصى (NMS) أثناء الاستدلال.
- المؤلفون: Ao Wang، Hui Chen، Lihao Liu، وآخرون.
- الجهة: جامعة تسينغهوا
- التاريخ: 23 مايو 2024
- Arxiv: 2405.14458
- المستندات: Ultralytics YOLOv10
أبرز معالم البنية المعمارية#
تتمثل الميزة الأبرز في YOLOv10 في التعيينات المزدوجة المتسقة للتدريب الخالي من NMS. تتنبأ الكاشفات التقليدية بعدة مربعات إحاطة متداخلة لكائن واحد، مما يتطلب استخدام NMS لتصفية التكرارات. وتشكّل خطوة المعالجة اللاحقة هذه عنق زجاجة، لا سيما على الأجهزة الطرفية. ويحل YOLOv10 هذه المشكلة من خلال تمكين النموذج من التنبؤ طبيعيًا بمربع إحاطة واحد ودقيق لكل كائن.
ركز المؤلفون أيضًا على تصميم شامل للنموذج تحركه الكفاءة والدقة. ومن خلال تحليل التكرار الحسابي في البنى الحالية بعناية، حسّنوا البنية الأساسية والرأس لتقليل عدد FLOPs والمعلمات. ويضمن هذا التصميم خفيف الوزن أن يحقق YOLOv10 زمن استجابة استدلال استثنائيًا عند تصديره إلى تنسيقات مثل TensorRT أو OpenVINO.
الأداء والمعايير القياسية#
يوضح الجدول أدناه مقاييس الأداء الأولية على مجموعة بيانات COCO. وقد أُبرزت أفضل القيم الإجمالية في كل عمود بخط عريض.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
على الرغم من أن DAMO-YOLO يحقق أداءً جيدًا من حيث الدقة، فإن YOLOv10 يوفر باستمرار زمن استجابة أقل وأوزان نموذج أصغر بكثير. فعلى سبيل المثال، يحقق YOLOv10s قيمة mAP أعلى قليلًا (46.7%) من DAMO-YOLOs (46.0%)، مع استخدام أقل من نصف عدد المعلمات (7.2M مقابل 16.3M). وتجعل متطلبات الذاكرة الأقل من YOLOv10 خيارًا متعدد الاستخدامات بصورة استثنائية للأنظمة المضمنة.
كفاءة التدريب وسهولة الاستخدام#
عند الانتقال من البحث الأكاديمي إلى الإنتاج، تكون سهولة الاستخدام أمرًا بالغ الأهمية. وقد تفرض عملية التقطير متعددة المراحل وإعدادات NAS المعقدة في DAMO-YOLO منحنى تعلم حادًا على فرق الهندسة.
وعلى العكس، يستفيد YOLOv10 بدرجة كبيرة من دمجه الكامل في حزمة Ultralytics Python SDK. ويتطلب تدريب نموذج مخصص حدًا أدنى من الشيفرة التمهيدية. ويتولى Ultralytics تلقائيًا زيادة البيانات وضبط المعلمات الفائقة وتتبع التجارب.
from ultralytics import YOLO
# Load a pretrained YOLOv10 nano model
model = YOLO("yolov10n.pt")
# Train on a custom dataset with built-in validation
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on an image seamlessly
prediction = model("path/to/image.jpg")
prediction[0].show()يتيح استخدام منظومة Ultralytics للمطورين الانتقال من نموذج أولي إلى نموذج ONNX مُصدَّر بالكامل عبر بضعة أسطر من الشيفرة فقط، متجاوزين عمليات إعداد البيئات المعقدة المطلوبة في أطر العمل الأقدم.
حالات الاستخدام الواقعية#
- تجارة التجزئة الذكية (DAMO-YOLO): تتناسب دقة DAMO-YOLO جيدًا مع بيئات الخوادم عالية الكثافة التي تحلل سلوك العملاء، حيث تتوفر GPU بكثرة ويمكن التحكم في اختناقات NMS في الوقت الفعلي.
- المركبات ذاتية القيادة (YOLOv10): تضمن البنية الخالية من NMS زمن استجابة حتميًا وقابلًا للتنبؤ، وهو أمر بالغ الأهمية لأنظمة السلامة في القيادة الذاتية.
- الأتمتة الصناعية (YOLOv10): يتطلب اكتشاف العيوب على خطوط التجميع سريعة الحركة نماذج تعظّم سرعات الاستدلال في الوقت الفعلي دون استهلاك قدر هائل من VRAM، مما يجعل YOLOv10 خيارًا رئيسيًا للنشر على الأجهزة الطرفية.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO وYOLOv10 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار DAMO-YOLO#
يُعد DAMO-YOLO خيارًا قويًا من أجل:
- تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو عالية FPS على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند حجم الدفعة 1 هي المقياس الأساسي.
- خطوط التصنيع الصناعية: السيناريوهات ذات القيود الصارمة على زمن استجابة GPU ضمن عتاد مخصص، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والشبكات الأساسية المعاد تمثيلها بكفاءة على أداء الاكتشاف.
متى تختار YOLOv10#
يوصى باستخدام YOLOv10 من أجل:
- الاكتشاف في الوقت الفعلي الخالي من NMS: التطبيقات التي تستفيد من الاكتشاف من الطرف إلى الطرف دون كبت القيم غير العظمى، ما يقلل تعقيد النشر.
- المفاضلة المتوازنة بين السرعة والدقة: المشاريع التي تتطلب توازنًا قويًا بين سرعة الاستدلال ودقة الاكتشاف عبر مقاييس نماذج مختلفة.
- التطبيقات ذات زمن الانتقال المتسق: سيناريوهات النشر التي تكون فيها أزمنة الاستدلال المتوقعة أمرًا بالغ الأهمية، مثل الروبوتات أو الأنظمة الذاتية.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
الجيل التالي: تقديم Ultralytics YOLO26#
على الرغم من أن YOLOv10 وضع الأساس لاكتشاف الكائنات الخالي من NMS، فقد تطورت التقنية بسرعة. وبالنسبة إلى التطبيقات الحديثة، يقدم نموذج Ultralytics YOLO26 أداءً وسهولة استخدام لا مثيل لهما، إذ يستفيد من أفضل ما قدمته الأجيال السابقة ويصقله ليتناسب مع الإنتاج.
يتميز YOLO26 بتصميم أصلي من البداية إلى النهاية، مما يلغي المعالجة اللاحقة لـ NMS لخطوط أنابيب نشر أبسط عبر أجهزة الحافة. علاوة على ذلك، أدى إزالة خسارة التركيز التوزيعي (DFL) إلى تحسين التوافق بشكل كبير مع عتاد الذكاء الاصطناعي على الحافة منخفض الطاقة.
على صعيد التدريب، يقدّم YOLO26 مُحسِّن MuSGD، وهو مُحسِّن هجين مستوحى من تقنيات تدريب نماذج اللغة الكبيرة (LLM). ويضمن ذلك تدريبًا أكثر استقرارًا وتقاربًا أسرع. وبالاقتران مع دوال الخسارة ProgLoss + STAL، يُظهر YOLO26 تحسينات ملحوظة في التعرف على الكائنات الصغيرة، وهي ميزة مهمة لـالحفاظ على الحياة البرية وعمليات الطائرات المسيّرة.
والأهم من ذلك أن YOLO26 ليس مجرد كاشف للكائنات. فهو يقدم تحسينات خاصة بكل مهمة على نطاق واسع، مع دعم أصلي لـتجزئة المثيلات وتقدير الوضعية باستخدام تقدير الاحتمال اللوغاريتمي المتبقي (RLE)، وخسائر زاوية متخصصة لـمربعات الإحاطة الموجّهة (OBB). ومع استدلال على CPU أسرع بنسبة تصل إلى 43% من أسلافه، فإنه الخيار الحاسم لفرق الهندسة الرشيقة.
لإدارة نماذج YOLO26 ووضع تعليقاتها التوضيحية وتدريبها سحابيًا بصورة مركزية، توفر منصة Ultralytics واجهة بديهية تبسّط دورة حياة الرؤية الحاسوبية بأكملها.
يمكن للمطورين المهتمين باستكشاف التطورات الحديثة الأخرى أيضًا تقييم Ultralytics YOLO11 أو إطار العمل RT-DETR القائم على Transformer للسيناريوهات التي تتطلب حلولًا معمارية متميزة.