YOLOv7 مقابل DAMO-YOLO#
يشهد مجال اكتشاف الأجسام في الوقت الفعلي تطورًا مستمرًا، إذ يسعى الباحثون والمهندسون إلى إيجاد التوازن الأمثل بين السرعة والدقة. في هذه المقارنة التقنية، سنتعمق في بنيتين بارزتين من عام 2022: YOLOv7 وDAMO-YOLO. قدم كلا النموذجين مفاهيم مبتكرة إلى مجتمع الرؤية الحاسوبية، وتناولا تحديات مختلفة في تدريب النماذج وتصميم البنية والنشر.
خلفية النماذج والتفاصيل التقنية#
قبل التعمق في بنيتيهما، من الضروري فهم أصول هذين النموذجين. فقد طوّرتهما مجموعات بحثية رائدة، وقدّما منهجيات متقدمة لتوسيع حدود اكتشاف الأجسام في الوقت الفعلي.
تفاصيل YOLOv7#
طُوّر YOLOv7 بوصفه امتدادًا لعائلة YOLO، وقدم مفهوم «حقيبة المجانيات» القابلة للتدريب لتعزيز الدقة بدرجة كبيرة من دون زيادة تكلفة الاستدلال.
- المؤلفون: Chien-Yao Wang وAlexey Bochkovskiy وHong-Yuan Mark Liao
- الجهة: معهد علوم المعلومات، أكاديميا سينيكا، تايوان
- التاريخ: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- التوثيق: https://docs.ultralytics.com/models/yolov7
تفاصيل DAMO-YOLO#
طوّر باحثون في مجموعة Alibaba هذا النموذج، وركّز DAMO-YOLO بدرجة كبيرة على البحث عن البنية العصبية (NAS) وتقطير المعرفة المتقدم لبناء نماذج عالية الكفاءة لمختلف أنواع العتاد.
- المؤلفون: Xianzhe Xu، وYiqi Jiang، وWeihua Chen، وYilun Huang، وYuan Zhang، وXiuyu Sun
- الجهة: Alibaba Group
- التاريخ: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
الابتكارات المعمارية#
YOLOv7: تحليل مسارات التدرج وإعادة المعلمة#
يركز YOLOv7 بدرجة كبيرة على شبكات تجميع الطبقات الفعالة الموسعة (E-ELAN). صمّم المؤلفون E-ELAN من خلال تحليل مسارات التدرج في الشبكة، بما يضمن قدرة الشبكة على التعلم المستمر من دون إضعاف مسار التدرج الأصلي. علاوة على ذلك، يستفيد YOLOv7 بفاعلية من إعادة معلمة النموذج أثناء الاستدلال، إذ يدمج الطبقات بسلاسة لتقليل FLOPs وتسريع أوقات التنفيذ. وهذا يجعله مناسبًا للغاية لـالاستدلال في الوقت الفعلي على وحدات GPU الحديثة.
DAMO-YOLO: البحث عن البنية العصبية وRepGFPN#
يختلف نظام DAMO-YOLO من خلال الاعتماد بشكل كبير على بحث بنية الشبكات العصبية (NAS) في ظل قيود زمن الانتقال. وهو يستخدم إطار عمل يُسمى MAE-NAS لاكتشاف الهياكل الأساسية المثلى المخصصة لأجهزة محددة، مثل الأجهزة المحددة أو مسرعات الحافة المحددة. وبالنسبة للجزء المتوسط، فإنه يقدم هيكل RepGFPN (شبكة هرمية للميزات المعممة إعادة الصياغة) فعالاً، كما يوظف تصميم ZeroHead لتقليل العبء الحسابي في رؤوس التنبؤ.
بينما يعتمد YOLOv7 على تحسينات قوية متأصلة في بنيته، يعتمد DAMO-YOLO بدرجة كبيرة على عملية معقدة متعددة المراحل لتقطير المعرفة. ويتطلب ذلك تدريب نموذج معلّم كبير لتقطير المعرفة إلى نموذج طالب أصغر، ما قد يكون مكلفًا حسابيًا أثناء مرحلة التدريب.
مقارنة الأداء والمقاييس#
عند مقارنة هذه النماذج، من الضروري النظر في mAP (متوسط الدقة المتوسطة) وسرعة الاستدلال وتعقيد النموذج.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
يوضح الجدول أعلاه أن YOLOv7 يتوسع جيدًا إلى مجالات الدقة العالية (YOLOv7x)، بينما يوفر DAMO-YOLO نماذج صغيرة محسّنة للغاية للبيئات محدودة الموارد.
كفاءة التدريب ومتطلبات الذاكرة#
يكمن أحد الفروق الرئيسية بين البنيتين في منهجيات التدريب. فاعتماد DAMO-YOLO على التقطير يعني أن تدريب نموذج جديد من الصفر أو إجراء الضبط الدقيق على مجموعة بيانات مخصصة للرؤية الحاسوبية يتطلب غالبًا قدرًا أكبر بكثير من VRAM ووقت الحوسبة على GPU.
وعلى النقيض من ذلك، تُحسّن النماذج المدمجة في منظومة Ultralytics، مثل YOLOv7 والإصدارات الأحدث، بدرجة كبيرة لتلبية متطلبات الذاكرة. وتتيح للمطورين استخدام أحجام دفعات أكبر على العتاد الاستهلاكي من دون مواجهة أخطاء نفاد الذاكرة، مما يبسط عملية تتبع التجارب والتكرار.
ميزة Ultralytics#
على الرغم من أن كلًا من YOLOv7 وDAMO-YOLO يقدم ميزات قوية، فإن نشر النماذج ضمن منظومة Ultralytics يوفر تجربة تطوير لا مثيل لها.
- سهولة الاستخدام: توفر حزمة Ultralytics Python واجهة API موحدة وبسيطة. ويمكنك التبديل سريعًا بين بنيات النماذج، وبدء حلقات التدريب، أو تنفيذ الاستدلال باستخدام بضعة أسطر من التعليمات البرمجية.
- منظومة تحظى بصيانة جيدة: توفر Ultralytics تحديثات متكررة، مما يضمن التوافق الأصلي مع أحدث إصدارات PyTorch وبرامج تشغيل CUDA. كما تبسط عملية تصدير النماذج إلى تنسيقات مثل ONNX وTensorRT وOpenVINO.
- تعدد الاستخدامات: بخلاف DAMO-YOLO، الذي يقتصر على اكتشاف الأجسام، تدعم منظومة Ultralytics مهام متنوعة بشكل أصلي. ويمكن لنماذج عائلة Ultralytics تنفيذ اكتشاف مربعات الإحاطة القياسي، وتقدير الوضعية، وتقسيم المثيلات، ومربعات الإحاطة الموجّهة (OBB).
مثال برمجي: البدء بسرعة#
إليك مدى سهولة تحميل نماذج Ultralytics وتدريبها وتنفيذ الاستدلال باستخدامها:
from ultralytics import YOLO
# Load a pre-trained YOLOv7 model (or newer models like yolo26n.pt)
model = YOLO("yolov7.pt")
# Train the model on the COCO8 dataset with automated hyperparameter handling
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX format for deployment
model.export(format="onnx")مع Ultralytics، تتم معالجة تصدير الأوزان المدرّبة إلى تنسيقات متنوعة مسرّعة بالعتاد (مثل TensorRT أو CoreML) عبر وسيطة واحدة في أمر التصدير، مما يوفر ساعات من إعدادات البرامج النصية المعقدة.
الجيل التالي: YOLO26#
على الرغم من أن YOLOv7 لا يزال بنية قوية موروثة، فقد تقدم المجال بسرعة. وبالنسبة إلى عمليات النشر الجديدة، يُعد Ultralytics YOLO26 (الذي أُصدر في يناير 2026) المعيار الموصى به، إذ يتفوق على الأجيال السابقة في كل المقاييس تقريبًا.
- تصميم شامل خالٍ من NMS: طُوّر هذا النهج أولًا في YOLOv10، إذ يلغي YOLO26 بشكل أصلي المعالجة اللاحقة لكبت غير الأعظمي (NMS). ويضمن ذلك استدلالًا حتميًا بزمن استجابة فائق الانخفاض، وهو أمر بالغ الأهمية للروبوتات وتقنيات القيادة الذاتية.
- مُحسِّن MuSGD: يستوحي هذا المُحسِّن الهجين أفكاره من تقنيات تدريب LLM المتقدمة (مثل Kimi K2 من Moonshot AI)، ويمزج بين SGD وMuon لتوفير تدريب مستقر للغاية وتقارب أسرع عبر مجموعات البيانات.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: من خلال إزالة خسارة البؤرة التوزيعية (DFL) بصورة استراتيجية، يعزز YOLO26 الأداء بدرجة كبيرة على منصات الحوسبة الطرفية ووحدات CPU.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات كبيرة في اكتشاف الأجسام الصغيرة، مما يجعل YOLO26 مناسبًا للغاية لـالصور الجوية والمراقبة التفصيلية.
حالات الاستخدام المثالية#
متى تختار DAMO-YOLO#
- البحث الأكاديمي في NAS: إذا كانت مؤسستك تستثمر بدرجة كبيرة في دراسة منهجيات البحث عن البنية العصبية.
- زمن استجابة مقيّد للغاية على عتاد محدد: إذا كانت لديك الموارد اللازمة لتشغيل عمليات بحث NAS شاملة للعثور على بنية أساسية مخصصة لشريحة مسرّع ذكاء اصطناعي مخصصة.
متى تختار YOLOv7#
- مسارات GPU الحالية: للفرق التي تحافظ على مسارات إنتاج موروثة محسّنة بعمق حول بنية E-ELAN المحددة في YOLOv7 على عتاد NVIDIA المتطور.
لماذا تهاجر إلى نماذج Ultralytics الحديثة (YOLO11 / YOLO26)#
بالنسبة إلى الغالبية العظمى من تطبيقات المؤسسات—من تحليلات تجارة التجزئة والتصنيع الذكي إلى الرعاية الصحية—لا تضاهي النماذج الحديثة من Ultralytics. ويوفر التكامل مع منصة Ultralytics مسار ML كاملًا، يجمع بين سهولة الاستخدام والتوثيق المتفوق والدعم المجتمعي القوي وتعدد الاستخدامات عبر المهام. وسواء كنت تتتبع المخزون على Raspberry Pi أو تجري تحليلات مكثفة في السحابة، فإن نماذج مثل YOLO26 توفر التوازن المثالي في الأداء لمستقبل الرؤية الحاسوبية.