YOLO11 مقابل YOLOv7#
يواصل مشهد الرؤية الحاسوبية تطوره بوتيرة متسارعة، مع بقاء اكتشاف الأجسام في الوقت الفعلي في طليعة تطبيقات الذكاء الاصطناعي. ويتطلب اختيار البنية المناسبة لمشروعك الموازنة بين السرعة والدقة وسهولة النشر ضمن مفاضلة معقدة. في هذا الدليل، نقدم مقارنة تقنية شاملة بين بنيتين بارزتين: Ultralytics YOLO11 وYOLOv7.
خلفية النماذج والتفاصيل التقنية#
أثر كلا النموذجين تأثيرًا كبيرًا في مجتمع التعلم العميق، لكنهما ينحدران من فلسفتين وعصرين مختلفين في التطوير.
تفاصيل YOLO11:
- المؤلفان: Glenn Jocher وJing Qiu
- المنظمة: Ultralytics
- التاريخ: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- التوثيق: https://docs.ultralytics.com/models/yolo11
تفاصيل YOLOv7:
- المؤلفون: Chien-Yao Wang وAlexey Bochkovskiy وHong-Yuan Mark Liao
- الجهة: معهد علوم المعلومات، أكاديميا سينيكا، تايوان
- التاريخ: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- التوثيق: https://docs.ultralytics.com/models/yolov7
الاختلافات المعمارية#
عند تحليل الآليات الداخلية، يستخدم كلا الكاشفين مفاهيم متطورة، إلا أن أسسهما البنيوية مختلفة.
قدم YOLOv7 مفهوم شبكات تجميع الطبقات الفعّالة الموسعة (E-ELAN). وصُممت هذه البنية لتعزيز قدرة الشبكة على التعلم باستمرار من دون تدمير مسار التدرج الأصلي، وهو إنجاز مهم أُبلغ عنه في ورقة البحث الخاصة بهم. ويعتمد YOLOv7 بدرجة كبيرة على إعادة المعلمة البنيوية ومنهجية قوية قائمة على "مجموعة من المزايا المجانية" أثناء التدريب، ما يحسن الدقة الإجمالية على مجموعة بيانات COCO من دون زيادة تكاليف الاستدلال.
في المقابل، بُني YOLO11 على بنية Ultralytics المحسّنة بدرجة كبيرة. ويركز على خط أنابيب أكثر صقلًا لـاستخراج السمات باستخدام عدد أقل من المعلمات، ما يؤدي إلى خفض استخدام الذاكرة أثناء التدريب. ويحقق YOLO11 توازنًا ملائمًا للغاية في الأداء، إذ يستخدم موارد حسابية أقل (FLOPs) مع مضاهاة دقة اكتشاف النماذج الأكبر أو تجاوزها. علاوة على ذلك، يدعم YOLO11 بطبيعته مجموعة أوسع من المهام، ما يجعله خيارًا عالي المرونة لتطبيقات الرؤية الحاسوبية الحديثة.
من أبرز سمات نماذج Ultralytics YOLO انخفاض احتياجاتها من الذاكرة أثناء التدريب مقارنةً بالنماذج الأخرى المتطورة، ما يتيح للمطورين تدريب شبكات قوية على عتاد PyTorch المخصص للمستهلكين.
مقارنة الأداء والمقاييس#
لقياس الجدوى في العالم الحقيقي بدقة، من الضروري تقييم مقاييس مثل متوسط الدقة (mAP)، وسرعة الاستدلال، ومعلمات النموذج، والتعقيد الحسابي (FLOPs). يوضح الجدول التالي كيفية مقارنة متغيرات تحجيم YOLO11 بنماذج YOLOv7 الأكبر.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
كما يتضح، يحقق نموذج مثل YOLO11x قيمة 54.7 mAP أعلى مقارنةً بقيمة 53.1 mAP لنموذج YOLOv7x، مع استخدام عدد أقل بكثير من المعلمات (56.9M مقابل 71.3M). وهذا يبرز الكفاءة المعمارية الفائقة لـYOLO11.
كفاءة التدريب وسهولة استخدام المنظومة#
تتمثل إحدى أبرز الخصائص الفارقة بين هاتين البنيتين في تجربة المطور والمنظومة المحيطة.
YOLOv7 هو في جوهره مستودع أكاديمي للبحث. وغالبًا ما يتطلب تدريب النماذج إعدادات معقدة للبيئة، وإدارة يدوية للتبعيات، واستخدام وسائط طويلة في سطر الأوامر. وعلى الرغم من دعمه للتجارب المتطورة، فإن تكييف شيفرة مستودع YOLOv7 على GitHub لبيئات الإنتاج المخصصة قد يستغرق وقتًا طويلًا.
يعيد YOLO11 تعريف سهولة الاستخدام بالكامل. فهو مدمج تمامًا في منصة Ultralytics، وهي منظومة شاملة تتم صيانتها جيدًا وتوفر مسارات عمل سلسة من البداية إلى النهاية. ومن وسم البيانات والتدريب المحلي إلى النشر، تعمل واجهة Python API الموحدة وواجهة سطر الأوامر البسيطة على تبسيط العملية بأكملها.
مقارنة الشيفرات#
لا يتطلب تدريب نموذج لاكتشاف الأجسام باستخدام YOLO11 سوى بضعة أسطر من الشيفرة، ما يقلل حاجز الدخول بدرجة كبيرة:
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly using the unified API
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Quickly export to ONNX format
model.export(format="onnx")في المقابل، يبدو أمر التدريب المعتاد لـYOLOv7 كما يلي، إذ يتطلب إعدادًا دقيقًا للمسارات وملفات التكوين وبرامج bash النصية:
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'يوفر YOLO11 أيضًا مرونة هائلة. فبينما يتطلب YOLOv7 قواعد شيفرة مختلفة تمامًا أو تعديلات كبيرة لدعم المهام التي تتجاوز الاكتشاف، مثل تقدير الوضعية أو التجزئة، يتعامل YOLO11 مع اكتشاف الأجسام، وتجزئة المثيلات، وتصنيف الصور، وتقدير الوضعية، واكتشاف المربع المحيط الموجّه (OBB) عبر إطار عمل واحد متماسك.
التطبيقات الواقعية وحالات الاستخدام المثالية#
يعتمد الاختيار بين YOLOv7 وYOLO11 بالكامل على نطاق المشروع وقيود النشر.
متى ينبغي النظر في YOLOv7:
- قياس أداء النماذج القديمة: قد يستخدم الباحثون الأكاديميون الذين يستكشفون تصاميم مسارات التدرج YOLOv7 كخط أساس لتقييم الشبكات العصبية الالتفافية الأحدث.
- مسارات العمل المخصصة الحالية: الفرق التي تمتلك مسارات عمل مخصصة بدرجة كبيرة بلغة C++ أو CUDA ومبنية خصيصًا حول منطق YOLOv7 الفريد لفك ترميز المربع المحيط.
متى ينبغي اختيار YOLO11:
- الإنتاج التجاري: تستفيد التطبيقات في تجارة التجزئة الذكية أو تشخيص الرعاية الصحية بدرجة كبيرة من قاعدة شيفرة YOLO11 التي تتم صيانتها جيدًا ومن استقراره العالي.
- البيئات محدودة الموارد: تجعل البصمة الخفيفة لـYOLO11n منه خيارًا ملائمًا للغاية للنشر على الأجهزة المحمولة وأجهزة الحافة عبر ONNX.
- المشاريع متعددة المهام: إذا احتاج تطبيق واحد إلى تحديد شخص، ورسم هيكله العظمي (الوضعية)، وتجزئة جسم يحمله، فإن YOLO11 يوفر حلًا موحدًا.
الطليعة التقنية: المضي قدمًا مع YOLO26#
مع أن YOLO11 يظل خيارًا قويًا للغاية، فإن الابتكار في الذكاء الاصطناعي لا ينام. وبالنسبة إلى المهندسين الذين يبدؤون مشاريع جديدة اليوم، يُوصى بشدة باستكشاف Ultralytics YOLO26.
أُطلق YOLO26 في يناير 2026، ويقدم تصميمًا شاملًا من دون NMS، ما يلغي تمامًا اختناقات زمن الاستجابة المرتبطة بالمعالجة اللاحقة لـقمع غير الأقصى. علاوة على ذلك، يدمج YOLO26 محسّن MuSGD الثوري المستوحى من منهجيات تدريب نماذج LLM لضمان تقارب أسرع. وبفضل تحسينات الخسارة المستهدفة عبر ProgLoss + STAL واستدلال CPU أسرع بنسبة تصل إلى 43% نتيجة إزالة DFL، جرى تحسين YOLO26 خصيصًا للحوسبة الطرفية، ويمثل حاليًا ذروة الذكاء الاصطناعي للرؤية.
بالنسبة إلى المستخدمين المهتمين بالبنى البديلة المتخصصة، قد يؤدي استكشاف نماذج RT-DETR القائمة على Transformer أو نماذج YOLO-World الديناميكية ذات المفردات المفتوحة إلى نتائج مفيدة أيضًا في عمليات نشر الرؤية الحاسوبية المتنوعة.