YOLO11 مقابل YOLOv7#
يستمر مشهد الرؤية الحاسوبية في التطور بخطى سريعة، حيث يظل الكشف عن الكائنات في الوقت الفعلي في طليعة تطبيقات الذكاء الاصطناعي. يتطلب اختيار البنية المناسبة لمشروعك التنقل عبر مقايضة معقدة بين السرعة والدقة وسهولة النشر. في هذا الدليل، نقدم مقارنة تقنية شاملة بين بنيتين بارزتين: Ultralytics YOLO11 و YOLOv7.
خلفية النموذج والتفاصيل التقنية#
ترك كلا النموذجين تأثيراً كبيراً على مجتمع التعلم العميق، لكنهما ينبعان من فلسفات تطوير وعصور مختلفة.
تفاصيل YOLO11:
المؤلفون: غلين جوشر وجينغ تشيو
المؤسسة: Ultralytics
التاريخ: 2024-09-27
GitHub: https://github.com/ultralytics/ultralytics
التوثيق: https://docs.ultralytics.com/models/yolo11/
تفاصيل YOLOv7:
المؤلفون: تشيين-ياو وانغ، أليكسي بوتشكوفسكي، وهونغ-يوان مارك لياو
المؤسسة: معهد علوم المعلومات، أكاديميا سينيكا، تايوان
التاريخ: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: https://github.com/WongKinYiu/yolov7
التوثيق: https://docs.ultralytics.com/models/yolov7/
الاختلافات المعمارية#
عند تحليل الآليات الداخلية، يستخدم كلا الكاشفين مفاهيم متطورة، ومع ذلك تختلف أسسهما الهيكلية.
قدمت YOLOv7 مفهوم شبكات تجميع الطبقات الفعالة الممتدة (E-ELAN). صُممت هذه البنية للتعزيز المستمر لقدرة الشبكة على التعلم دون تدمير مسار التدرج الأصلي، وهو إنجاز حاسم تم الإبلاغ عنه في بحثهم العلمي. تعتمد YOLOv7 بشكل كبير على إعادة التبارز الهيكلي ومنهجية "حقيبة الهدايا" القوية أثناء التدريب، مما يحسن الدقة الإجمالية على مجموعة بيانات COCO دون زيادة تكاليف الاستدلال.
في المقابل، تم بناء YOLO11 على بنية Ultralytics عالية التحسين. وهي تؤكد على خط أنابيب أكثر دقة لـ استخراج الميزات بعدد أقل من المعلمات، مما يؤدي إلى انخفاض استهلاك الذاكرة أثناء التدريب. تحقق YOLO11 توازناً ملائماً للغاية في الأداء، حيث تستخدم موارد حسابية أقل (FLOPs) بينما تطابق أو تتجاوز دقة الكشف للنماذج الأثقل. علاوة على ذلك، تدعم YOLO11 بطبيعتها مجموعة واسعة من المهام، مما يجعلها خياراً متعدد الاستخدامات للغاية لتطبيقات الرؤية الحاسوبية الحديثة.
تتمثل إحدى الميزات البارزة لنماذج Ultralytics YOLO في متطلبات الذاكرة الأقل أثناء التدريب مقارنة بالنماذج الحديثة الأخرى، مما يسمح للمطورين بتدريب شبكات قوية على أجهزة PyTorch الاستهلاكية.
مقارنة الأداء والمقاييس#
لقياس الجدوى في العالم الحقيقي بدقة، يعد تقييم مقاييس مثل متوسط دقة متوسط (mAP)، وسرعة الاستنتاج، ومعلمات النموذج، وتعقيد الحوسبة (FLOPs) أمراً ضرورياً. يوضح الجدول التالي كيف تقارن متغيرات توسيع YOLO11 بنماذج YOLOv7 الأكبر.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (ms) | السرعة T4 TensorRT10 (ms) | المعلمات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
كما لوحظ، يحقق نموذج مثل YOLO11x درجة 54.7 mAP أعلى مقارنة بـ 53.1 mAP لنموذج YOLOv7x، مع استخدام معلمات أقل بكثير (56.9 مليون مقابل 71.3 مليون). يسلط هذا الضوء على كفاءة بنية YOLO11 الفائقة.
كفاءة التدريب وقابلية الاستخدام في النظام البيئي#
إحدى أكثر الخصائص تميزاً التي تفصل بين هاتين البنيتين هي تجربة المطور والنظام البيئي المحيط.
YOLOv7 هو في جوهره مستودع بحثي أكاديمي. يتطلب تدريب النماذج غالباً إعدادات بيئة معقدة، وإدارة التبعيات يدوياً، واستخدام وسائط سطر أوامر طويلة. على الرغم من أنه يدعم التجريب المتطور، إلا أن تكييف كود مستودع YOLOv7 على GitHub لبيئات الإنتاج المخصصة قد يستغرق وقتاً طويلاً.
تعمل YOLO11 على إعادة تعريف سهولة الاستخدام تماماً. فهي مدمجة بالكامل في منصة Ultralytics، وهي منظومة شاملة ومُصانة جيداً توفر سير عمل سلساً من البداية إلى النهاية. من تعليق البيانات والتدريب المحلي إلى النشر، تعمل واجهة برمجة تطبيقات Python الموحدة وواجهة سطر الأوامر البسيطة على تبسيط العملية برمتها.
مقارنة الكود#
يتطلب تدريب نموذج اكتشاف الكائنات باستخدام YOLO11 بضعة أسطر فقط من الكود، مما يقلل بشكل كبير من حاجز الدخول:
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly using the unified API
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Quickly export to ONNX format
model.export(format="onnx")في المقابل، يبدو أمر تدريب YOLOv7 المعتاد كما يلي، ويتطلب إعداداً دقيقاً للمسارات وملفات التكوين وscripts باش:
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'توفر YOLO11 أيضاً تنوعاً هائلاً. بينما تتطلب YOLOv7 قواعد أكواد مختلفة تماماً أو تعديلات كثيفة لدعم مهام تتجاوز الكشف (مثل الوضعية أو التجزئة)، تتعامل YOLO11 مع الكشف عن الكائنات، وتجزئة المثيلات، وتصنيف الصور، وتقدير الوضعية، والكشف عن مربعات الإحاطة الموجهة (OBB) عبر إطار عمل واحد متماسك.
تطبيقات العالم الحقيقي وحالات الاستخدام المثالية#
يعتمد الاختيار بين YOLOv7 و YOLO11 كلياً على نطاق المشروع وقيود النشر.
متى تفكر في YOLOv7:
- تقييم النماذج القديمة: قد يستخدم الباحثون الأكاديميون الذين يستكفون تصميمات مسار التدرج نموذج YOLOv7 كخط أساس لتقييم شبكات العصبونات التلافيفية الأحدث.
- خطوط الإنتاج المخصصة الحالية: الفرق التي تملك خطوط إنتاج مخصصة بشكل كبير بلغة C++ أو CUDA مبنية خصيصاً حول منطق فك تشفير مربعات الإحاطة الفريد الخاص بـ YOLOv7.
متى تختار YOLO11:
- الإنتاج التجاري: تستفيد التطبيقات في البيع بالتجزئة الذكي أو تشخيص الرعاية الصحية بشكل كبير من قاعدة كود YOLO11 المُصانة وثباتها العالي.
- البيئات المحدودة الموارد: تجعل البصمة خفيفة الوزن لـ YOLO11n ملائمة بشكل استثنائي للنشر على الأجهزة المحمولة والأجهزة الطرفية عبر ONNX.
- مشاريع المهام المتعددة: إذا كان تطبيق واحد يحتاج إلى تحديد شخص، ورسم هيكله العظمي (الوضع)، وتجزئة كائن يحمله، توفر YOLO11 حلاً موحداً.
الطليعة: المضي قدماً مع YOLO26#
بينما تظل YOLO11 خياراً قوياً للغاية، فإن الابتكار في الذكاء الاصطناعي لا يتوقف أبداً. بالنسبة للمهندسين الذين يبدؤون مشاريع جديدة اليوم، يُوصى بشدة باسترشاد Ultralytics YOLO26.
تُقدم YOLO26، التي أُصدرت في يناير 2026، تصميماً خالياً من NMS من البداية إلى النهاية، مما يلغي تماماً اختناقات زمن الوصول المرتبطة بمعالجة الكبح غير الأعظمي اللاحقة. علاوة على ذلك، تدمج YOLO26 مُحسِّن MuSGD Optimizer الثوري، المستوحى من منهجيات تدريب النماذج اللغوية الكبيرة، لضمان تقارب أسرع. ومع تحسينات الخسارة المستهدفة عبر ProgLoss + STAL وما يصل إلى 43% أسرع في الاستدلال على وحدة المعالجة المركزية (CPU) نظراً لإزالة DFL، فقد تم تحسين YOLO26 خصيصاً للحوسبة الطرفية وهي تمثل قمة ذكاء الرؤية الحالي.
للمستخدمين المهتمين بالهياكل البديلة المتخصصة، قد يؤدي استكشاف نموذج RT-DETR القائم على المُحوِّل (Transformer) أو نماذج YOLO-World الديناميكية المفتوحة المفردات إلى نتائج مفيدة أيضاً لنشر الرؤية الحاسوبية المتنوعة.