YOLO11 مقابل YOLOv10#
يشهد مجال الرؤية الحاسوبية في الوقت الفعلي تطورًا مستمرًا، إذ تدفع البنى الجديدة حدود ما هو ممكن على كلٍّ من الأجهزة الطرفية والبنية التحتية السحابية. في هذا التحليل التقني المفصل، نستكشف الفروق الدقيقة بين نموذجين محوريين في هذا المجال: Ultralytics YOLO11 وYOLOv10. ويمثل كلاهما قفزات مهمة في قدرات كشف الأجسام، إلا أنهما يتبنيان فلسفتين معماريتين مختلفتين جوهريًا لتحقيق أدائهما.
تفكيك بنية YOLO11#
تفاصيل YOLO11:
- المؤلفان: Glenn Jocher وJing Qiu
- المنظمة: Ultralytics
- التاريخ: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- التوثيق: https://docs.ultralytics.com/models/yolo11
قُدِّم YOLO11 بوصفه نموذجًا قويًا ومتعدد الاستخدامات، إذ يبني على سنوات من الأبحاث الأساسية في الرؤية الحاسوبية والذكاء الاصطناعي. وتتمحور فلسفة التصميم الأساسية لـ YOLO11 حول ثراء الميزات والمرونة العالية عبر مهام الرؤية الحاسوبية المتعددة.
من أبرز التحسينات في YOLO11 تطبيق كتلة C3k2. تعمل وحدة عنق الزجاجة المحسّنة هذه على تحسين تدفق التدرجات عبر الشبكة، مما يزيد كفاءة المعلمات بدرجة كبيرة مع الحفاظ على الدقة العالية. بالإضافة إلى ذلك، يستخدم YOLO11 آلية محسّنة للانتباه المكاني، وهي بالغة الأهمية لتحديد العناصر الصغيرة أو المحجوبة جزئيًا. وهذا يجعله خيارًا استثنائيًا لـحالات استخدام الصور الجوية وتحليل الصور الطبية التفصيلي.
يستخدم YOLO11 تصميمًا خاليًا من المراسي يقلل من تعقيد ضبط المعلمات الفائقة، مما يتيح تعميمًا قويًا عبر مجموعة واسعة من مجموعات البيانات المخصصة. علاوة على ذلك، تكون متطلبات الذاكرة أثناء التدريب أقل بكثير مقارنةً بالبنى المعتمدة على Transformer، مما يتيح للباحثين تدريب النماذج الكبيرة بكفاءة على الأجهزة المعتادة للمستهلكين.
استكشاف بنية YOLOv10#
تفاصيل YOLOv10:
- المؤلفون: Ao Wang، Hui Chen، Lihao Liu، وآخرون.
- الجهة: جامعة تسينغهوا
- التاريخ: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
- التوثيق: https://docs.ultralytics.com/models/yolov10
طوّر باحثون في جامعة تسينغهوا YOLOv10، الذي برز بوصفه رائدًا شاملًا من البداية إلى النهاية ضمن عائلة YOLO. وتتمثل السمة المميزة لـ YOLOv10 في منهجية التدريب الخالي من NMS. فمن خلال استخدام تعيينات مزدوجة متسقة أثناء مرحلة التدريب، يتنبأ النموذج طبيعيًا بمربع إحاطة واحد بالضبط لكل جسم. ويلغي هذا الاختراق تمامًا الحاجة إلى قمع غير القيم العظمى (NMS) أثناء الاستدلال، وهي خطوة معالجة لاحقة كانت تُدخل تاريخيًا اختناقات في زمن الاستجابة ضمن مسارات نشر النماذج.
تقدم البنية أيضًا استراتيجية شاملة للتصميم توازن بين الكفاءة والدقة. فهي تدمج أخذ عينات تنازليًا مفصولًا مكانيًا وقنويًا، وتصميمات كتل موجهة بالرتبة تقلل التكرار انتقائيًا في مراحل الشبكة. وينتج عن ذلك عدد أقل من العمليات العائمة ونفقات حسابية منخفضة، من دون التضحية بدرجة كبيرة بـمتوسط الدقة. وفي التطبيقات الآنية التي تحظى فيها كل ميلي ثانية بأهمية، تؤدي إزالة NMS إلى رسم بياني حتمي للاستدلال، ملائم للغاية لـأجهزة الذكاء الاصطناعي الطرفية.
مقاييس الأداء والمعايير المرجعية#
عند تقييم هذين النموذجين، نبحث في التوازن بين الدقة وعدد المعلمات والسرعة. يوضح الجدول التالي كيفية مقارنتهما عبر مقاييس مختلفة ضمن مجموعة بيانات COCO.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
كما يتضح من مقاييس أداء YOLO، يحقق YOLO11 عمومًا درجات mAP أعلى قليلًا عبر إصداراته، ولا سيما في النماذج الأكبر. ويضمن التصميم الخالي من NMS في YOLOv10 أزمنة استدلال مستقرة للغاية من البداية إلى النهاية، إلا أن YOLO11 لا يزال يحقق معدل معالجة استثنائيًا عند تحسينه باستخدام TensorRT على عتاد NVIDIA.
عند إعداد نماذجك للنشر، يُعد تصديرها إلى تنسيقات محسّنة أمرًا بالغ الأهمية. يمكن تصدير كلٍّ من YOLO11 وYOLOv10 بسلاسة إلى تنسيقات مثل ONNX وTensorRT باستخدام إطار عمل Ultralytics. راجع دليلنا حول خيارات نشر النماذج للاطلاع على التعليمات خطوة بخطوة.
ميزة منظومة Ultralytics#
رغم أهمية مقاييس الأداء المستقلة، فإن إطار العمل المحيط يحدد النجاح العملي لمشروع التعلم الآلي. وهنا يتألق YOLO11 حقًا، بصفته مكوّنًا أصليًا في منظومة Ultralytics.
توفر منصة Ultralytics تجربة مستخدم مبسطة للغاية. وباستخدام واجهة Python البرمجية الموحدة والبسيطة، يمكن للمطورين التعامل مع مهام تتجاوز مربعات الإحاطة الأساسية. ويدعم YOLO11 أصليًا تقسيم الكائنات، وتقدير الوضعيات، وتصنيف الصور، وكشف مربع الإحاطة الموجّه (OBB) مباشرةً. وغالبًا ما تفتقر مستودعات الأبحاث المتخصصة إلى هذا القدر الكبير من المرونة.
علاوة على ذلك، تدعم المنظومة وثائق واسعة ومساندة نشطة من المجتمع. وقد أُدمجت مباشرةً في المكتبة تكاملات مع أدوات مثل Weights & Biases لتتبع التجارب، وOpenVINO لتحسين الأداء على عتاد Intel. ويتطلب تدريب النموذج حدًا أدنى من التعليمات البرمجية التمهيدية، ويستفيد من عمليات تدريب عالية الكفاءة تتطلب ذاكرة CUDA أقل من نماذج Transformer الثقيلة مثل RT-DETR.
مثال عملي على التعليمات البرمجية#
صُمم التدريب وإجراء الاستدلال باستخدام Ultralytics ليكونا بديهيين قدر الإمكان. وتتولى الواجهة البرمجية نفسها التعامل بسهولة مع كلٍّ من YOLO11 وYOLOv10.
from ultralytics import YOLO
# Initialize the model (YOLO11n or YOLOv10n)
model = YOLO("yolo11n.pt")
# Train the model efficiently on a custom dataset
# Ultralytics automatically handles hyperparameters and memory optimization
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Run inference on an image
inference_results = model("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
inference_results[0].show()حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLO11 وYOLOv10 على متطلبات مشروعك الخاصة، وقيود النشر، وتفضيلاتك المتعلقة بالمنظومة.
متى تختار YOLO11#
يُعد YOLO11 خيارًا قويًا لـ:
- النشر الطرفي في بيئات الإنتاج: التطبيقات التجارية على أجهزة مثل Raspberry Pi أو NVIDIA Jetson، حيث تمثل الموثوقية والصيانة النشطة أولوية قصوى.
- تطبيقات الرؤية متعددة المهام: المشاريع التي تتطلب الكشف، والتقسيم، وتقدير الوضعيات، وOBB ضمن إطار عمل موحد واحد.
- إنشاء النماذج الأولية والنشر بسرعة: الفرق التي تحتاج إلى الانتقال سريعًا من جمع البيانات إلى الإنتاج باستخدام واجهة Ultralytics Python البرمجية المبسطة.
متى تختار YOLOv10#
يوصى باستخدام YOLOv10 من أجل:
- الاكتشاف في الوقت الفعلي الخالي من NMS: التطبيقات التي تستفيد من الاكتشاف من الطرف إلى الطرف دون كبت القيم غير العظمى، ما يقلل تعقيد النشر.
- المفاضلة المتوازنة بين السرعة والدقة: المشاريع التي تتطلب توازنًا قويًا بين سرعة الاستدلال ودقة الاكتشاف عبر مقاييس نماذج مختلفة.
- التطبيقات ذات زمن الانتقال المتسق: سيناريوهات النشر التي تكون فيها أزمنة الاستدلال المتوقعة أمرًا بالغ الأهمية، مثل الروبوتات أو الأنظمة الذاتية.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
الجيل التالي: YOLO26#
في حين قدّم YOLOv10 النموذج الثوري الخالي من NMS، وأتقن YOLO11 المرونة متعددة المهام، فإن مجال الذكاء الاصطناعي يتطور بسرعة. ونوصي بشدة المطورين الذين يبدؤون عمليات نشر إنتاجية جديدة اليوم باستكشاف Ultralytics YOLO26.
أُصدر YOLO26 في يناير 2026، ويجمع أفضل ما في العالمين. فهو يتبنى أصليًا تصميمًا خاليًا من NMS من البداية إلى النهاية، الذي ابتكره YOLOv10، مما يبسط مسار النشر بدرجة كبيرة ويضمن زمن استجابة متسقًا. علاوة على ذلك، يدمج YOLO26 تحسينات متخصصة للحوسبة الطرفية. ومن خلال تنفيذ إزالة DFL (إزالة خسارة البؤرة التوزيعية)، تضمن البنية قابلية تصدير أسهل وتحقق استدلالًا أسرع لوحدة المعالجة المركزية بنسبة تصل إلى 43% مقارنةً بالنماذج القديمة، مما يجعلها الخيار الأمثل لأجهزة إنترنت الأشياء منخفضة الطاقة وتطبيقات الأجهزة المحمولة.
يضيف YOLO26 أيضًا استقرار تدريب نموذج اللغة الكبير (LLM) إلى الرؤية الحاسوبية عبر مُحسِّن MuSGD المبتكر، وهو مُحسِّن هجين مستوحى من أحدث أبحاث الذكاء الاصطناعي. وبالاقتران مع دوال الخسارة ProgLoss + STAL، يقدم YOLO26 دقة لا مثيل لها على الأجسام الصغيرة، وهو أمر ضروري لـكشف حركة المرور في الفيديو بالتفصيل وأتمتة الروبوتات المعقدة.
الخلاصة#
يعتمد اختيار نموذج الرؤية المناسب على قيودك التشغيلية الخاصة. ويمثل YOLOv10 محطة مهمة في الأوساط الأكاديمية، إذ أثبت إمكانية إزالة NMS بفعالية من مسار الكشف. ومع ذلك، يوفر YOLO11 حلًا قويًا جاهزًا للمؤسسات لتحقيق توازن أفضل بين الأداء، وتعدد المهام الشامل، وأدوات النشر السلسة.
بالنسبة إلى المهندسين الذين يريدون أحدث ما توصلت إليه التقنيات — مع الجمع بين البساطة من البداية إلى النهاية والأداء الطرفي فائق السرعة — فإن الانتقال إلى YOLO26 الأحدث هو التوصية المثلى. ومن خلال الاستفادة من منصة Ultralytics الشاملة، تضمن بناء مشاريعك على أساس مُصان جيدًا وعالي الكفاءة ومهيأ للمستقبل.