Ultralytics YOLO27:

YOLOv9 مقابل YOLOv7#

قاد التطور في اكتشاف الأجسام في الوقت الفعلي سعيٌ متواصل لتحقيق التوازن بين الكفاءة الحاسوبية والدقة العالية. ومن أبرز البنى المعمارية في هذه المسيرة YOLOv9 وYOLOv7، وقد طوّرهما باحثون في معهد علوم المعلومات التابع لأكاديمية سينكا في تايوان. وبينما قدّم YOLOv7 مفهوم حقيبة المزايا القابلة للتدريب، يتصدى YOLOv9 الأحدث مباشرةً لاختناقات المعلومات في التعلم العميق.

تستكشف هذه المقارنة التقنية الشاملة الفروق المعمارية، ومقاييس الأداء، وسيناريوهات النشر المثالية لكلا النموذجين، مما يساعد مهندسي التعلم الآلي والباحثين على اختيار الأداة المناسبة لمسارات عمل الرؤية الحاسوبية لديهم.

مقارنة الأداء والمقاييس#

عند مقارنة هذين النموذجين، يُعد الأداء الخام والكفاءة عاملين حاسمين. يوضح الجدول التالي متوسط الدقة (mAP) والمتطلبات الحاسوبية للمعايير المرجعية القياسية لمجموعة بيانات COCO.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
موازنة الأداء

لاحظ أن YOLOv9c يحقق دقة مماثلة تقريبًا (53.0 mAP) لدقة YOLOv7x (53.1 mAP)، مع استخدام عدد أقل بكثير من المعلمات (25.3M مقابل 71.3M) وFLOPs. ويوضح ذلك التحسينات في توازن الأداء ضمن البنى المعمارية الحديثة.

YOLOv9: حل اختناق المعلومات#

طُرح YOLOv9 في أوائل عام 2024، وأحدث تغييرًا جوهريًا في طريقة احتفاظ الشبكات العصبية العميقة بالبيانات عبر طبقاتها.

ابتكارات البنية المعمارية#

يقدّم YOLOv9 شبكة تجميع الطبقات الفعّالة المعمّمة (GELAN) ومعلومات التدرج القابلة للبرمجة (PGI). تجمع GELAN بين مزايا CSPNet وELAN لتحسين كفاءة المعلمات والتكلفة الحاسوبية، بما يضمن دقة عالية مع عدد أقل من المعلمات. أما PGI فهي إطار إشراف مساعد مصمم لمنع فقدان البيانات في الشبكات العميقة، إذ يولّد تدرجات موثوقة لتحديث الأوزان أثناء عملية التدريب.

نقاط القوة والقيود#

تتمثل نقطة القوة الرئيسية في YOLOv9 في قدرته على استخراج السمات الدقيقة دون عبء حاسوبي هائل، مما يجعله مناسبًا للغاية للمهام التي تتطلب وفاءً عاليًا بالسمات، مثل تحليل الصور الطبية. إلا أن بنية PGI المعقدة أثناء التدريب قد تجعل التعديلات المعمارية المخصصة أكثر صعوبة على المبتدئين مقارنةً بالأطر الأكثر توحيدًا.

تعرّف على المزيد حول YOLOv9

YOLOv7: رائد حقيبة المزايا#

أُطلق YOLOv7 في عام 2022، ووضع معيارًا جديدًا لما يمكن تحقيقه على العتاد الاستهلاكي، إذ قدّم ابتكارات بنيوية عززت سرعات الاستدلال في الوقت الفعلي بدرجة كبيرة.

ابتكارات البنية المعمارية#

تتمثل المساهمة الأساسية لـYOLOv7 في شبكة تجميع الطبقات الفعّالة الموسّعة (E-ELAN). وتمكّن هذه البنية النموذج من تعلم سمات أكثر تنوعًا باستمرار. بالإضافة إلى ذلك، يستخدم YOLOv7 «حقيبة مزايا قابلة للتدريب»—وهي تقنيات مثل الالتفافات المعاد تحديد معلماتها المخططة وإسناد التسميات الديناميكي. وتحسّن هذه الأساليب دقة النموذج أثناء التدريب من دون إضافة تكاليف للاستدلال أثناء النشر.

نقاط القوة والقيود#

جرى تحسين YOLOv7 بدرجة كبيرة لمعالجة الحافة في الوقت الفعلي، ولا يزال عنصرًا أساسيًا في الأنظمة القديمة وبيئات CUDA الأقدم. ويتمثل قيده الرئيسي حاليًا في كِبَر حجم معلماته مقارنةً بالنماذج الأحدث. وكما يوضح جدول الأداء، يتطلب تحقيق دقة من المستوى الأعلى استخدام نموذج YOLOv7x الثقيل، الذي يحتاج إلى قدر أكبر بكثير من ذاكرة GPU مقارنةً بالبنى المعمارية الحديثة المماثلة.

تعرّف على المزيد حول YOLOv7

ميزة Ultralytics: نشر مبسّط#

على الرغم من أن مستودعات الأبحاث الأصلية لـYOLOv9 وYOLOv7 توفر أسسًا أكاديمية ممتازة، فإن نشر هذين النموذجين في بيئات الإنتاج قد يكون معقدًا. ويوفر دمجهما عبر حزمة ultralytics سهولة استخدام لا مثيل لها.

من خلال الاستفادة من منصة Ultralytics المتكاملة، يستفيد المطورون من منظومة تتم صيانتها جيدًا، وتضم واجهة API سهلة الاستخدام لـPython، ودعمًا نشطًا من المجتمع، وتتبعًا متينًا للتجارب.

استشراف المستقبل مع YOLO26#

إذا كنت تبدأ مشروعًا جديدًا في الرؤية الحاسوبية، فنحن نوصي بشدة باستكشاف YOLO26 المطروح حديثًا بدلًا من YOLOv9 وYOLOv7. وقد طُرح YOLO26 بوصفه المعيار الجديد المتطور، وهو يقدم تطورات رائدة:

  • تصميم شامل من البداية إلى النهاية وخالٍ من NMS: يلغي المعالجة اللاحقة لقمع القيم غير العظمى، مما يقلل بدرجة كبيرة من تعقيد النشر وزمن الاستجابة.
  • استدلال على CPU أسرع بنسبة تصل إلى 43%: مُحسّن لبيئات الحوسبة الطرفية، بما يضمن تشغيل تطبيقك بسلاسة حتى من دون وحدات GPU مخصصة.
  • مُحسِّن MuSGD: مُحسِّن هجين مستوحى من تدريب LLM، يوفر تقاربًا مستقرًا للغاية ويقلل وقت التدريب.
  • إزالة DFL: تبسّط تصدير النموذج من خلال إزالة Distribution Focal Loss، مما يعزز التوافق مع الأجهزة المحمولة منخفضة الطاقة.
  • ProgLoss + STAL: يحسّن الأداء بدرجة كبيرة في اكتشاف الأجسام الصغيرة، مما يجعله الخيار الأول لـالصور الجوية والمراقبة.

تشمل البدائل الشائعة الأخرى ضمن المنظومة Ultralytics YOLOv8 وYOLO11، وكلاهما يوفر مرونة هائلة عبر مهام مثل تقسيم المثيلات وتقدير الوضعيات.

مثال على التنفيذ#

يُعد تدريب أي من هذه البنى المعمارية وتصديره أمرًا بالغ السهولة باستخدام واجهة API الموحدة. ويوضح الكود أدناه سمة كفاءة التدريب المميزة لأدوات Ultralytics.

from ultralytics import YOLO

# Initialize YOLOv9 or the recommended YOLO26 model
model = YOLO("yolov9c.pt")  # Swap with "yolo26n.pt" for faster edge performance

# Train on a custom dataset with built-in data augmentation
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)

# Export the trained model to ONNX format for deployment
model.export(format="onnx")
متطلبات الذاكرة

عند التدريب على عتاد استهلاكي، تُعد كفاءة الذاكرة أمرًا بالغ الأهمية. وقد جرى تحسين تطبيقات Ultralytics لـYOLOv9 وYOLO26 بدرجة كبيرة للحد من ارتفاعات VRAM المفاجئة، بخلاف النماذج القائمة على Transformer (مثل RT-DETR) التي غالبًا ما تعاني من تضخم حاد في الذاكرة أثناء التدريب.

التطبيقات الواقعية وحالات الاستخدام المثالية#

غالبًا ما يتوقف الاختيار بين هذه البنى المعمارية على القيود المحددة لبيئة الإنتاج لديك.

متى تستخدم YOLOv9: يتفوق YOLOv9 في البيئات التي يكون فيها الاحتفاظ بالتفاصيل الدقيقة أمرًا ضروريًا. ويجعل استخراج السمات المتين فيه خيارًا مثاليًا لـتحليلات البيع بالتجزئة لعدّ المنتجات المتراصة بكثافة على الرفوف، أو للتطبيقات الزراعية التي يكون فيها تحديد أمراض المحاصيل في مراحلها المبكرة على الأوراق الصغيرة أمرًا حاسمًا.

متى تستخدم YOLOv7: لا يزال YOLOv7 مرشحًا قويًا لمسارات النشر القديمة. فإذا كنت تدمجه في أنظمة عتاد أقدم، مثل بعض أجيال Google Coral Edge TPU، فقد تكون بنية CNN المباشرة في YOLOv7 أسهل في التجميع من فروع التدرج الأكثر تعقيدًا في النماذج الأحدث.

متى تستخدم YOLO26 (موصى به): بالنسبة إلى أي عملية نشر حديثة—من الطائرات المسيّرة ذاتية القيادة إلى إدارة حركة المرور في المدن الذكية—يُعد YOLO26 الخيار الأفضل. وتضمن بنيته الخالية من NMS أزمنة استدلال حتمية، وهو أمر أساسي للروبوتات ذات المتطلبات الحرجة للسلامة، بينما تتفوق دقته على YOLOv9 وYOLOv7 في جميع المجالات.

التعليقات