Ultralytics YOLO27:

مقارنة بين YOLOv5 وYOLOv9#

شهد مجال الرؤية الحاسوبية واكتشاف الأجسام في الوقت الفعلي تطورات ملحوظة خلال السنوات القليلة الماضية. ويُعدّ الاختيار بين النماذج الراسخة والمختبرة ميدانيًا وبنى الأبحاث الأحدث تحديًا شائعًا لمهندسي تعلّم الآلة. يقدم هذا الدليل مقارنة تقنية شاملة بين نموذجين بالغَي التأثير ضمن عائلة YOLO: YOLOv5 وYOLOv9.

سواء كنت تنشر على أجهزة طرفية محدودة الموارد، أو تجري أبحاثًا حول استخراج السمات عالية الدقة، أو تبني مسارات عمل معقدة لـاكتشاف الأجسام، فإن فهم الفروق الدقيقة في بنية هذه النماذج ومقاييس أدائها والاختلافات بين منظوماتها أمر بالغ الأهمية.

نظرة عامة على النماذج#

قبل التعمق في المقارنات المعمارية، من المفيد فهم أصول كل نموذج وأهدافه الأساسية.

Ultralytics YOLOv5#

طوّر Glenn Jocher نموذج YOLOv5، وأصدرته Ultralytics في 26 يونيو 2020، ليُحدث تحولًا جذريًا في طريقة تفاعل المطورين مع نماذج الرؤية. ومن خلال اعتماده الكامل على إطار عمل PyTorch، استبدل YOLOv5 خطوات الترجمة المعقدة للنماذج السابقة القائمة على Darknet بتجربة استخدام بديهية تضع Python في المقام الأول.

يشتهر YOLOv5 بسهولة الاستخدام وأدائه المستقر عبر بيئات الأجهزة المتنوعة. وهو لا يدعم الاكتشاف فحسب، بل يدعم أيضًا تصنيف الصور وتقسيم الكائنات.

YOLOv9#

قدّم Chien-Yao Wang وHong-Yuan Mark Liao من معهد علوم المعلومات في Academia Sinica بتايوان نموذج YOLOv9، الذي يركز بدرجة كبيرة على النظرية المعمارية للتخفيف من مشكلات عنق الزجاجة المعلوماتي في الشبكات العصبية العميقة.

  • المؤلفون: Chien-Yao Wang وHong-Yuan Mark Liao
  • الجهة: معهد علوم المعلومات، Academia Sinica، تايوان
  • التاريخ: 2024-02-21
  • Arxiv: 2402.13616
  • GitHub: مستودع YOLOv9
  • الوثائق: وثائق YOLOv9

يعتمد جوهر YOLOv9 على ابتكارين نظريين رئيسيين: معلومات التدرج القابلة للبرمجة (PGI) وشبكة تجميع الطبقات الفعّالة المعممة (GELAN). وتساعد هذه المفاهيم النموذج على الاحتفاظ بالسمات المكانية المهمة عبر طبقات الشبكة العميقة.

تعرف على المزيد حول YOLOv9

حصّن عمليات النشر لديك للمستقبل

على الرغم من قوة YOLOv5 وYOLOv9، فإن YOLO26 المُصدر حديثًا يمثل التوازن الأمثل بين السرعة والدقة. وبفضل تصميمه الشامل الخالي من NMS وسرعة استدلال على CPU أعلى بنسبة تصل إلى 43%، يُوصى بـYOLO26 بشدة للحوسبة الطرفية الحديثة وعمليات النشر الإنتاجية.

الفروق المعمارية والتقنية#

يُعد فهم ما يشغّل نماذج الرؤية هذه من الداخل أمرًا بالغ الأهمية لتحسين استراتيجيات نشر النماذج.

استخراج السمات والاحتفاظ بالمعلومات#

يستخدم YOLOv5 عمودًا فقريًا من نوع شبكة الجزء المتقاطع (CSPNet)، ما يقلل بفاعلية من عبء الحسابات مع الحفاظ على تدفق تدرجات دقيق أثناء الانتشار العكسي. وقد حُسّن هذا التصميم بدرجة كبيرة لعمليات GPU التقليدية، ويضمن متطلبات ذاكرة أقل أثناء التدريب مقارنة ببدائل Transformer الثقيلة.

يقدم YOLOv9 بنية GELAN، وهي بنية عامة توسّع مبادئ CSPNet. وبالاقتران مع PGI — وهو فرع مساعد قابل للعكس — يضمن YOLOv9 عدم فقدان الطبقات العميقة للبيانات الدلالية اللازمة لدوال الهدف الدقيقة. ويتيح ذلك لـYOLOv9 تحقيق دقة عالية، ولا سيما على الأجسام الصغيرة، مع أن التفريع المساعد المعقد قد يعقّد أحيانًا مسارات التصدير إلى الأجهزة الطرفية شديدة التقييد.

متطلبات الذاكرة وكفاءة التدريب#

عندما يتعلق الأمر بكفاءة التدريب، يظل YOLOv5 متينًا للغاية. وتضمن منظومة Ultralytics جيدة الصيانة استهلاك نماذج YOLOv5 قدرًا أقل بكثير من ذاكرة CUDA، ما يتيح للباحثين زيادة أحجام الدُفعات إلى أقصى حد على وحدات GPU المخصصة للمستهلكين. وعلى الرغم من أن YOLOv9 يحقق كفاءة ممتازة في عدد المعلمات (دقة عالية مقارنة بحجمه)، فإن عملية تدريبه قد تتطلب موارد أكثر إذا لم تُستخدم أطر عمل محسّنة. ولحسن الحظ، يؤدي دمج YOLOv9 في API الخاصة بـUltralytics إلى تقليص الفجوة بينه وبين إدارة الموارد الانسيابية في YOLOv5.

الأداء والمقاييس#

لتقييم هذه البنى تقييمًا موضوعيًا، نقارن أداءها على مجموعات بيانات قياسية مثل COCO. ويعرض ما يلي تفصيلًا لمقاييس مثل mAP (متوسط الدقة)، وسرعة الاستدلال، وأعداد المعلمات.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

كما يوضح الجدول، يحقق YOLOv9 دقة خام أعلى ضمن المستويات المتكافئة، ما يعكس بنيته الأحدث. ومع ذلك، يحافظ YOLOv5n على زمن استجابة منخفض للغاية يبلغ 1.12ms في TensorRT، ما يبرز قوته المستمرة في تطبيقات الحوسبة الطرفية المحلية عالية السرعة.

منهجيات التدريب وسهولة الاستخدام#

تكمن الميزة الحقيقية للاستفادة من الرؤية الحاسوبية اليوم في سهولة الوصول إلى سلسلة الأدوات.

ميزة Ultralytics#

على الرغم من أن مستودعات الأبحاث الأصلية لنماذج مثل YOLOv9 تشكل أساسًا مهمًا، فإنها غالبًا ما تأتي مع مصفوفات تبعيات معقدة ونصوص برمجية نمطية. وتجرّد واجهة Python البرمجية لـUltralytics هذه التعقيدات بالكامل. وبفضل منظومة Ultralytics، يمكنك تدريب YOLOv5 وYOLOv9 وتقييمهما وتصديرهما باستخدام بنية موحّدة متطابقة.

from ultralytics import YOLO

# Load a pre-trained YOLOv5 model for fast deployment
model_v5 = YOLO("yolov5s.pt")

# Or leverage a YOLOv9 model for high-fidelity accuracy
model_v9 = YOLO("yolov9c.pt")

# Train seamlessly on custom data with automatic MLflow logging
results = model_v9.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export the trained model to ONNX
model_v9.export(format="onnx")

يوفر نهج API الواحد هذا مرونة هائلة، إذ لا يدعم الاكتشاف فحسب، بل يدعم أيضًا تقدير الوضعيات والمربعات المحيطة الموجّهة (OBB)، وذلك بحسب النموذج المختار. علاوة على ذلك، أُدمجت مباشرةً في حلقة التدريب تكاملات قوية مع أدوات مثل Comet ML وWeights & Biases.

حالات الاستخدام المثالية والتطبيقات الواقعية#

يعتمد الاختيار بين هذه البنى إلى حد كبير على قيود أجهزتك والدقة التي يتطلبها مجال تطبيقك.

متى تختار YOLOv5#

YOLOv5 نموذج مخضرم ومختبر ميدانيًا، ويتألق في عمليات النشر التي تعطي الأولوية للاستقرار، وبصمة الذاكرة المنخفضة، والتوافق الواسع للغاية مع التصدير.

  • عمليات النشر على الأجهزة المحمولة: يُعد تصدير YOLOv5 إلى TFLite أو CoreML للاستدلال على الجهاز في الهواتف الذكية القديمة أمرًا سلسًا للغاية.
  • الأجهزة الطرفية القديمة: بالنسبة إلى أجهزة مثل Raspberry Pi أو NVIDIA Jetson Nano من الأجيال الأولى، تضمن الالتفافات المباشرة في YOLOv5 معدلات إطارات ثابتة لتطبيقات مثل إدارة مواقف السيارات الذكية.
  • النمذجة الأولية السريعة: إن التوفر الواسع للدروس التعليمية التي يقدمها المجتمع، والأوزان المدربة مسبقًا المخصصة، والتوافق الكبير مع مجموعات البيانات، يجعل YOLOv5 أسرع طريقة للتحقق من جدوى نموذج أولي.

متى تختار YOLOv9#

يُعد YOLOv9 مثاليًا للسيناريوهات التي يكون فيها التقاط التفاصيل المعقدة وتقليل السلبيات الكاذبة أمرًا بالغ الأهمية، حتى إذا تطلب ذلك عبئًا حسابيًا أكبر قليلًا.

  • الصور الجوية وصور الأقمار الصناعية: يتميز إطار PGI بقدرة كبيرة على الحفاظ على دقة الأجسام الصغيرة، ما يجعل YOLOv9 ممتازًا لـمراقبة المحاصيل الزراعية المعتمدة على الطائرات المسيّرة.
  • تشخيص الصور الطبية: عند اكتشاف الحالات الشاذة أو الآفات الدقيقة في عمليات المسح عالية الدقة، يوفر تدفق التدرجات الدقيق في GELAN أفضلية ضرورية في الاسترجاع.
  • تحليلات تجارة التجزئة المتقدمة: تستفيد عملية تتبع المنتجات المتداخلة على الرفوف المكتظة بدرجة كبيرة من قدرات YOLOv9 المتفوقة على الاحتفاظ بالسمات.

وسّع آفاقك#

على الرغم من أن مقارنة YOLOv5 وYOLOv9 تقدم رؤية واضحة لكيفية تطور البنى من عام 2020 إلى عام 2024، فإن مجال الذكاء الاصطناعي يتحرك بوتيرة أسرع من أي وقت مضى. ويُشجَّع المطورون الذين يسعون إلى بلوغ أقصى حدود الأداء على استكشاف أحدث نماذج YOLO26. ومن خلال استبدال كبت غير الأقصى التقليدي بتصميم شامل خالٍ من NMS أصلي، واستخدام مُحسِّن MuSGD المتقدم، يردم YOLO26 الفجوة بين دقة مستوى الأبحاث وسرعة مستوى الإنتاج. وبفضل إزالة DFL (إزالة خسارة التركيز التوزيعية لتبسيط التصدير وتحسين التوافق مع الأجهزة الطرفية والأجهزة منخفضة الطاقة)، يحقق YOLO26 استدلالًا على CPU أسرع بنسبة تصل إلى 43%، ما يجعله مثاليًا للحوسبة الطرفية. بالإضافة إلى ذلك، يوفر ProgLoss + STAL دوال خسارة محسّنة مع تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لإنترنت الأشياء والروبوتات والصور الجوية.

قد يهمك أيضًا مقارنة هذه البنى بنماذج أخرى متطورة مثل RT-DETR أو YOLO11 عالي القدرات. ويضمن استخدام إطار Ultralytics الموحّد بقاء مسار التطوير لديك نظيفًا وفعالًا وقابلًا للتوسع، بصرف النظر عن النموذج الذي تختاره.

التعليقات