Ultralytics YOLO27:

YOLOv9 مقابل DAMO-YOLO#

أدى التطور السريع في مجال الرؤية الحاسوبية إلى ظهور مجموعة من البنى القوية المصممة لتلبية قيود النشر ومتطلبات الدقة المتنوعة. ومن بين النماذج البارزة في هذا المجال YOLOv9، المعروف بقدرته المتينة على التعامل مع اختناقات المعلومات، وDAMO-YOLO، الذي يركز بدرجة كبيرة على البحث في البنى العصبية (NAS) وأهرامات الميزات الفعالة.

يقدم هذا الدليل مقارنة تقنية متعمقة بين YOLOv9 وDAMO-YOLO، مع تسليط الضوء على اختلافاتهما المعمارية، ومنهجيات التدريب، وسيناريوهات النشر المثالية. وسنستكشف أيضًا كيف توفر منظومة Ultralytics مسارًا سلسًا من التطوير إلى الإنتاج، ولماذا أصبحت النماذج الحديثة مثل YOLO26 المعيار الموصى به للمشروعات الجديدة.

تحليل معماري متعمق#

يكشف فهم الآليات الأساسية التي تدفع كل نموذج عن سبب اختلاف أدائهما عبر المقاييس المختلفة.

YOLOv9: المعلومات القابلة للبرمجة للتدرجات#

صُمم YOLOv9 لمعالجة فقدان المعلومات الذي يحدث مباشرةً أثناء تدفق البيانات عبر الشبكات العصبية العميقة.

  • المؤلفان: Chien-Yao Wang، Hong-Yuan Mark Liao
  • الجهة: معهد علوم المعلومات، Academia Sinica، تايوان
  • التاريخ: 21 فبراير 2024
  • الروابط: Arxiv، GitHub، المستندات

تعرف على المزيد حول YOLOv9

يقدم YOLOv9 كلاً من معلومات التدرج القابلة للبرمجة (PGI) وشبكة تجميع الطبقات الفعالة المعممة (GELAN). تضمن PGI الاحتفاظ بالمعلومات المكانية والدلالية الحيوية أثناء عملية التمرير الأمامي، مما يمنع تدهور التدرجات المستخدمة لتحديث الأوزان. وتكمل GELAN ذلك من خلال زيادة كفاءة المعلمات إلى أقصى حد، ما يسمح للنموذج بتحقيق متوسط الدقة المتوسطة (mAP) المتقدم على مستوى النتائج الحديثة باستخدام عدد أقل من FLOPs مقارنةً بالعديد من شبكات CNN التقليدية.

DAMO-YOLO: كفاءة مدفوعة بالبحث في البنى العصبية (NAS)#

طوّرت Alibaba Group نموذج DAMO-YOLO، الذي يتبع نهجًا مختلفًا بالاستفادة من البحث الآلي في البنى للعثور على التوازن الأمثل بين السرعة والدقة.

  • المؤلفون: Xianzhe Xu، وYiqi Jiang، وWeihua Chen، وYilun Huang، وYuan Zhang، وXiuyu Sun
  • المنظمة: Alibaba Group
  • التاريخ: 23 نوفمبر 2022
  • الروابط: Arxiv، GitHub

تعرف على المزيد حول DAMO-YOLO

يعتمد DAMO-YOLO على هيكل بحث بنية الشبكة العصبية بالإنتروبيا القصوى (MAE-NAS) لتوليد هياكل شبكية فعالة تلقائياً. وهو يستخدم شبكة هرمية للميزات المعممة المُعاد صياغتها (RepGFPN) لدمج الميزات بشكل قوي وتصميم "ZeroHead" لتقليل عبء الحساب لرأس الكشف. بالإضافة إلى ذلك، فهو يدمج AlignedOTA لتخصيص التسميات وتقطير المعرفة تعزيزاً لأداء نسخه الأصغر.

دور البحث في البنى العصبية (NAS) في الرؤية الحاسوبية

يعمل البحث في البنى العصبية (NAS) على أتمتة تصميم الشبكات العصبية الاصطناعية. ورغم قدرته على إنتاج نماذج عالية الكفاءة مثل DAMO-YOLO، فإنه يتطلب غالبًا موارد حوسبة ضخمة للبحث في فضاء البنى، على خلاف فلسفة التصميم الأكثر حتمية لنماذج مثل YOLOv9.

مقارنة الأداء والمقاييس#

عند اختيار نموذج كشف الأجسام، من الضروري تحقيق توازن بين الدقة والسرعة والبصمة الحاسوبية.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

التحليل#

  • الدقة مقابل المعلمات: يُظهر YOLOv9 عمومًا نسبةً أفضل بين المعلمات والدقة. فعلى سبيل المثال، يحقق YOLOv9c نسبة 53.0% mAP باستخدام 25.3M من المعلمات، بينما يحقق DAMO-YOLOl نسبة 50.8% mAP لكنه يتطلب عددًا أكبر بكثير من المعلمات (42.1M).
  • سرعة الاستدلال: توفر بنية DAMO-YOLO سرعات استدلال تنافسية باستخدام TensorRT على وحدات معالجة الرسومات T4، متفوقةً بفارق طفيف على YOLOv9 في الفئات المتوسطة. ومع ذلك، تترجم كفاءة YOLOv9 في FLOPs وعدد المعلمات إلى كفاءة استثنائية في ذاكرة GPU.
  • متطلبات الذاكرة: تُظهر نماذج Ultralytics YOLO، بما في ذلك YOLOv9، عادةً استخدامًا أقل للذاكرة أثناء التدريب والاستدلال مقارنةً بالنماذج المعقدة المُولدة بواسطة NAS أو البنى الثقيلة القائمة على Transformer، مما يجعلها مناسبةً جدًا للنشر على الأجهزة الطرفية محدودة الموارد.

ميزة منظومة Ultralytics#

رغم أهمية المقاييس النظرية، فإن التنفيذ العملي يحدد نجاح المشروع بدرجة كبيرة. وهنا تتفوق منصة Ultralytics ومنظومتها البرمجية الشاملة على المستودعات المستقلة مثل DAMO-YOLO.

سهولة الاستخدام وكفاءة التدريب#

يتطلب تدريب نموذج YOLOv9 مخصص قدرًا ضئيلًا من التعليمات البرمجية التمهيدية. وتجرّد واجهة Python البرمجية لـ Ultralytics العمليات المعقدة مثل زيادة البيانات، والتدريب الموزع، وتحسين الأجهزة من تفاصيلها.

from ultralytics import YOLO

# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate model performance
metrics = model.val()

# Export for production deployment
model.export(format="onnx")

وعلى النقيض، يتطلب استخدام DAMO-YOLO غالبًا التعامل مع ملفات إعدادات جامدة وسلاسل تبعيات معقدة خاصة بخط أنابيب التدريب الفريد الخاص به، مما يؤدي إلى منحنى تعلم أكثر حدة.

تعدد الاستخدامات عبر المهام#

تُعد المرونة المتأصلة إحدى السمات المميزة لنماذج Ultralytics. فإلى جانب كشف مربعات الإحاطة التقليدي، يدعم إطار عمل Ultralytics بسلاسة مهام مثل تجزئة المثيلات، وتقدير الوضعية، وتصنيف الصور، وكشف مربع الإحاطة الموجّه (OBB). أما DAMO-YOLO فهو محسّن حصرًا لكشف الأجسام ثنائي الأبعاد، ويتطلب إعادة هندسة كبيرة للتكيف مع الأنماط البصرية الأخرى.

التصدير إلى الأجهزة الطرفية

تبسّط Ultralytics مسار النشر من خلال توفير تصدير النماذج بنقرة واحدة إلى تنسيقات مثل TensorRT، وOpenVINO، وCoreML، مما يضمن أقصى أداء بغض النظر عن الأجهزة المستهدفة.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv9 وDAMO-YOLO على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلاتك المتعلقة بالمنظومة.

متى تختار YOLOv9#

يُعد YOLOv9 خيارًا قويًا لـ:

  • أبحاث عنق الزجاجة المعلوماتي: المشاريع الأكاديمية التي تدرس معماريات المعلومات القابلة للبرمجة للتدرجات (PGI) وشبكة تجميع الطبقات الفعّالة المعمّمة (GELAN).
  • دراسات تحسين تدفق التدرجات: الأبحاث التي تركز على فهم فقدان المعلومات في طبقات الشبكات العميقة أثناء التدريب والحد منه.
  • قياس أداء اكتشاف عالي الدقة: السيناريوهات التي تحتاج إلى أداء YOLOv9 القوي في معيار COCO بوصفه نقطة مرجعية للمقارنات المعمارية.

متى تختار DAMO-YOLO#

يوصى باستخدام DAMO-YOLO في الحالات التالية:

  • تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو عالية FPS على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند حجم الدفعة 1 هي المقياس الأساسي.
  • خطوط التصنيع الصناعية: السيناريوهات ذات القيود الصارمة على زمن استجابة GPU ضمن عتاد مخصص، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
  • أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والشبكات الأساسية المعاد تمثيلها بكفاءة على أداء الاكتشاف.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

المستقبل: الانتقال إلى YOLO26#

رغم أن YOLOv9 وDAMO-YOLO يمثلان محطتين تاريخيتين قويتين، فقد تحولت الرؤية الحاسوبية الحديثة نحو البنى الأصلية المتكاملة من البداية إلى النهاية. وبالنسبة إلى أي تطوير جديد، يُعد YOLO26 المعيار الموصى به.

أُطلق YOLO26 في عام 2026، وهو يبني على نجاحات أسلافه، مقدمًا قفزةً في كل من الدقة وبساطة النشر.

أهم ابتكارات YOLO26#

  • تصميم متكامل من البداية إلى النهاية وخالٍ من NMS: يلغي YOLO26 المعالجة اللاحقة الخاصة بالكبت غير الأقصى (NMS) بالكامل. وينشئ ذلك مسار نشر مبسطًا ومتكاملًا من البداية إلى النهاية، وهو إنجاز رائد ظهر للمرة الأولى في YOLOv10.
  • إزالة DFL: أُزيلت خسارة البؤرة للتوزيع لتبسيط التصدير وتحسين التوافق مع الأجهزة الطرفية ومنخفضة الطاقة.
  • استدلال على CPU أسرع بنسبة تصل إلى 43%: من خلال إزالة المعالجة اللاحقة المعقدة وتحسين الالتفافات الأساسية، يلائم YOLO26 بشكل فريد سيناريوهات الحوسبة الطرفية التي تفتقر إلى وحدات معالجة رسومات مخصصة.
  • مُحسِّن MuSGD: مستلهمًا من ابتكارات تدريب نماذج اللغة الكبيرة، يستخدم YOLO26 مزيجًا هجينًا من SGD وMuon (MuSGD) لضمان عمليات تدريب أكثر استقرارًا وأزمنة تقارب أسرع بوضوح.
  • ProgLoss + STAL: توفر دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرف على الأجسام الصغيرة، مما يجعل YOLO26 مثاليًا للصور الجوية الملتقطة من ارتفاعات عالية ولأجهزة إنترنت الأشياء.

إذا كنت تبحث حاليًا في YOLO11 أو YOLOv8 لمشروعك القادم، فإن الترقية إلى YOLO26 تضمن استخدامك لإطار عمل الذكاء الاصطناعي للرؤية الأكثر تحسينًا وتقدمًا والمتاح اليوم.

الملخص#

يعتمد اختيار النموذج المناسب على قيودك التشغيلية المحددة:

  • DAMO-YOLO يقدم لمحةً مثيرة للاهتمام عن التحسين المدفوع بالبحث في البنى العصبية (NAS)، إذ يوفر سرعات تنافسية لملفات تعريف أجهزة محددة جدًا تتألق فيها بنية RepGFPN الخاصة به.
  • YOLOv9 خيار ممتاز للباحثين الذين يركزون على الاحتفاظ بالتفاصيل البصرية الدقيقة، مستفيدين من بنية PGI لمنع فقدان المعلومات في الشبكات العميقة.
  • Ultralytics YOLO26 هو الخيار الحاسم لتطبيقات المؤسسات والبحوث الحديثة. فسهولة استخدامه التي لا مثيل لها، وبنيته الخالية من NMS، وتحسينات التدريب المتطورة القائمة على MuSGD، تجعله النموذج الأكثر موثوقية ودقةً وسهولةً في النشر ضمن مشهد الرؤية الحاسوبية.

التعليقات