Ultralytics YOLO27:

DAMO-YOLO مقابل YOLOv7#

أدى التطور السريع في مجال الرؤية الحاسوبية إلى إنتاج نماذج فعّالة للغاية لـاكتشاف الكائنات، صُممت لتحقيق توازن بين الدقة والتكلفة الحاسوبية. ومن بين النماذج البارزة التي قُدّمت في عام 2022 DAMO-YOLO وYOLOv7. وبينما يهدف كلاهما إلى دفع حدود مهام الرؤية في الوقت الفعلي، فإنهما يحققان نتائجهما من خلال نماذج معمارية ومنهجيات تدريب مختلفة جذريًا.

تستكشف هذه المقارنة التقنية الشاملة النهجين المتميزين لكلا النموذجين، مع فحص بنيتيهما وإمكانات نشرهما ومقاييس أدائهما، لمساعدة مهندسي تعلّم الآلة على اختيار الأداة المناسبة لـتطبيقات الرؤية الحاسوبية الخاصة بهم.

أصول النماذج وبياناتها الوصفية#

قبل التعمق في التحليل التقني، من الضروري وضع نشأة نموذجي الرؤية الحاسوبية هذين في سياقها.

DAMO-YOLO#

طوّر باحثون في مجموعة Alibaba نموذج DAMO-YOLO، وقدّموه لتحسين السرعة والدقة معًا من خلال البحث الآلي عن البنية والتقطير.

تعرف على المزيد حول DAMO-YOLO

YOLOv7#

أُطلق YOLOv7 بوصفه أحدث ما توصلت إليه التقنية في منتصف عام 2022، ودفع الاستدلال في الوقت الفعلي إلى آفاق أبعد من خلال تقديم «حقيبة من المزايا» قابلة للتدريب من دون زيادة تكاليف النشر.

تعرف على المزيد حول YOLOv7

النظام البيئي المدعوم

يحظى YOLOv7 بدعم رسمي ضمن النظام البيئي لـ Ultralytics، ما يتيح التدريب والتحقق والتصدير بسلاسة من خلال API موحّد.

الابتكارات المعمارية#

DAMO-YOLO: البحث الآلي عن البنية والتقطير#

يضم DAMO-YOLO عدة تقنيات متطورة تهدف إلى تحقيق أقصى قدر من الكفاءة:

  • العمود الفقري للبحث الآلي عن البنية: يستخدم البحث الآلي عن البنية العصبية (NAS) لتصميم أعمدة فقارية مثلى تلقائيًا (MAE-NAS)، مخصصة للبيئات الحساسة لزمن الاستجابة.
  • Efficient RepGFPN: شبكة هرمية للميزات معمّمة معدّلة، تعزز كفاءة دمج الميزات بدرجة كبيرة عبر مقاييس متعددة.
  • ZeroHead وAlignedOTA: يدمج رأس اكتشاف خفيف الوزن واستراتيجية محسّنة لإسناد التسميات (AlignedOTA) لتقليل العبء الحاسوبي.
  • تحسين التقطير: يستفيد بدرجة كبيرة من تقطير المعرفة أثناء التدريب لتعزيز أداء إصدارات النماذج الأصغر من دون زيادة عدد معلماتها.

YOLOv7: ‏E-ELAN وحقيبة المزايا#

اتبّع YOLOv7 نهجًا هندسيًا بنيويًا أكثر، مع التركيز على تحسين مسارات التدرج واستراتيجيات التدريب المتينة.

  • بنية E-ELAN: تتيح شبكة تجميع الطبقات الفعّالة الموسّعة للنموذج تعلّم ميزات أكثر تنوعًا من خلال التحكم في أقصر مسارات التدرج وأطولها، بما يضمن تقاربًا فعالًا للتعلم.
  • تحجيم النموذج: يقدّم أسلوب تحجيم مركّبًا مخصصًا للنماذج القائمة على التسلسل، إذ يحجّم العمق والعرض في الوقت نفسه لتحقيق محاذاة بنيوية.
  • حقيبة المزايا القابلة للتدريب: يستخدم تقنيات مثل الالتفافات المُعاد تمثيلها (RepConv) من دون وصلات الهوية، واستراتيجيات ديناميكية لإسناد التسميات، ما يعزز الدقة أثناء التدريب من دون التأثير في سرعة الاستدلال.

تحليل الأداء#

عند تقييم متوسط الدقة المحققة (mAP) والسرعة والكفاءة، يُظهر كلا النموذجين مقاييس مبهرة، رغم استهدافهما شرائح مختلفة قليلًا. يركز YOLOv7 بدرجة كبيرة على النشر عبر GPU عالي الدقة، بينما تهدف البنى المشتقة من البحث الآلي عن البنية في DAMO-YOLO إلى النشر العدواني منخفض زمن الاستجابة على CPU والأجهزة الطرفية.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

كما توضح المقاييس، يوفّر DAMO-YOLO إصدارات خفيفة للغاية، مثل النموذج الصغير الذي يضم 8.5M معلمة فقط، بينما يحقق YOLOv7 ذروة أعلى للدقة الإجمالية، إذ يصل YOLOv7x إلى 53.1 mAP impressive على مجموعة بيانات COCO.

ميزة منظومة Ultralytics#

على الرغم من أهمية البنية النظرية، فإن عملية النموذج تحددها منظومته البيئية. وتستفيد النماذج المدعومة من Ultralytics، مثل YOLOv7، من نظام بيئي تتم صيانته جيدًا وسهولة استخدام لا مثيل لها.

  • توازن الأداء: تحقق نماذج Ultralytics باستمرار مفاضلة مثلى بين سرعة الاستدلال ودقة الاكتشاف، ما يجعلها مثالية لكل من الأجهزة الطرفية ونشر النماذج المستند إلى السحابة.
  • متطلبات الذاكرة: بخلاف النماذج الأثقل القائمة على Transformer، تحافظ نماذج Ultralytics YOLO على متطلبات منخفضة لذاكرة CUDA أثناء التدريب. ويتيح ذلك استخدام أحجام دفعات أكبر، ما يبسّط عملية التدريب حتى على العتاد المخصص للمستهلكين.
  • تعدد الاستخدامات: يتجاوز إطار Ultralytics اكتشاف الكائنات إلى مهام مثل تجزئة المثيلات وتقدير الوضعية، ما يزوّد المطورين بمجموعة أدوات كاملة للرؤية الحاسوبية.
كفاءة التدريب

تتيح حزمة Ultralytics الانتقال بسلاسة من مجموعات البيانات إلى نموذج مُدرّب بالكامل خلال دقائق معدودة، بالاستفادة من محمّلات بيانات محسّنة للغاية وأوزان مُدرّبة مسبقًا.

مثال على التعليمات البرمجية: تدريب YOLOv7 باستخدام Ultralytics#

يُعد دمج YOLOv7 في مسار عمل الرؤية الحاسوبية أمرًا سهلًا للغاية باستخدام Python API من Ultralytics.

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference and validate results
metrics = model.val()
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)

المعيار الجديد: تقديم YOLO26#

على الرغم من أن YOLOv7 وDAMO-YOLO مثّلا إنجازات مهمة في عام 2022، فإن مجال ذكاء الرؤية يتطور بسرعة. وبالنسبة إلى الفرق التي تبدأ مشاريع جديدة اليوم، فإن النموذج الموصى به هو Ultralytics YOLO26 المتطور، الذي أُطلق في يناير 2026.

يحقق YOLO26 قفزة جيلية في الأداء وسهولة الاستخدام، مع دمج ابتكارات متطورة:

  • تصميم شامل من البداية ومن دون NMS: يعمل YOLO26 أصلاً بطريقة شاملة من البداية إلى النهاية. ومن خلال إلغاء المعالجة اللاحقة لكبت عدم الحد الأقصى (NMS)، فإنه يوفّر منطق نشر أسرع وأبسط، في تحول نموذجي ابتكرته مبدئيًا YOLOv10.
  • مُحسِّن MuSGD: مستوحًى من ابتكارات نماذج اللغة الكبيرة مثل Kimi K2 من Moonshot AI، يستخدم YOLO26 مزيجًا هجينًا من SGD وMuon. ويضمن هذا المُحسِّن ديناميكيات تدريب مستقرة للغاية ومعدلات تقارب أسرع بكثير.
  • استدلال أسرع على CPU بنسبة تصل إلى 43%: بفضل الإزالة المستهدفة لخسارة التركيز التوزيعي (DFL) والتحسينات البنيوية العميقة، جرى تحسين YOLO26 بدرجة كبيرة للحوسبة الطرفية منخفضة الطاقة، متفوقًا على الأجيال السابقة في العتاد غير المعتمد على GPU.
  • ProgLoss + STAL: يدمج دوال خسارة جديدة ومتقدمة تستهدف صراحةً تحسين التعرّف على الكائنات الصغيرة، وهي قدرة أساسية لتطبيقات الصور الجوية والروبوتات ومراقبة الأمن.
  • تحسينات خاصة بالمهام: بالإضافة إلى الاكتشاف القياسي، يتضمن YOLO26 تحسينات مخصصة لمهام متنوعة، بما في ذلك وضع النماذج الأولية متعدد المقاييس للتجزئة، وRLE لتقدير الوضعية، وخسائر زوايا محددة لـالمربعات المحيطة الموجّهة (OBB).

حالات الاستخدام المثالية#

يعتمد اختيار البنية المناسبة بالكامل على بيئة النشر المستهدفة وقيود المشروع.

متى تختار DAMO-YOLO:

  • تعمل في بيئات طرفية شديدة التقييد ومحدودة الموارد، حيث يجب إبقاء العدد الخام للمعلمات منخفضًا للغاية، مثل المتحكمات الدقيقة.
  • تستخدم مسارات عمل للتعلم الآلي الآلي مدمجة تحديدًا مع الخدمات السحابية الاحتكارية التابعة لـ Alibaba.

متى تختار YOLOv7:

  • لديك بالفعل مسارات عمل قديمة لـ GPU محسّنة للاستدلال عالي الدقة القائم على المراسي.
  • تعمل في بيئات تكون فيها الدقة في الوقت الفعلي أمرًا بالغ الأهمية، مثل المركبات ذاتية القيادة عالية السرعة أو الروبوتات المتقدمة.

متى تختار YOLO26 (موصى به):

  • تعمل على بناء تطبيق رؤية حاسوبية جديد من الصفر، وتحتاج إلى أحدث ما توصلت إليه التقنية على الإطلاق في كل من الدقة وسرعة الاستدلال على CPU والأجهزة الطرفية.
  • تحتاج إلى نشر سريع وسلس، مثل التصدير إلى CoreML أو TensorRT، من دون التعامل مع قيود عوامل تشغيل NMS.
  • ترغب في الاستفادة من الإمكانات الكاملة لـمنصة Ultralytics للتدريب السحابي وإدارة مجموعات البيانات والنشر الآلي.

من خلال الاستفادة من النظام البيئي المتين لنماذج Ultralytics، يمكن للمطورين تقليل وقت الهندسة بدرجة كبيرة مع ضمان أداء تنبؤي من المستوى الأعلى لتطبيقاتهم الواقعية.

التعليقات