Ultralytics YOLO27:

DAMO-YOLO مقابل YOLOX#

يتطور مجال الرؤية الحاسوبية في الوقت الفعلي باستمرار. ومن أبرز المحطات في هذا المسار DAMO-YOLO وYOLOX، إذ يقدّم كل منهما ابتكارات فريدة لمعالجة مشكلة اكتشاف الأجسام بسرعة ودقة عاليتين. وعلى الرغم من إسهام كلا النموذجين إسهامًا كبيرًا في مجتمع المصادر المفتوحة، فإن فهم اختلافاتهما المعمارية، ومنهجيات تدريبهما، وسيناريوهات النشر المثالية لهما أمر بالغ الأهمية لمهندسي تعلّم الآلة.

يستكشف هذا الدليل الشامل الفروق التقنية الدقيقة بين النموذجين، ويوضح سبب تقديم المنصات الحديثة مثل Ultralytics YOLO26 أداءً متفوقًا وسهولة استخدام أكبر لبيئات الإنتاج الحالية.

نظرة عامة على النماذج#

تفاصيل DAMO-YOLO#

تم تطوير DAMO-YOLO بواسطة فريق من الباحثين في مجموعة علي بابا، وتم تقديمه كطريقة كشف عن الكائنات عالية الكفاءة تستفاد من اكتشاف البنية التلقائي.

تعرف على المزيد حول DAMO-YOLO

تفاصيل YOLOX#

تم إنشاء YOLOX بواسطة باحثين في Megvii، وهدف إلى سد الفجوة بين المجتمعات البحثية والصناعية عن طريق تحويل سلسلة YOLO إلى تصميم خالي من المرابط، مما أدى إلى تبسيط البنية بشكل جذري مع تحقيق أداء أفضل في ذلك الوقت.

تعرف على المزيد حول YOLOX

التحليل المعماري#

معمارية DAMO-YOLO#

يعتمد DAMO-YOLO اعتمادًا كبيرًا على البحث الآلي عن البنى (NAS). وتشمل المكوّنات الأساسية ما يلي:

  • الشبكات الأساسية MAE-NAS: تستخدم بحثاً موجهاً بأقصى إنتروبيا لاكتشاف شبكات أساسية توفر التوازن الأمثل بين سرعة الاستدلال والدقة.
  • Efficient RepGFPN: تصميم عنق كثيف مكيّف لدمج السمات، يساعد النموذج في الحفاظ على دقة عالية عبر مقاييس الأجسام المختلفة.
  • ZeroHead: رأس اكتشاف مبسّط وخفيف يقلل العبء الحسابي في طبقات التنبؤ النهائية.

معمارية YOLOX#

اتبع YOLOX نهجًا مختلفًا، إذ ركّز على البساطة الهيكلية والتصميم الخالي من المراسي:

  • الآلية الخالية من المراسي: من خلال التنبؤ بإحداثيات مربعات الإحاطة مباشرةً دون مراسٍ محددة مسبقًا، يقلل YOLOX عدد معلمات التصميم وعمليات الضبط الاستكشافية المطلوبة.
  • الرأس المفكك: يفصل مهمتَي التصنيف والانحدار في فرعين مختلفين للسمات، مما يحسّن سرعة التقارب والدقة الإجمالية.
  • إسناد التسميات SimOTA: استراتيجية متقدمة لإسناد التسميات توزّع العينات الموجبة على الحقائق الأرضية ديناميكيًا، مما يحسّن كفاءة التدريب.
فلسفات التصميم

في حين يستخدم DAMO-YOLO عمليات بحث NAS موجّهة آليًا للعثور على البنى المعمارية المثلى ضمن قيود صارمة، يستفيد YOLOX من تبسيطات أنيقة صمّمها البشر، مثل الرؤوس الخالية من المراسي، لتبسيط مسار اكتشاف الأجسام.

مقارنة الأداء#

يتطلب تقييم هذه النماذج النظر في متوسط الدقة (mAP)، وسرعات الاستدلال، وعدد المعلمات. يوضح الجدول أدناه مقارنة تفصيلية بين الإصدارات القياسية والخفيفة لكلتا المعماريتين.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

يحقق YOLOXx أعلى قيمة مطلقة لـ mAP بمقدار 51.1، بينما يقدّم DAMO-YOLOl قيمة mAP تنافسية للغاية تبلغ 50.8، مع أقل من نصف عدد المعلمات (42.1M مقابل 99.1M) وتنفيذ أسرع بكثير عبر TensorRT.

منهجيات التدريب#

تدريب DAMO-YOLO#

يستخدم DAMO-YOLO تعزيزًا معقدًا بالتقطير أثناء التدريب. غالبًا ما يُدرَّب نموذج كبير يُسمى «المعلّم» أولًا، ثم تُقطّر معارفه في نماذج أصغر تُسمى «الطلاب». كما يستخدم AlignedOTA لإسناد التسميات ديناميكيًا. وعلى الرغم من فعالية هذه العملية الكبيرة، فإن عملية التدريب متعددة المراحل تزيد بدرجة كبيرة من وقت الحوسبة على GPU والذاكرة المطلوبة.

تدريب YOLOX#

يعتمد YOLOX على استراتيجيات قوية لزيادة البيانات مثل MixUp وMosaic. إلا أن المؤلفين اكتشفوا أن إيقاف عمليات زيادة البيانات القوية هذه خلال آخر 15 حقبة يتيح للنموذج تقليص فجوة الواقع، مما يعزز مقاييس الدقة النهائية بدرجة كبيرة.

حالات الاستخدام المثالية#

  • DAMO-YOLO: يُناسب بدرجة أكبر عمليات النشر الصناعية الحرجة التي يمكن فيها دعم مسارات التقطير على الخادم، والتي تستفيد فيها الأجهزة المستهدفة، مثل وحدات GPU محددة من NVIDIA، مباشرةً من معمارية NAS ذات العنق الكثيف.
  • YOLOX: خيار ممتاز للمطورين الذين يبحثون عن نهج خالص خالٍ من المراسي. ويجعل YOLOXnano الخفيف للغاية هذا النهج مناسبًا لأجهزة Android القديمة، والحوسبة الطرفية، ومستشعرات IoT شديدة التقييد حيث يمثل عدد المعلمات عنق الزجاجة الأكبر.

ميزة Ultralytics: تقديم YOLO26#

على الرغم من أن DAMO-YOLO وYOLOX يمثلان محطتين بارزتين، فإن المطورين اليوم يطالبون بحلول أشمل وأكثر مرونة وأسهل استخدامًا. وهنا تتألق منصة Ultralytics وUltralytics YOLO26 المطروحة حديثًا.

أُطلق YOLO26 في يناير 2026، وهو النموذج الموصى به نهائيًا لجميع مهام الرؤية الحاسوبية. ويقدّم مجموعة من الاختراقات التي تتفوق على المعماريات الأقدم:

  • تصميم شامل خالٍ من NMS: يلغي YOLO26 أصلاً المعالجة اللاحقة لكبت القيم العظمى غير المتجاورة (NMS). ويتيح ذلك نشرًا أبسط وأسرع بدرجة كبيرة، مع تجنّب اختناقات زمن الاستجابة الكامنة في رؤوس الاكتشاف التقليدية.
  • استدلال أسرع على CPU بنسبة تصل إلى 43%: من خلال إزالة Distribution Focal Loss (DFL) استراتيجيًا وتحسين الطبقات، يقدّم YOLO26 سرعات لا مثيل لها على وحدات CPU والأجهزة الطرفية.
  • مُحسِّن MuSGD: استلهامًا من تقنيات تدريب نماذج اللغة الكبيرة (LLM)، يقدّم YOLO26 مُحسِّن MuSGD، وهو مزيج هجين من SGD وMuon، مما ينتج عمليات تدريب مستقرة للغاية وتقاربًا أسرع بكثير مقارنةً بالإعدادات القديمة في YOLOX.
  • ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، مما يجعل YOLO26 متفوقًا بدرجة كبيرة في لقطات الطائرات المسيّرة والروبوتات.
  • تعدد الاستخدامات: بخلاف DAMO-YOLO، المخصص لاكتشاف الأجسام فقط، يتعامل YOLO26 بسلاسة مع تجزئة المثيلات، وتقدير الوضعيات، والتصنيف، ومربعات الإحاطة الموجّهة (OBB) أصلاً ضمن النظام المتكامل نفسه، الذي تتم صيانته باستمرار.

سهولة الاستخدام مع Ultralytics#

تُبسّط واجهة Python البرمجية من Ultralytics تجربة المطور. ويتطلب تدريب نموذج YOLO26 متطور قدرًا أقل بكثير من الشيفرة التمهيدية، كما يتجنب مسارات التقطير المعقدة في DAMO-YOLO. علاوةً على ذلك، تتميز نماذج Ultralytics بمتطلبات منخفضة للغاية من ذاكرة CUDA أثناء التدريب مقارنةً بالنماذج الثقيلة القائمة على Transformer.

from ultralytics import YOLO

# Load the latest Ultralytics YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset with one line of code
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run fast, NMS-free inference on an image
results = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX or TensorRT seamlessly
model.export(format="onnx")
التدريب والنشر السحابي

يمكنك إضافة التعليقات التوضيحية إلى النماذج وتدريبها ونشرها على الحافة تلقائيًا باستخدام منصة Ultralytics، التي تتولى إدارة إصدارات البيانات وتوفير موارد GPU السحابية نيابةً عنك.

الخلاصة#

يعتمد الاختيار بين DAMO-YOLO وYOLOX على القيود المحددة: إذ يوفّر DAMO-YOLO نسبًا استثنائية بين السرعة والدقة على وحدات GPU محددة عبر NAS، بينما يقدّم YOLOX تصميمًا نظيفًا خاليًا من المراسي، مثاليًا لسيناريوهات الحافة خفيفة الوزن.

ومع ذلك، بالنسبة إلى الفرق التي تبحث عن حل حديث محصّن للمستقبل ومدعوم بمجتمع نشط، فإن معمارية Ultralytics YOLO26 هي الخيار الحاسم. ويجعل تصميمها الخالي من NMS، واستدلالها السريع على CPU، وواجهتها البرمجية الموحدة لمهام الاكتشاف والتجزئة والوضعيات، منها خيارًا لا مثيل له للانتقال بسلاسة من البحث إلى إنتاج متين في العالم الحقيقي.

بالنسبة إلى المطورين المهتمين باستكشاف معماريات حديثة أخرى، نوصي أيضًا بالاطلاع على Ultralytics YOLO11 أو النماذج القائمة على Transformer مثل RT-DETR والمتاحة في وثائق Ultralytics الشاملة.

التعليقات