DAMO-YOLO مقابل YOLO26#
يتطور مجال الرؤية الحاسوبية باستمرار، مدفوعًا بالحاجة إلى بنيات توازن بين الدقة العالية والاستدلال بزمن استجابة منخفض. تتناول هذه المقارنة التفاصيل التقنية الدقيقة لكل من DAMO-YOLO وUltralytics YOLO26، وتستكشف ابتكاراتهما المعمارية ومنهجيات التدريب وحالات الاستخدام المثلى.
سواء كنت تنشر نماذج الرؤية على الأجهزة الطرفية أو تبني مسارات سحابية عالية الإنتاجية، فإن فهم الفروق الدقيقة بين هذه النماذج أمر بالغ الأهمية لاتخاذ قرارات مدروسة بشأن البنية في تطوير الذكاء الاصطناعي الحديث.
DAMO-YOLO: البحث عن البنى العصبية على نطاق واسع#
طورت Alibaba Group نموذج DAMO-YOLO، وأُطلق في 23 نوفمبر 2022. صمم النموذج كل من Xianzhe Xu وYiqi Jiang وWeihua Chen وYilun Huang وYuan Zhang وXiuyu Sun، ويركز بدرجة كبيرة على الاكتشاف الآلي للبنى الفعالة باستخدام البحث عن البنى العصبية (NAS).
يمكنك مراجعة البحث الأصلي في ورقة ArXiv، أو استكشاف الشيفرة المصدرية في مستودع DAMO-YOLO على GitHub.
الميزات المعمارية الأساسية#
يقدم DAMO-YOLO عدة ابتكارات تقنية مصممة لتوسيع آفاق كشف الأجسام الآني:
- الأعمدة الفقرية MAE-NAS: يستخدم DAMO-YOLO بحثًا موجّهًا بأقصى إنتروبيا للعثور على الأعمدة الفقرية المثلى. ويكتشف نهج NAS هذا بنيات توازن بدقة بين دقة الكشف وسرعة الاستدلال على عتاد محدد.
- RepGFPN الفعال: تصميم ثقيل للعنق يحسّن دمج الميزات بدرجة كبيرة، وهو مفيد للغاية عند تحليل المشاهد المعقدة مثل تلك الموجودة في الصور الجوية.
- تصميم ZeroHead: رأس كشف مبسّط إلى حد كبير يقلل التعقيد الحسابي لطبقات التنبؤ النهائية.
- AlignedOTA والتقطير: يستخدم DAMO-YOLO تعيين النقل الأمثل المتوافق (AlignedOTA) لمعالجة التباس تعيين التسميات، إلى جانب استراتيجية متينة لتحسين تقطير المعرفة، بهدف تعزيز دقة النماذج الطلابية الأصغر باستخدام شبكات معلمة أكبر.
تعرّف على المزيد حول DAMO-YOLO
ميزة Ultralytics: YOLO26#
أُطلق YOLO26 في 14 يناير 2026 على يد Glenn Jocher وJing Qiu في Ultralytics، ويمثل قمة الذكاء الاصطناعي البصري عالي الأداء والمتاح للجميع. واستنادًا إلى إرث YOLO11 وYOLOv10، صُمم YOLO26 من الأساس للنشر على الأجهزة الطرفية أولًا، وتعدد المهام، وسهولة الاستخدام التي لا مثيل لها.
ابتكارات YOLO26#
يقدم Ultralytics YOLO26 عدة ميزات رائدة تجعله الخيار الحاسم لتطبيقات الرؤية الحاسوبية الحديثة:
- تصميم شامل من البداية إلى النهاية بلا NMS: يزيل الرأس الأصلي أحادي المطابقة في YOLO26 (
nms=False) المعالجة اللاحقة لكبح غير الأقصى (NMS). وقد طُبق هذا النهج الشامل أول مرة في YOLOv10، وهو يبسّط مسارات النشر بدرجة كبيرة ويضمن استدلالًا حتميًا بزمن استجابة منخفض. - استدلال أسرع بنسبة تصل إلى 43% على CPU: بفضل تحسينه المعماري للحوسبة الطرفية، يوفر YOLO26 سرعة استثنائية على الأجهزة الطرفية ووحدات CPU القياسية، ما يجعله مثاليًا لأجهزة إنترنت الأشياء العاملة بالبطارية.
- محسّن MuSGD: استلهامًا من تدريب نماذج اللغة الكبيرة، مثل Kimi K2 من Moonshot AI، يدمج YOLO26 نهجًا هجينًا من SGD وMuon. وهذا ينقل استقرار تدريب نماذج اللغة الكبيرة إلى الرؤية الحاسوبية، ما يؤدي إلى تقارب أسرع وأكثر موثوقية.
- إزالة DFL: من خلال إزالة خسارة البؤرة التوزيعية، يُبسّط مخطط النموذج، ما يتيح تصديرًا سلسًا إلى تنسيقات مثل ONNX وTensorRT.
- ProgLoss + STAL: توفر دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهي ميزة مهمة لـعمليات الطائرات المسيّرة والزراعة.
يتضمن YOLO26 تحسينات متخصصة عبر أنماط متعددة: نموذجًا أوليًا متعدد المقاييس لـتقسيم الكائنات، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لـتقدير الوضعية، وخسارة زاوية متقدمة للحد من مشكلات الحدود في كشف مربعات الإحاطة الموجّهة (OBB).
مقارنة الأداء#
عند تقييم هذه النماذج، يُعد التوازن بين الدقة (mAP) والكفاءة الحسابية (السرعة/FLOPs) أمرًا بالغ الأهمية. ويسلط الجدول أدناه الضوء على مقارنة هذه النماذج باستخدام مجموعة بيانات COCO المعتمدة في المجال.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
كما يتضح أعلاه، يحقق YOLO26 دقة أعلى باستمرار باستخدام عدد أقل بكثير من المعاملات وFLOPs، ما ينتج عنه بنية أكثر كفاءة بكثير في التدريب والاستدلال على حد سواء.
كفاءة التدريب وسهولة الاستخدام#
تعقيدات DAMO-YOLO#
مع أن DAMO-YOLO يحقق دقة تنافسية، فإن منهجية تدريبه شديدة التعقيد. فالاعتماد على البحث عن البنى العصبية (NAS) وتقطير المعرفة المكثف يعني أن تدريب نموذج مخصص غالبًا ما يتطلب موارد GPU كبيرة وخبرة متخصصة. وقد تؤدي هذه العملية متعددة المراحل—أي تدريب نموذج معلم ضخم لتقطير معرفته في نموذج طالب أصغر—إلى إبطاء فرق الهندسة المرنة التي تسعى إلى تكرار التجارب بسرعة على مجموعات بيانات مخصصة.
تجربة Ultralytics المبسطة#
على النقيض من ذلك، صُمم Ultralytics YOLO26 لسهولة الاستخدام الفائقة، بدءًا من الصفر وصولًا إلى الاحتراف. وتُدار دورة حياة التدريب والتحقق والنشر كاملة عبر واجهتي Python API وCLI نظيفتين وموحدتين. علاوة على ذلك، يتطلب YOLO26 ذاكرة CUDA أقل بكثير أثناء التدريب مقارنةً بالنماذج القائمة على Transformer مثل RT-DETR، ما يتيح للباحثين تدريب نماذج متطورة على عتاد استهلاكي.
فيما يلي مثال يوضح مدى سهولة تدريب نموذج YOLO26 وتقييمه وتصديره باستخدام SDK من Ultralytics:
from ultralytics import YOLO
# تحميل أحدث نموذج YOLO26 nano
model = YOLO("yolo26n.pt")
# تدريب النموذج على مجموعة بيانات COCO8 لمدة 50 حقبة
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# تقييم أداء النموذج على مجموعة التحقق
metrics = model.val()
# إجراء الاستدلال على صورة نموذجية
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# تصدير النموذج بتنسيق ONNX لنشره
model.export(format="onnx")بالنسبة إلى الفرق التي تفضل بيئة لا تتطلب كتابة التعليمات البرمجية، توفر منصة Ultralytics واجهة سهلة الاستخدام للتعليق التوضيحي على مجموعات البيانات والتدريب السحابي والنشر السلس.
تطبيقات واقعية#
يعتمد اختيار البنية المناسبة بدرجة كبيرة على بيئة النشر المستهدفة وقيود العتاد.
مراقبة الجودة الصناعية#
في مجال أتمتة التصنيع عالية السرعة، يمكن أن يحقق DAMO-YOLO أداءً جيدًا على عتاد GPU مخصص. لكن YOLO26 هو الخيار المفضل لخطوط التجميع الحديثة. إذ يضمن تصميمه الشامل من البداية إلى النهاية والخالي من NMS زمن استجابة حتميًا ومستقرًا، وهو أمر أساسي لمزامنة البيانات المرئية مع المشغلات الروبوتية في الوقت الفعلي.
الذكاء الاصطناعي الطرفي والأجهزة المحمولة#
يتطلب نشر الرؤية الحاسوبية على الأجهزة العاملة بالبطارية كفاءة فائقة. وبينما يعتمد DAMO-YOLO على أعناق RepGFPN محددة، فإن YOLO26n (Nano) محسّن خصيصًا للحوسبة الطرفية. وتجعله إزالة DFL وزيادة سرعة الاستدلال على CPU بنسبة 43% الحل الأمثل للكاميرات الذكية وتطبيقات الأجهزة المحمولة وأنظمة إنذار الأمان.
متطلبات المشاريع متعددة المهام#
إذا كان المشروع يتطلب أكثر من مجرد كشف الأجسام—مثل تحليل حركات اللاعبين في الرياضة باستخدام تقدير الوضعية، أو استخراج الحدود الدقيقة على مستوى البكسل باستخدام تقسيم الكائنات—فإن YOLO26 يوفر دعمًا أصليًا لجميع هذه المهام ضمن قاعدة شيفرة موحدة واحدة. أما DAMO-YOLO فيقتصر حصرًا على كشف مربعات الإحاطة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO وYOLO26 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار DAMO-YOLO#
يُعد DAMO-YOLO خيارًا قويًا في الحالات التالية:
- تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو ذات معدل إطارات مرتفع على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند batch-1 المقياس الأساسي.
- خطوط التصنيع الصناعي: السيناريوهات ذات قيود زمن استجابة صارمة على GPU ضمن أجهزة مخصصة، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والعمود الفقري الفعال المعاد تحديد معلماته على أداء الكشف.
متى تختار YOLO26#
يوصى بـ YOLO26 لما يلي:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
الخلاصة#
تمثل كلتا البنيتين إنجازين مهمين في مجال التعلم العميق. ويقدم DAMO-YOLO لمحة رائعة عن قوة البحث عن البنى العصبية وتقنيات التقطير المصممة لمعايير أداء عتاد محدد.
لكن Ultralytics YOLO26 يبرز بوصفه الخيار الأفضل للمطورين والباحثين والمؤسسات الباحثة عن حل جاهز للإنتاج. فالجمع بين تصميم شامل من البداية إلى النهاية وخالٍ من NMS، وتحسينات هائلة في الاستدلال على CPU، وتعدد المهام، والتكامل مع منظومة Ultralytics التي تحظى بصيانة جيدة، يجعله الأداة الأكثر متانة وعملية لمعالجة تحديات الرؤية الحاسوبية في العالم الحقيقي اليوم.
للمهتمين باستكشاف نماذج أخرى ضمن منظومة Ultralytics، تتوفر وثائق شاملة لكل من YOLO11 وYOLOv8 وRT-DETR القائم على Transformer.