DAMO-YOLO مقابل YOLO11#
عند اختيار بنية لكشف الأجسام في الوقت الفعلي لمشروعك التالي في مجال الرؤية الحاسوبية، من الضروري فهم الفروق الدقيقة بين النماذج الرائدة. يقدم هذا الدليل الشامل تحليلًا تقنيًا متعمقًا يقارن بين DAMO-YOLO وUltralytics YOLO11، مستكشفًا بنيتيهما، ومقاييس الأداء، ومنهجيات التدريب، وسيناريوهات النشر المثالية في العالم الحقيقي.
تفاصيل DAMO-YOLO:
- المؤلفون: Xianzhe Xu، وYiqi Jiang، وWeihua Chen، وYilun Huang، وYuan Zhang، وXiuyu Sun
- الجهة: Alibaba Group
- التاريخ: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- الوثائق: وثائق DAMO-YOLO
تفاصيل YOLO11:
- المؤلفان: Glenn Jocher وJing Qiu
- المنظمة: Ultralytics
- التاريخ: 2024-09-27
- GitHub: ultralytics/ultralytics
- الوثائق: وثائق YOLO11
فلسفة التصميم المعماري#
تحدد البنية الأساسية لنموذج كشف الأجسام سرعة الاستدلال ودقته وقابليته للتكيف عبر بيئات الأجهزة المختلفة.
يقدم DAMO-YOLO عدة ابتكارات أكاديمية، مع اعتماد كبير على البحث عن البنى المعمارية العصبية (NAS) لتصميم العمود الفقري تلقائيًا. ويستخدم RepGFPN (شبكة هرمية عامة للميزات مُعادَة المعلمات) فعّالة لتعزيز دمج الميزات، وتصميم ZeroHead يقلل بدرجة كبيرة من حجم رأس التنبؤ الثقيل الموجود غالبًا في البنى السابقة. وبينما يتيح هذا النهج القائم على NAS لـ DAMO-YOLO تحقيق كفاءات محددة على وحدات GPU مختارة، فقد تفتقر البنى الناتجة أحيانًا إلى المرونة اللازمة للتعميم بسلاسة عبر أجهزة الحافة المتنوعة.
في المقابل، يعتمد YOLO11 على سنوات من الأبحاث التأسيسية لتقديم بنية محسّنة للغاية ومصممة يدويًا. ويركز على عمود فقري مبسّط وعنق عالي الكفاءة يقلل العمليات الحسابية الزائدة. ومن المزايا الأساسية لـ YOLO11 كفاءته المحسّنة من حيث المعلمات؛ إذ يحقق تمثيلًا عاليًا للميزات دون متطلبات VRAM الكبيرة المعتادة في النماذج القائمة على Transformer مثل RT-DETR. وهذا يجعل YOLO11 متعدد الاستخدامات بدرجة استثنائية، وقادرًا على العمل بسلاسة على وحدات GPU المخصصة للمستهلكين والأجهزة المحمولة ومسرّعات الحافة المتخصصة.
الأداء والمقاييس#
يتطلب تقييم الأداء النظر إلى ما هو أبعد من الدقة الإجمالية، مع مراعاة التوازن بين السرعة وحجم النموذج والحمل الحوسبي (FLOPs).
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
كما يوضح الجدول، يحقق YOLO11 توازنًا ملائمًا للغاية في الأداء. فعلى سبيل المثال، يتفوق المتغير YOLO11s على DAMO-YOLOs من حيث الدقة، مع الحفاظ على حجم أصغر بكثير من حيث عدد المعلمات. وينعكس هذا الانخفاض في متطلبات الذاكرة مباشرةً على خفض تكاليف النشر وتحسين سرعة الاستجابة على أجهزة الحافة.
منهجيات التدريب وسهولة الاستخدام#
تُعدّ سلسلة التدريب المرحلة التي يقضي فيها المطورون معظم وقتهم، مما يجعل كفاءة التدريب مصدر قلق بالغ الأهمية.
يستخدم DAMO-YOLO عملية تدريب متعددة المراحل تعتمد بدرجة كبيرة على تقطير المعرفة. ويستخدم AlignedOTA (تعيين النقل الأمثل) لتعيين التسميات، وغالبًا ما يتطلب تدريب نموذج أكبر يُسمى «المعلم» لتقطير المعرفة إلى نماذج أصغر تُسمى «الطلاب». وتزيد هذه المنهجية بدرجة كبيرة من استهلاك ذاكرة CUDA ومن إجمالي وقت الحوسبة اللازم لتحقيق التقارب الأمثل.
وعلى العكس، تعمل منظومة Ultralytics على تجريد تعقيدات تدريب النماذج. صُمم YOLO11 ليوفر سهولة استخدام استثنائية، إذ يضم واجهة برمجة تطبيقات Python مبسطة وواجهات CLI شاملة تتيح للمهندسين بدء التدريب على مجموعات بيانات مخصصة باستخدام أمر واحد. وتتميز سلسلة التدريب بكفاءة الموارد بطبيعتها، إذ تقلل ارتفاعات استهلاك الذاكرة، بحيث يمكن حتى تدريب النماذج الأكبر على الأجهزة القياسية.
لا يتطلب تدريب نموذج Ultralytics أي تعليمات برمجية تمهيدية. فسلاسل تحميل البيانات وزيادتها وحساب الخسارة المدمجة محسّنة بالكامل وجاهزة للاستخدام.
إليك مثال سريع يوضح مدى سهولة تدريب نموذج Ultralytics ونشره:
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly on a custom dataset
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Export the trained model to ONNX for seamless deployment
model.export(format="onnx")التطبيقات الواقعية وتعدد الاستخدامات#
غالبًا ما يعتمد الاختيار بين هاتين البنيتين على نطاق المهام المطلوبة في بيئة النشر لديك.
متى يناسب DAMO-YOLO#
يعد DAMO-YOLO إطار عمل لاكتشاف الكائنات بشكل صارم. وهو يتفوق في بيئات البحث الأكاديمي حيث تستكشف الفرق إعادة المعلمات أو تعيد إنتاج تجارب البحث المعماري العصبي المحددة. ويمكن نشر المقارنة أيضاً في بيئات صناعية مقيدة بشدة حيث يتطابق مُسَرِّع GPU محدد تماماً مع الهيكل الخلفي الناتج عن البحث المعماري العصبي.
ميزة Ultralytics#
تتألق نماذج Ultralytics، بما في ذلك YOLO11، في التطبيقات التجارية الواقعية نظراً لتعدد استخداماتها الذي لا يُضاهى ونظامها البيئي المُصان جيداً. وخلافاً لـ DAMO-YOLO، يدعم إطار عمل Ultralytics مهام متعددة بشكل أصلي. فمن تقسيم المثيلات في التصوير الطبي إلى تقدير الوضعية للتحليل الميكانيكي الحيوي في الرياضة، تتولى قاعدة كود واحدة وموحدة كل ذلك.
تشمل القطاعات التي تستفيد من YOLO11 ما يلي:
- الزراعة الذكية: استخدام كشف الأجسام لمراقبة صحة المحاصيل وأتمتة آلات الحصاد.
- تحليلات تجارة التجزئة: تنفيذ المراقبة الذكية لتحليل حركة العملاء وأتمتة إدارة المخزون.
- الخدمات اللوجستية وسلسلة التوريد: كشف الرموز الشريطية والطرود بسرعة عالية باستخدام المربعات المحيطة الموجّهة (OBB) على سيور ناقلة سريعة الحركة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO وYOLO11 على متطلبات مشروعك المحددة وقيود النشر وتفضيلاتك المتعلقة بالمنظومة.
متى تختار DAMO-YOLO#
يُعد DAMO-YOLO خيارًا قويًا من أجل:
- تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو عالية FPS على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند حجم الدفعة 1 هي المقياس الأساسي.
- خطوط التصنيع الصناعية: السيناريوهات ذات القيود الصارمة على زمن استجابة GPU ضمن عتاد مخصص، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والشبكات الأساسية المعاد تمثيلها بكفاءة على أداء الاكتشاف.
متى تختار YOLO11#
يوصى باستخدام YOLO11 من أجل:
- النشر الطرفي في بيئات الإنتاج: التطبيقات التجارية على أجهزة مثل Raspberry Pi أو NVIDIA Jetson، حيث تمثل الموثوقية والصيانة النشطة أولوية قصوى.
- تطبيقات الرؤية متعددة المهام: المشاريع التي تتطلب الكشف، والتقسيم، وتقدير الوضعيات، وOBB ضمن إطار عمل موحد واحد.
- إنشاء النماذج الأولية والنشر بسرعة: الفرق التي تحتاج إلى الانتقال سريعًا من جمع البيانات إلى الإنتاج باستخدام واجهة Ultralytics Python البرمجية المبسطة.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
الجيل التالي: تقديم YOLO26#
مع أن YOLO11 يظل خيارًا قويًا وموثوقًا، فإن مجال الرؤية الحاسوبية يتطور بسرعة. وبالنسبة إلى المطورين الذين يبدؤون مشاريع جديدة، يمثل أحدث نموذج YOLO26 أحدث ما توصل إليه المجال.
أُطلق YOLO26 في يناير 2026، وقدم عدة تطورات رائدة:
- تصميم شامل خالٍ من NMS: من خلال إلغاء المعالجة اللاحقة لقمع القيم غير العظمى، يضمن YOLO26 أزمنة استدلال أسرع وحتمية، ويبسط سلاسل النشر بدرجة كبيرة.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: من خلال إزالة خسارة البؤرة التوزيعية (DFL)، يصبح النموذج ملائمًا بدرجة استثنائية لأجهزة الحافة والأجهزة منخفضة الطاقة التي تفتقر إلى وحدات GPU مخصصة.
- مُحسِّن MuSGD: من خلال دمج ابتكارات تدريب LLM المستوحاة من Moonshot AI، يضمن هذا المُحسِّن الهجين تقاربًا مستقرًا وسريعًا أثناء التدريب.
- دوال خسارة متقدمة: باستخدام ProgLoss + STAL، يُظهر YOLO26 تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية للصور الجوية والروبوتات.
الخلاصة#
أسهم كل من DAMO-YOLO وYOLO11 إسهامًا كبيرًا في تطوير الرؤية الحاسوبية السريعة والدقيقة. وبينما يقدم DAMO-YOLO رؤى أكاديمية مهمة حول البحث عن البنى والتقطير، يوفر Ultralytics YOLO11 (وYOLO26 الرائد) تجربة مطورين متفوقة.
بفضل متطلبات الذاكرة الأقل، والوثائق الشاملة، والقدرات متعددة المهام، والتكامل مع منصة Ultralytics القوية، تظل نماذج Ultralytics التوصية الأولى للباحثين ومهندسي المؤسسات الذين يتطلعون إلى بناء حلول ذكاء اصطناعي متينة وقابلة للتوسع. ولمن يستكشفون البنى المتقدمة الأخرى، توفر مقارنة YOLO26 مقابل RT-DETR رؤى إضافية حول البدائل القائمة على Transformer.