DAMO-YOLO مقابل YOLOv6-3.0#
أدى التطور السريع في مجال الرؤية الحاسوبية إلى إنتاج بُنى متخصصة للغاية، مصممة لتلبية احتياجات التطبيقات الصناعية. ومن بين هذه البُنى، يبرز نموذجان قويان يركزان على الأداء الآني وكفاءة النشر: DAMO-YOLO وYOLOv6-3.0. تقدم هذه الصفحة مقارنة تقنية متعمقة لبنيتيهما، ومقاييس الأداء، ومنهجيات التدريب، لمساعدتك على اتخاذ قرارات النشر المناسبة.
DAMO-YOLO: يلتقي البحث عن البنية العصبية باكتشاف الكائنات#
طوّر باحثون في مجموعة Alibaba Group نموذج DAMO-YOLO، الذي يقدم نهجًا مبتكرًا لعائلة YOLO من خلال دمج البحث عن البنية العصبية (NAS) بدرجة كبيرة في تصميم بنيته الأساسية.
- المؤلفون: Xianzhe Xu، وYiqi Jiang، وWeihua Chen، وYilun Huang، وYuan Zhang، وXiuyu Sun
- الجهة: Alibaba Group
- التاريخ: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
الابتكارات المعمارية#
يستخدم DAMO-YOLO بنية أساسية محسّنة بواسطة NAS تُسمى MAE-NAS، وتبحث تلقائيًا عن بُنى الشبكات المثلى ضمن قيود محددة لزمن الاستجابة. ويضمن ذلك توسّع النموذج بكفاءة عبر ملفات تعريف مختلفة للأجهزة. ولتحسين دمج السمات، تستخدم البنية شبكة Efficient RepGFPN (شبكة هرم السمات المعمّمة المُعاد توحيدها)، مما يعزز تمثيل المقاييس المتعددة بدرجة كبيرة.
علاوة على ذلك، يقدم النموذج تصميمًا يُسمى "ZeroHead". فمن خلال إزالة البُنى المعقدة متعددة الفروع في رأس الكشف، يحافظ النموذج على المعلومات المكانية بفاعلية أكبر مع تقليل العبء الحسابي. كما تستفيد منهجية التدريب من AlignedOTA (تعيين النقل الأمثل المتوافق) ومن تقطير المعرفة المتين، مما يتيح للنماذج الأصغر حجمًا، أي نماذج الطلاب، التعلم من شبكات المعلمين الأكبر حجمًا.
على الرغم من أن تقطير المعرفة يساعد DAMO-YOLO على تحقيق دقة عالية، فإنه يتطلب خط أنابيب تدريب متعدد المراحل. ويزيد ذلك بدرجة كبيرة من حوسبة GPU المطلوبة مقارنةً بتدريب النماذج القياسية أحادية المرحلة.
YOLOv6-3.0: تعظيم معدل الإنتاجية الصناعية#
طوّر قسم Meituan Vision AI نموذج YOLOv6-3.0، المصنّف صراحةً على أنه كاشف كائنات صناعي، والمصمم خصيصًا لتعظيم معدل الإنتاجية على أجهزة NVIDIA.
- المؤلفون: Chuyi Li، Lulu Li، Yifei Geng، Hongliang Jiang، Meng Cheng، Bo Zhang، Zaidan Ke، Xiaoming Xu، وXiangxiang Chu
- المنظمة: Meituan
- التاريخ: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
الميزات والتحسينات الرئيسية#
يعتمد YOLOv6-3.0 على البنية الأساسية EfficientRep الصديقة للأجهزة، مما يجعله سريعًا للغاية عند الاستفادة من تحسينات مثل TensorRT على وحدات GPU الحديثة. وفي إصداره v3.0، تدمج الشبكة وحدة Bi-directional Concatenation (BiC) لتحسين تحديد مواقع الكائنات ذات الأحجام المختلفة.
ومن الميزات البارزة الأخرى استراتيجية التدريب المعتمدة على المراسي (AAT). تجمع AAT بين استقرار الكاشفات المعتمدة على المراسي أثناء التدريب وسرعة الاستدلال التي يوفرها التصميم الخالي من المراسي. ويحقق هذا النهج الهجين تقاربًا ممتازًا دون التضحية بزمن استجابة النشر، مما يجعله خيارًا قويًا لمعالجة تدفقات الفيديو الضخمة في تحليلات المدن الذكية وأنظمة الدفع الآلي عند الخروج.
مقارنة الأداء#
عند تقييم هذه النماذج من أجل الاستدلال الآني، من الضروري تحقيق توازن بين المعلمات وFLOPs والدقة. فيما يلي تقييم مفصل يقارن أداءهما.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
مع أن DAMO-YOLO يتفوق بفارق طفيف في الفئة الصغيرة (46.0 mAP مقابل 45.0 mAP)، يُظهر YOLOv6-3.0 قابلية توسّع أفضل، إذ يتفوق في الفئتين المتوسطة والكبيرة، مع الحفاظ على أقل عدد مطلق من المعلمات في إعداد nano الخاص به.
إذا كانت بيئة أجهزتك تسمح بإجراء عمليات بحث آلية مكثفة لتخصيص بنيتك الأساسية، فإن نهج NAS في DAMO-YOLO فعال للغاية. أما إذا كنت تعتمد بالكامل على تسريع GPU القياسي، مثل T4 أو A100، فإن بُنى EfficientRep في YOLOv6 غالبًا ما تؤدي إلى معدل FPS خام أعلى.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO وYOLOv6 على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.
متى تختار DAMO-YOLO#
يُعد DAMO-YOLO خيارًا قويًا من أجل:
- تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو عالية FPS على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند حجم الدفعة 1 هي المقياس الأساسي.
- خطوط التصنيع الصناعية: السيناريوهات ذات القيود الصارمة على زمن استجابة GPU ضمن عتاد مخصص، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والشبكات الأساسية المعاد تمثيلها بكفاءة على أداء الاكتشاف.
متى تختار YOLOv6#
يوصى باستخدام YOLOv6 في الحالات التالية:
- النشر المراعي للعتاد الصناعي: السيناريوهات التي يوفر فيها تصميم النموذج المراعي للعتاد وإعادة المعلمة الفعالة أداءً محسنًا على عتاد مستهدف محدد.
- الاكتشاف السريع أحادي المرحلة: التطبيقات التي تعطي الأولوية لسرعة الاستدلال الخام على GPU لمعالجة الفيديو في الوقت الفعلي ضمن بيئات خاضعة للرقابة.
- التكامل مع منظومة Meituan: الفرق التي تعمل بالفعل ضمن حزمة تقنيات Meituan وبنيتها التحتية للنشر.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
ميزة Ultralytics: تقديم YOLO26#
على الرغم من أن كلًا من DAMO-YOLO وYOLOv6-3.0 يتمتعان بقدرات عالية، فإنهما يعانيان من أنظمة بيئية مجزأة، وقيود المهام أحادية الغرض، وخطوط أنابيب نشر معقدة. وبالنسبة إلى فرق الهندسة الحديثة، توفر نماذج Ultralytics تجربة مطور أفضل بكثير، تتوج بالنموذج الرائد YOLO26.
أُطلق YOLO26 في يناير 2026، ويمثل المعيار الجديد للنشر على الحافة والسحابة، مع تحسين كبير لمتطلبات الذاكرة والكفاءة الحسابية.
لماذا تختار YOLO26؟#
- تصميم شامل خالٍ من NMS: استنادًا إلى مفاهيم من YOLOv10، يلغي YOLO26 معالجة ما بعد الاستدلال الخاصة بقمع القيم غير العظمى (NMS) بشكل أصلي. ويبسّط ذلك بدرجة كبيرة شيفرة النشر ويقلل تفاوت زمن الاستدلال عبر جميع أجهزة الحافة.
- تحسين متفوق: يستخدم YOLO26 مُحسِّن MuSGD Optimizer، وهو مزيج هجين من SGD وMuon (مستوحى من نماذج اللغة الكبيرة)، مما يوفر عمليات تدريب مستقرة للغاية وتقاربًا أسرع.
- مرونة الأجهزة: من خلال تطبيق DFL Removal (إزالة Distribution Focal Loss)، تُبسّط رؤوس الإخراج، مما يعزز توافق النموذج مع أجهزة الحافة. وفي الواقع، يحقق YOLO26 استدلالًا أسرع على CPU بنسبة تصل إلى 43%، مما يجعله متفوقًا بدرجة كبيرة على YOLOv6 في بيئات الحافة المحمولة أو بيئات إنترنت الأشياء.
- دقة محسّنة: باستخدام ProgLoss + STAL، يحقق YOLO26 تحسينات كبيرة في اكتشاف الكائنات الصغيرة، مما يجعله الخيار الأمثل للصور الجوية وفحص العيوب.
- تعدد استخدامات لا مثيل له: على عكس النماذج الصناعية التي تقتصر على مربعات الإحاطة فقط، تدعم عائلة YOLO26 مهام متعددة، بما في ذلك تصنيف الصور، وتجزئة المثيلات، وتقدير الوضعية، ومربعات الإحاطة الموجهة (OBB).
تجربة سلسة للنظام البيئي#
تعمل منصة Ultralytics على تحويل دورة حياة التعلم الآلي بأكملها. فلم يعد تدريب النموذج عملية معقدة متعددة المراحل بسبب التقطير. ومع زيادة البيانات التلقائية، وضبط المعلمات الفائقة الموحّد، والتصدير بنقرة واحدة إلى تنسيقات مثل ONNX وOpenVINO وCoreML، تنتقل من مجموعة البيانات إلى الإنتاج خلال ساعات لا أسابيع.
بالإضافة إلى ذلك، تشتهر نماذج Ultralytics بكفاءة الذاكرة، إذ تتجنب اختناقات VRAM الهائلة التي تعاني منها بُنى Transformer مثل RT-DETR.
مثال سريع على شيفرة البدء#
يتسم التدريب والاستدلال باستخدام نموذج من Ultralytics مثل YOLO26 بالبساطة والأناقة. يوضح نص Python التالي كيفية بدء تتبع الكائنات فورًا باستخدام بضعة أسطر من الشيفرة فقط:
from ultralytics import YOLO
# Load the highly efficient, NMS-free YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset seamlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a sample image
prediction = model("https://ultralytics.com/images/bus.jpg")
# Export to TensorRT for maximum GPU throughput
model.export(format="engine", dynamic=True)الخلاصة#
يمثل كل من DAMO-YOLO وYOLOv6-3.0 إنجازًا هندسيًا مثيرًا للإعجاب يدفع حدود اكتشاف الكائنات الصناعية. ومع ذلك، فهما أداتان متخصصتان للغاية، وغالبًا ما تتطلبان إعدادات معقدة وقيودًا صارمة على الأجهزة.
بالنسبة إلى المطورين والباحثين الذين يطلبون توازنًا مثاليًا في الأداء، وقدرات متعددة المهام، ونظامًا بيئيًا يحظى بصيانة نشطة، لا يضاهى YOLO26 من Ultralytics. فمن خلال دمج مُحسِّنات مستوحاة من LLM مع بنية نظيفة خالية من NMS، يبسّط YOLO26 نشر الذكاء الاصطناعي مع توفير دقة بمستوى متطور عبر بيئات الحافة والسحابة.
إذا كنت تقيّم نماذج لمشروع جديد في مجال الرؤية الحاسوبية، فنوصي بشدة باستكشاف إمكانات نظام Ultralytics YOLO البيئي. وقد تجد أيضًا أنه من المفيد مقارنتها ببُنى أخرى مثل EfficientDet أو بمحطات بارزة سابقة مثل YOLO11، لفهم تطور الذكاء الاصطناعي للرؤية الآنية فهمًا كاملًا.