DAMO-YOLO في مقابل YOLOv6-3.0#
أدى التطور السريع لرؤية الحاسوب إلى إنتاج بنيات متخصصة للغاية ومصممة للتطبيقات الصناعية. ومن بين هذه البنيات، يبرز نموذجان قويان لتركيزهما على الأداء في الوقت الفعلي وكفاءة النشر، وهما: DAMO-YOLO و YOLOv6-3.0. توفر هذه الصفحة مقارنة تقنية متعمقة لبنيتيهما ومقاييس أدائهما ومنهجيات تدريبهما لمساعدتك في اتخاذ قرارات النشر الخاصة بك.
DAMO-YOLO: حيث يلتقي البحث عن البنية العصبية باكتشاف الأجسام#
تم تطوير DAMO-YOLO بواسطة باحثين في مجموعة Alibaba، ويقدم نهجاً جديداً لعائلة YOLO من خلال دمج البحث عن البنية العصبية (NAS) بكثافة في تصميم هيكله الأساسي (backbone).
- المؤلفون: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, و Xiuyu Sun
- المنظمة: Alibaba Group
- التاريخ: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
الابتكارات المعمارية#
يستخدم DAMO-YOLO هيكلاً أساسياً مُحسّناً بواسطة NAS يسمى MAE-NAS، والذي يبحث تلقائياً عن هياكل الشبكة المثلى في ظل قيود زمن وصول محددة. وهذا يضمن قدرة النموذج على التوسع بكفاءة عبر ملفات تعريف الأجهزة المختلفة. ولتحسين دمج الميزات، تستخدم البنية Efficient RepGFPN (شبكة هرمية ميزات معممة قابلة لإعادة التعيين)، مما يعزز تمثيل المقاييس المتعددة بشكل كبير.
علاوة على ذلك، يقدم النموذج تصميماً "ZeroHead". فمن خلال إزالة هياكل الفروع المتعددة المعقدة في رأس الكشف، فإنه يحافظ على المعلومات المكانية بشكل أكثر فعالية مع تقليل العبء الحسابي. كما تستفيد منهجية التدريب من AlignedOTA (تخصيص النقل الأمثل الموحد) وتقطير المعرفة القوي، مما يسمح لنماذج الطلاب الأصغر بالتعلم من شبكات المعلمين الأثقل.
في حين أن تقطير المعرفة يساعد DAMO-YOLO في تحقيق دقة عالية، إلا أنه يتطلب مسار تدريب متعدد المراحل. هذا يزيد بشكل كبير من GPU compute المطلوبة مقارنة بتدريب النماذج القياسية أحادية المرحلة.
YOLOv6-3.0: زيادة الإنتاجية الصناعية إلى الحد الأقصى#
بمبادرة من قسم رؤية الذكطة الاصطناعية في شركة ميتوان، يُصنف YOLOv6-3.0 صراحةً ككشف كائنات صناعي، مصمم خصيصاً لتعظيم الإنتاجية على أجهزة NVIDIA.
- المؤلفون: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, و Xiangxiang Chu
- Organization: Meituan
- التاريخ: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
الميزات الرئيسية والتحسينات#
يتم بناء YOLOv6-3.0 على الهيكل الأساسي EfficientRep المتوافق مع الأجهزة، مما يجعله سريعاً بشكل استثنائي عند الاستفادة من تحسينات مثل TensorRT على وحدات معالجة الرسوميات الحديثة. في إصداره v3.0، تدمج الشبكة وحدة ربط ثنائي الاتجاه (BiC) لتحسين تحديد موقع أحجام الكائنات المتغيرة.
ميزة بارزة أخرى هي استراتيجية التدريب المدعوم بالمراسي (AAT). تجمع AAT بين استقرار anchor-based detectors أثناء التدريب وسرعة الاستدلال للتصميم الخالي من المراسي. يوفر هذا النهج الهجين تقارباً ممتازاً دون التضحية بزمن انتقال النشر، مما يجعله خياراً قوياً معالجة تدفقات الفيديو الضخمة في تحليلات المدن الذكية وأنظمة الدفع الآلية.
مقارنة الأداء#
عند تقييم هذه النماذج لـ real-time inference، يعد موازنة المعلمات، و FLOPs، والدقة أمراً بالغ الأهمية. فيما يلي تقييم مفصل يقارن أدائها.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (ms) | السرعة T4 TensorRT10 (ms) | المعلمات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
بينما يُظهر DAMO-YOLO تفوقاً طفيفاً في الفئة الصغيرة (46.0 mAP مقابل 45.0 mAP)، يُظهر YOLOv6-3.0 قابلية توسع متفوقة، متفوقاً في الفئات المتوسطة والكبيرة مع الاحتفاظ بأقل عدد مطلق من المعلمات في تكوينه النانوي.
إذا كانت بيئة أجهزتك تسمح بعمليات بحث آلية ثقيلة لتخصيص هيكلك الأساسي، فإن نهج NAS الخاص بـ DAMO-YOLO فعال للغاية. ومع ذلك، إذا كنت تعتمد كلياً على تسريع GPU الموحد (مثل T4 أو A100)، فإن هياكل EfficientRep الخاصة بـ YOLOv6 غالباً ما تترجم إلى إطارات في الثانية أعلى.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO و YOLOv6 على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.
متى تختار DAMO-YOLO#
يعد DAMO-YOLO خياراً قوياً لما يلي:
- تحليلات الفيديو ذات الإنتاجية العالية: معالجة تدفقات الفيديو ذات معدل الإطارات العالي على بنية تحتية ثابتة لوحدات GPU من NVIDIA حيث يكون إنتاجية الدفعة-1 هو المقياس الأساسي.
- خطوط التصنيع الصناعية: السيناريوهات ذات قيود زمن انتقال GPU صارمة على أجهزة مخصصة، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث في البنية العصبية: دراسة تأثيرات البحث الآلي في البنية (MAE-NAS) والهياكل الأساسية المعاد برمجتها بكفاءة على أداء الاكتشاف.
متى تختار YOLOv6#
يوصى بـ YOLOv6 لـ:
- النشر المدرك للأجهزة الصناعية: السيناريوهات التي يوفر فيها التصميم المدرك للأجهزة وإعادة تحديد المعلمات الفعال للنموذج أداءً محسناً على أجهزة مستهدفة محددة.
- الكشف السريع في مرحلة واحدة: التطبيقات التي تعطي الأولوية لسرعة الاستدلال الخام على GPU لمعالجة الفيديو الفوري في بيئات خاضعة للتحكم.
- تكامل النظام البيئي لـ Meituan: الفرق التي تعمل بالفعل ضمن حزمة التكنولوجيا والبنية التحتية للنشر الخاصة بـ Meituan.
متى تختار Ultralytics (YOLO26)#
بالنسبة لمعظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطورين:
- نشر الحافة الخالي من NMS: التطبيقات التي تتطلب استنتاجاً متسقاً ومنخفض زمن الانتقال دون تعقيدات معالجة ما بعد المعالجة باستخدام كبت غير الأقصى.
- بيئات وحدة المعالجة المركزية (CPU) فقط: الأجهزة التي لا تحتوي على تسريع مخصص بوحدة معالجة الرسوميات (GPU)، حيث توفر سرعة استنتاج CPU أسرع بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- الكشف عن الأشياء الصغيرة: السيناريوهات الصعبة مثل صور الطائرات بدون طيار الجوية أو تحليل مستشعرات إنترنت الأشياء (IoT) حيث تعمل ProgLoss و STAL على تعزيز الدقة بشكل كبير على الأشياء الدقيقة.
ميزة Ultralytics: تقديم YOLO26#
في حين أن كل من DAMO-YOLO و YOLOv6-3.0 كفؤان للغاية، إلا أنهما يعانيان من أنظمة بيئية مجزأة، وقيود المهام الفردية، وخطوط نشر معقدة. بالنسبة لفرق الهندسة الحديثة، توفر Ultralytics models تجربة مطور أفضل بكثير، تتوج بـ YOLO26 الرائد.
تم إصداره في يناير 2026، ويمثل YOLO26 المعيار الجديد لنشر الحافة والسحابة، حيث يحسن بشكل كبير memory requirements والكفاءة الحسابية.
لماذا تختار YOLO26؟#
- تصميم NMS-Free من البداية إلى النهاية: بناءً على المفاهيم الواردة من YOLOv10، يلغي YOLO26 بشكل أصلي المعالجة اللاحقة لقمع غير الحد الأقصى. هذا يبسط بشكل كبير كود النشر ويقلل من تباين زمن انتقال الاستدلال عبر جميع أجهزة الحافة.
- تحسين متفوق: يستخدم YOLO26 مُحسِّن MuSGD، وهو هجين من SGD و Muon (مستوحى من النماذج اللغوية الكبيرة)، والذي ينتج عنه عمليات تدريب مستقرة للغاية وتقارب أسرع.
- تنوع الأجهزة: من خلال تنفيذ إزالة DFL (خسارة التنسيق البؤري)، يتم تبسيط رؤوس الإخراج، مما يعزز توافق جهاز الحافة. في الواقع، يحقق YOLO26 استدلالاً أسرع لوحدة المعالجة المركزية (CPU) بنسبة تصل إلى 43%، مما يجعله متفوقاً بشكل كبير على YOLOv6 لبيئات الهاتف المحمول أو إنترنت الأشياء (IoT).
- دقة محسنة: باستخدام ProgLoss + STAL، يشهد YOLO26 تحسينات جذرية في small object detection، مما يجعله الخيار الأمثل لـ aerial imagery وفحص العيوب.
- تعدد استخدامات لا مثيل له: على عكس النماذج الصناعية التي تقوم فقط بمربعات الإحاطة، تدعم عائلة YOLO26 المهام متعددة الوسائط، بما في ذلك Image Classification، Instance Segmentation، Pose Estimation، و Oriented Bounding Boxes (OBB).
تجربة نظام بيئي سلسة#
تعمل Ultralytics Platform على تحويل دورة حياة التعلم الآلي بأكملها. لم يعد تدريب النموذج صداع تقطير متعدد المراحل. مع زيادة البيانات التلقائية، وضبط المعلمات الفائقة الموحدة، والتصديرات بنقرة واحدة إلى تنسيقات مثل ONNX، OpenVINO، و CoreML، يمكنك الانتقال من مجموعة البيانات إلى الإنتاج في غضون ساعات، وليس أسابيع.
بالإضافة إلى ذلك، تشتهر نماذج Ultralytics بـ memory efficiency، متجاوزة اختناقات VRAM الهائلة التي تعصف ببنيات المحولات مثل RT-DETR.
مثال كود للبدء السريع#
التدريب والاستدلال باستخدام نموذج Ultralytics مثل YOLO26 بسيط وأنيق. يوضح سكربت Python التالي كيف يمكنك البدء فوراً في تتبع الأجسام ببضعة أسطر فقط من الكود:
from ultralytics import YOLO
# Load the highly efficient, NMS-free YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset seamlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a sample image
prediction = model("https://ultralytics.com/images/bus.jpg")
# Export to TensorRT for maximum GPU throughput
model.export(format="engine", dynamic=True)الخلاصة#
يعد كل من DAMO-YOLO و YOLOv6-3.0 إنجازات هندسية مبهرة تدفع حدود كشف الأجسام الصناعي. ومع ذلك، فهي أدوات متخصصة للغاية وغالباً ما تتطلب إعدادات معقدة وقيوداً صارمة على الأجهزة.
بالنسبة للمطورين والباحثين الذين يطلبون توازناً مثالياً في الأداء، وقدرات متعددة المهام، ونظاماً بيئياً نشطاً وwell-maintained ecosystem، يقف Ultralytics YOLO26 دونปล่อย منافس. من خلال مزج المحسنات المستوحاة من نماذج اللغة الكبيرة مع بنية نظيفة وخالية من NMS، يبسط YOLO26 AI deployment مع تقديم دقة متطورة عبر بيئات الحافة والسحابة.
إذا كنت تقيّم نماذج لمشروع رؤية حاسوبية جديد، فنحن نوص بشدة باكتشاف قدرات نظام Ultralytics YOLO البيئي. قد تجد أيضاً أنه من المفيد مقارنة هذه بالبنى الأخرى مثل EfficientDet أو المعالم السابقة مثل YOLO11 لفهم تطور ذكاء الرؤية في الوقت الفعلي بشكل كامل.