DAMO-YOLO مقابل YOLOX#
يتطور مشهد الرؤية الحاسوبية في الزمن الحقيقي باستمرار. ومن المحطات البارزة في هذا المسار DAMO-YOLO وYOLOX، إذ يقدم كل منهما ابتكارات فريدة لمشكلة الكشف عن الأجسام بسرعة ودقة عاليتين. وأسهم كلا النموذجين إسهامًا كبيرًا في مجتمع المصدر المفتوح، لكن فهم الاختلافات المعمارية ومنهجيات التدريب وسيناريوهات النشر المثلى أمر بالغ الأهمية لمهندسي التعلم الآلي.
يستكشف هذا الدليل الشامل الجوانب التقنية الدقيقة لكلا النموذجين، ويوضح أسباب تفوق البدائل الحديثة مثل منصة Ultralytics YOLO26 من حيث الأداء وسهولة الاستخدام في بيئات الإنتاج الحالية.
نظرة عامة على النماذج#
تفاصيل DAMO-YOLO#
طوّر فريق من الباحثين في مجموعة Alibaba نموذج DAMO-YOLO، وطرحوه بوصفه أسلوبًا عالي الكفاءة للكشف عن الأجسام، يستفيد من الاكتشاف الآلي للبنى.
- المؤلفون: Xianzhe Xu وYiqi Jiang وWeihua Chen وYilun Huang وYuan Zhang وXiuyu Sun
- المؤسسة: Alibaba Group
- التاريخ: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
- التوثيق: توثيق DAMO-YOLO
اطّلع على مزيد من المعلومات حول DAMO-YOLO
تفاصيل YOLOX#
طوّر باحثون في Megvii نموذج YOLOX بهدف سد الفجوة بين مجتمعي البحث والصناعة، وذلك بتحويل سلسلة YOLO إلى تصميم خالٍ من المراسي، ما بسّط البنية بدرجة كبيرة مع تحقيق أداء أفضل آنذاك.
- المؤلفون: Zheng Ge وSongtao Liu وFeng Wang وZeming Li وJian Sun
- المؤسسة: Megvii
- التاريخ: 2021-07-18
- Arxiv: https://arxiv.org/abs/2107.08430
- GitHub: https://github.com/Megvii-BaseDetection/YOLOX
- الوثائق: وثائق YOLOX
تعرّف على مزيد من المعلومات عن YOLOX
تحليل البنية المعمارية#
بنية DAMO-YOLO#
يعتمد DAMO-YOLO بدرجة كبيرة على البحث عن البنى العصبية (NAS). وتشمل مكوناته الأساسية ما يلي:
- أعمدة MAE-NAS الفقرية: تستخدم بحثًا موجّهًا بأقصى إنتروبيا لاكتشاف أعمدة فقرية تحقق التوازن الأمثل بين سرعة الاستدلال والدقة.
- RepGFPN الفعال: تصميم عنق ثقيل مخصص لدمج الميزات، يساعد النموذج على الحفاظ على دقة عالية عبر مقاييس الأجسام المختلفة.
- ZeroHead: رأس كشف مبسط وخفيف الوزن يقلل العبء الحاسوبي في طبقات التنبؤ النهائية.
بنية YOLOX#
اتبعت YOLOX نهجًا مختلفًا، إذ ركزت على البساطة البنيوية والتصميم الخالي من المراسي:
- آلية بلا مراسي: من خلال التنبؤ بإحداثيات مربعات الإحاطة مباشرةً من دون مراسي محددة مسبقًا، تقلل YOLOX عدد معلمات التصميم والحاجة إلى الضبط الاستدلالي.
- رأس منفصل: يفصل مهام التصنيف والانحدار في فروع ميزات مختلفة، ما يحسن سرعة التقارب والدقة الإجمالية.
- إسناد التسميات SimOTA: استراتيجية متقدمة لإسناد التسميات تخصص العينات الإيجابية للقيم المرجعية ديناميكيًا، ما يحسن كفاءة التدريب.
بينما يستخدم DAMO-YOLO عمليات بحث NAS موجّهة آليًا لاكتشاف البنى المثلى ضمن قيود صارمة، تستفيد YOLOX من تبسيطات أنيقة صممها البشر، مثل الرؤوس الخالية من المراسي، لتبسيط مسار عمل الكشف عن الأجسام.
مقارنة الأداء#
يتطلب تقييم هذه النماذج النظر إلى متوسط الدقة (mAP) وسرعات الاستدلال وعدد المعلمات. فيما يلي جدول مقارنة مفصل للإصدارات القياسية والخفيفة من كلتا البنيتين.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
مع أن YOLOXx يحقق أعلى قيمة mAP مطلقة، وهي 51.1، يقدم DAMO-YOLOl قيمة mAP تنافسية للغاية تبلغ 50.8، بأقل من نصف عدد المعلمات (42.1M مقابل 99.1M) وبتنفيذ أسرع بكثير باستخدام TensorRT.
منهجيات التدريب#
تدريب DAMO-YOLO#
يستخدم DAMO-YOLO تعزيزًا معقدًا بالتقطير أثناء التدريب. غالبًا ما يُدرَّب أولًا نموذج "معلّم" كبير، ثم تُقطّر معرفته إلى نماذج "طالبة" أصغر. كما يستخدم AlignedOTA لإسناد التسميات ديناميكيًا. ورغم فعالية هذه العملية العالية، فإن التدريب متعدد المراحل يزيد بدرجة كبيرة زمن الحوسبة على GPU والعبء على الذاكرة.
تدريب YOLOX#
تعتمد YOLOX على استراتيجيات قوية لزيادة البيانات مثل MixUp وMosaic. لكن الباحثين اكتشفوا أن إيقاف هذه الزيادات القوية في آخر 15 حقبة تدريبية يتيح للنموذج تقليص فجوة الواقع، ما يحسن مقاييس الدقة النهائية بدرجة كبيرة.
حالات الاستخدام المثالية#
- DAMO-YOLO: الأنسب لعمليات النشر الصناعية عالية الأهمية التي يمكن دعم مسارات التقطير فيها على الخوادم، والتي تستفيد فيها الأجهزة المستهدفة، مثل وحدات GPU محددة من NVIDIA، مباشرةً من بنية NAS ذات العنق الثقيل.
- YOLOX: خيار ممتاز للمطورين الباحثين عن نهج خالص خالٍ من المراسي. ويتيح صغر حجم
YOLOXnanoاستخدامه على أجهزة Android قديمة والحوسبة الطرفية ومستشعرات إنترنت الأشياء محدودة الموارد للغاية، حيث يكون عدد المعلمات هو العائق الأهم.
ميزة Ultralytics: ظهور YOLO26#
رغم أن DAMO-YOLO وYOLOX يمثلان محطتين بارزتين، يحتاج المطورون اليوم إلى حلول أشمل وأكثر تنوعًا وأسهل استخدامًا. وهنا تتألق منصة Ultralytics وUltralytics YOLO26 الذي طُرح حديثًا.
أُطلق YOLO26 في يناير 2026، وهو النموذج الموصى به على نحو مثالي لجميع مهام الرؤية الحاسوبية. ويقدم مجموعة من الابتكارات التي تتجاوز البنى الأقدم:
- تصميم شامل من البداية إلى النهاية بلا NMS: يتجاوز الرأس الاختياري أحادي المطابقة في YOLO26 (
nms=False) خطوة المعالجة اللاحقة بالكبت غير الأقصى (NMS). وهذا يتيح نشرًا أبسط وأسرع بكثير، مع تفادي اختناقات زمن الاستجابة الملازمة لرؤوس الكشف التقليدية. - استدلال أسرع على CPU بنسبة تصل إلى 43%: من خلال إزالة دالة خسارة البؤرة التوزيعية (DFL) على نحو مدروس وتحسين الطبقات، يحقق YOLO26 سرعات لا مثيل لها على وحدات CPU والأجهزة الطرفية.
- محسّن MuSGD: استنادًا إلى تقنيات تدريب النماذج اللغوية الكبيرة (LLM)، يقدم YOLO26 محسّن MuSGD، وهو مزيج هجين من SGD وMuon، ما يؤدي إلى دورات تدريب مستقرة للغاية وتقارب أسرع بكثير مقارنةً بإعدادات YOLOX القديمة.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، ما يجعل YOLO26 أفضل بكثير لمقاطع الطائرات المسيّرة والروبوتات.
- تعدد الاستخدامات: بخلاف DAMO-YOLO المخصص للكشف عن الأجسام حصرًا، يتعامل YOLO26 بسلاسة وبشكل أصيل مع تجزئة الكائنات وتقدير الوضعية والتصنيف ومربعات الإحاطة الموجّهة (OBB) ضمن منظومة واحدة تحظى بصيانة جيدة.
سهولة الاستخدام مع Ultralytics#
تُبسّط واجهة Ultralytics Python API تجربة المطور. ويتطلب تدريب نموذج YOLO26 متطور قدرًا أقل بكثير من الشيفرة التمهيدية، كما يتجنب مسارات التقطير المعقدة في DAMO-YOLO. علاوةً على ذلك، تتميز نماذج Ultralytics بمتطلبات منخفضة للغاية لذاكرة CUDA أثناء التدريب مقارنةً بالنماذج الثقيلة القائمة على المحوّلات.
from ultralytics import YOLO
# تحميل أحدث نموذج nano من Ultralytics YOLO26
model = YOLO("yolo26n.pt")
# تدريب النموذج على مجموعة بياناتك المخصصة بسطر واحد من الشيفرة
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# تنفيذ استدلال سريع على صورة من دون NMS
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# صدّر إلى ONNX أو TensorRT بسلاسة
model.export(format="onnx")يمكنك إضافة التعليقات التوضيحية تلقائيًا إلى النماذج وتدريبها ونشرها على الأجهزة الطرفية باستخدام منصة Ultralytics، التي تتولى إدارة إصدارات البيانات وتوفير موارد GPU السحابية نيابةً عنك.
الخلاصة#
يعتمد الاختيار بين DAMO-YOLO وYOLOX على القيود المحددة: يوفر DAMO-YOLO نسبًا استثنائية بين السرعة والدقة على وحدات GPU محددة باستخدام NAS، بينما تقدم YOLOX تصميمًا واضحًا خاليًا من المراسي، مثاليًا لسيناريوهات الأجهزة الطرفية خفيفة الوزن.
ومع ذلك، تُعد بنية Ultralytics YOLO26 الخيار الأمثل للفرق الباحثة عن حل حديث ومهيأ للمستقبل، تدعمه مجموعة مجتمعية نشطة. ويجعل الاستدلال الاختياري الخالي من NMS وسرعة الاستدلال على CPU وواجهة API الموحدة لمهام الكشف والتجزئة والوضعية منه خيارًا لا مثيل له للانتقال بسلاسة من البحث إلى إنتاج متين في العالم الحقيقي.
للمطورين المهتمين باستكشاف بنى حديثة أخرى، نوصي أيضًا بالاطلاع على Ultralytics YOLO11 أو النماذج القائمة على المحوّلات مثل RT-DETR المتاحة في وثائق Ultralytics الشاملة.