رؤية YOLO 2026:

مقارنة بين RTDETRv2 و DAMO-YOLO#

مشهد الرؤية الحاسوبية يتطور باستمرار، حيث يسعى الباحثون والمهندسون لبناء نماذج توازن بشكل مثالي بين السرعة والدقة والكفاءة. وهناك بنيتان بارزتان حققتا أصداء واسعة في هذا المجال هما RTDETRv2، التي تطورها شركة Baidu، وDAMO-YOLO، التي صممتها مجموعة Alibaba. كلا النموذجين يدفعان حدود اكتشاف الكائنات في الوقت الفعلي، ومع ذلك فإنهما يعتمدان فلسفات بنيوية مختلفة تماماً لتحقيق نتائجهما المذهلة.

في هذه المقارنة التقنية، سنتعمق في بنياتها، ومنهجيات تدريبها، وقدرات نشرها في العالم الحقيقي. سنستكشف أيضاً كيف تتناسب هذه النماذج مع النظام البيئي الأوسع، ولا سيما منصة Ultralytics عالية التحسين وبنية YOLO26 المتطورة.

الابتكارات المعمارية#

إن فهم الآليات الأساسية لهذه النماذج أمر بالغ الأهمية لـمهندسي التعلم الآلي المكلفين باختيار الأداة المناسبة لبيئات الإنتاج.

RTDETRv2: نهج الـ Transformer#

بناءً على نجاح الإصدار الأصلي RT-DETR، تستخدم RTDETRv2 مشفرًا هجينًا ومفكك ترميز المحولات (transformer decoder). يتيح هذا التصميم للنموذج معالجة السياق العالمي بفعالية عالية، مما يجعله بارعاً بشكل استثنائي في التمييز بين الكائنات المتداخلة في المشاهد المزدحمة. وتكمن الميزة الأهم لهذه البنية في تصميمها الأصلي الخالي من كبح الحد الأقصى غير الضروري (NMS). ومن خلال القضاء على خطوة المعالجة اللاحقة لـ NMS، تبسط RTDETRv2 خط أنابيب الاستدلال وتضمن زمن انتقال أكثر استقراراً عبر تكوينات الأجهزة المختلفة.

اعرف المزيد عن RTDETRv2

DAMO-YOLO: تعزيز كفاءة الشبكات العصبية التلافيفية (CNN)#

من ناحية أخرى، تظل DAMO-YOLO متجذرة في سلالة YOLO الناجحة القائمة على الشبكات العصبية التلافيفية (CNN)، ولكنها تقدم العديد من التحسينات الرائدة. وهي تستفيد من البحث الهيكلي العصبي (NAS) لتحسين هيكلها الأساسي، مما يضمن أقصى كفاءة لاستخراج الميزات. علاوة على ذلك، فهي تدمج شبكة هرمية للميزات المعممة المُعاد صياغتها بكفاءة RepGFPN وتصميم ZeroHead، إلى جانب تقنيات AlignedOTA وتحسين التقطير. تتيح هذه الابتكارات لـ DAMO-YOLO تحقيق سرعات استدلال سريعة مع الحفاظ على درجة mAPval تنافسية للغاية.

اعرف المزيد عن DAMO-YOLO

التباعد المعماري

بينما تركز RTDETRv2 على الاستفادة من آليات الانتباه لفهم الميزات العالمية بدون NMS، تعمل DAMO-YOLO على زيادة كفاءة CNN التقليدية إلى الحد الأقصى من خلال NAS والتقطير المتقدم، مما يتطلب معالجة لاحقة قياسية ولكنه يوفر مزايا سرعة متميزة على أجهزة معينة.

مقارنة الأداء والمقاييس#

عند تقييم النماذج للنشر، تكون مقاييس الأداء مثل متوسط الدقة (mAP)، وسرعة الاستدلال، وعدد المعلمات أمراً بالغ الأهمية. تجدون أدناه مقارنة مفصلة بين عائلتي النموذجين.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

تحليل النتائج#

كما يتضح من الجدول، تحقق RTDETRv2-x أعلى دقة بفضل درجة mAPval البالغة 54.3، مما يبرز قوة بنية المحولات على عمليات التحقق المعقدة مثل مجموعة بيانات COCO. ومع ذلك، يأتي هذا على حساب عدد معلمات أعلى بكثير (76 مليون) وعمليات فاصلة عائمة (FLOPs).

على العكس من ذلك، تعد DAMO-YOLOt (الصغيرة) خفيفة الوزن بشكل استثنائي، حيث تتطلب 8.5 مليون معلمة فقط، مما يجعلها خياراً سريعاً للغاية للبيئات التي تكون فيها ذاكرة CUDA مقيدة بشدة. توفر DAMO-YOLO عموماً مقايضة مواتية بين السرعة والدقة لأجهزة الحافة القديمة.

النظام البيئي، وسهولة الاستخدام، وميزة Ultralytics#

في حين أن المستودعات المستقلة مثل مستودع RT-DETR الرسمي على GitHub ومستودع DAMO-YOLO على GitHub توفر الشفرة البرمجية الخام لتدريب هذه النماذج، فإن دمجها في خطوط الإنتاج يتطلب غالباً شفرة نمطية مكثفة وتحسينًا يدويًا.

وهنا يأتي دور نظام Ultralytics البيئي الذي يبسط تجربة المطورين بشكل جذري. تدمج Ultralytics نماذج مثل RTDETRv2 مباشرة في واجهة برمجة التطبيقات الموحدة الخاصة بها، مما يسمح للمستخدمين بتدريب النماذج والتحقق منها وتصديرها بسطر واحد من التعليمات البرمجية. علاوة على ذلك، تشتهر نماذج Ultralytics بمتطلبات ذاكرتها الضئيلة أثناء التدريب مقارنة بمستودعات المحولات الثقيلة المستقلة.

مثال على الكود: تكامل سلس#

إليك مدى سهولة الاستفادة من مكتبة Ultralytics بلغة Python لتشغيل الاستدلال. تظل واجهة برمجة التطبيقات متسقة سواء كنت تستخدم نموذج Transformer أو نموذج CNN متطور.

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")

# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Display the results
results_yolo[0].show()
تصدير النماذج للإنتاج

باستخدام واجهة برمجة تطبيقات Ultralytics، يمكنك بسلاسة تصدير نماذجك المدربة إلى تنسيقات مثل TensorRT أو ONNX أو CoreML باستخدام أمر بسيط model.export(format="engine")، مما يقلل بشكل جذري من صعوبات النشر.

حالات الاستخدام المثالية#

يعتمد الاختيار بين هذه المعماريات كلياً على متطلبات مشروعك المحددة:

  • تتألق RTDETRv2 في المعالجة من جانب الخادم حيث تتوفر ذاكرة الفيديو (VRAM) بكثرة. ويعد إدراكها للسياق العالمي مثالياً لـالتصوير الطبي وتحليل الحشود الكثيفة حيث تتكرر حالات الحجب.
  • تعد DAMO-YOLO مناسبة للغاية لـتطبيقات إنترنت الأشياء المدمجة خطوط الفحص الصناعي سريع الحركة حيث تكون أعداد المعلمات المنخفضة ومعدلات الإطارات العالية (FPS) متطلبات صارمة.

المستقبل: Ultralytics YOLO26#

في حين أن لكل من RTDETRv2 وDAMO-YOLO مزاياهما، إلا أن مجال الرؤية الحاسوبية يتقدم بسرعة. وبالنسبة للمشاريع الجديدة، فإن أحدث إصدار Ultralytics YOLO26 يمثل التوليف النهائي للسرعة والدقة وتجربة المطورين.

تتبنى YOLO26 تصميمًا خاليًا من NMS من البداية إلى النهاية، مستحوذة على الفائدة الأساسية للمحولات دون العبء الحسابي الهائل. وهي تدمج محسن MuSGD المبتكر - المستوحى من تدريب نماذج اللغات الكبيرة - من أجل تقارب مستقر وسريع. علاوة على ذلك، مع إزالة DFL (إتم إزالة خسارة التمرير البؤري لتصدير أبسط وتوافق أفضل مع الأجهزة الطرفية والأجهزة منخفضة الطاقة)، تحقق YOLO26 ما يصل إلى استدلال أسرع بنسبة 43% على وحدة المعالجة المركزية (CPU)، مما يجعلها البطل بلا منازع لـالحوسبة الطرفية. بالإضافة إلى ذلك، توفر ProgLoss + STAL دوال خسارة محسنة مع تحسينات ملحوظة في التعرف على الكائنات الصغيرة، وهو أمر بالغ الأهمية لإنترنت الأشياء، والروبوتات، والاصطوار الجوي.

على عكس النماذج المقتصرة حصرياً على مربعات الإحاطة، توفر عائلة YOLO26 تنوعاً لا مثيل له، حيث تدعم مهام تتراوح من تجزئة المثيلات وتقدير الوضعية إلى مربعات الإحاطة الموجهة (OBB)، وكلها تُدَار بسلاسة تامة من خلال منصة Ultralytics البديهية.

استكشف YOLO26 على المنصة

تفاصيل النموذج والمراجع#

RTDETRv2#

  • المؤلفون: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, و Yi Liu
  • المنظمة: Baidu
  • التاريخ: 24-07-2024
  • Arxiv: 2407.17140
  • GitHub: مستودع RT-DETR

DAMO-YOLO#

للمستخدمين المهتمين باستكشاف مقارنات أخرى، تحقق من أدلتنا حول مقارنة RTDETRv2 و YOLO11 أو مقارنة DAMO-YOLO و YOLOv8 لمعرفة كيف أداء هذه النماذج مقابل الأجيال السابقة من عائلة Ultralytics.

التعليقات