Ultralytics YOLO27:
Get Started

DAMO-YOLO مقابل RTDETRv2#

أفرز التطور السريع لمجال الرؤية الحاسوبية مجموعة مبهرة من البنى المصممة لتحقيق توازن بين السرعة والدقة والكفاءة الحسابية. ومن النماذج البارزة التي أسهمت بنُهج فريدة في معالجة هذه التحديات DAMO-YOLO وRTDETRv2. وعلى الرغم من سعي كلا النموذجين إلى تقديم حلول متطورة للاستدلال الآني، فإن فلسفتيهما المعماريتين تختلفان اختلافًا جوهريًا.

يتعمق هذا الدليل الشامل في المواصفات التقنية والابتكارات المعمارية وحالات الاستخدام العملية لكلا النموذجين، كما يستكشف كيف أعادت الحلول الحديثة مثل منصة Ultralytics وYOLO26 المتطور تعريف معايير القطاع للنشر وسهولة الاستخدام.

نظرة عامة على النماذج#

التعرف على DAMO-YOLO#

طوّر باحثون في Alibaba Group نموذج DAMO-YOLO، الذي يقدم طريقة سريعة ودقيقة لكشف الأجسام وتعتمد بدرجة كبيرة على البحث عن البنى العصبية (NAS). ويستبدل النموذج الأعمدة الفقرية التقليدية المصممة يدويًا ببنى مولّدة عبر NAS ومنخفضة زمن الاستجابة. كما يدمج شبكة هرم السمات العامة المعاد تمثيلها والفعّالة (RepGFPN) وتصميم ZeroHead لتبسيط تجميع السمات والتنبؤ بالصناديق المحيطة.

تفاصيل النموذج الرئيسية:

اطّلع على مزيد من المعلومات حول DAMO-YOLO

التعرف على RTDETRv2#

يمثل RTDETRv2 من Baidu تقدمًا كبيرًا في محولات الكشف الآني. وعلى خلاف الشبكات العصبية الالتفافية (CNNs) التقليدية التي تعتمد على صناديق المراسي وكبت غير الأعظميات (NMS)، يستخدم RTDETRv2 آليات الانتباه الذاتي لفهم سياق الصورة كاملة. ويخرج الصناديق المحيطة مباشرةً، متجاوزًا كليًا خطوة المعالجة اللاحقة الخاصة بـNMS. كما يقدم النموذج استراتيجية تدريب «مجموعة من المجانيات» لتحسين الدقة الأساسية دون زيادة زمن الاستدلال.

تفاصيل النموذج الرئيسية:

تعرّف على المزيد حول RTDETRv2

اعتماد بنى Transformer في الذكاء الاصطناعي للرؤية

على الرغم من أن بنى Transformer تتطلب موارد حوسبة أكبر، فإن قدرتها على معالجة السياق العام تجعلها فعّالة للغاية في فهم المشاهد المعقدة، وهي من أبرز نقاط قوة RTDETRv2.

مقارنة الأداء#

عند تقييم هذه النماذج للنشر في العالم الواقعي، تكون معلمات مثل متوسط الدقة (mAP) وسرعة الاستدلال وبصمة الذاكرة عوامل حاسمة. وتتطلب النماذج المعتمدة على Transformer، مثل RTDETRv2، عمومًا ذاكرة CUDA أكبر أثناء التدريب والاستدلال مقارنةً بنماذج CNN خفيفة الوزن مثل DAMO-YOLO.

فيما يلي مقارنة مفصلة لمقاييس أدائها.

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

حالات الاستخدام المثالية#

مواضع تميز DAMO-YOLO: بفضل عموده الفقري المحسّن بالبحث عن البنى العصبية (NAS) وعدد معلماته المنخفض للغاية في إصداراته الأصغر (مثل DAMO-YOLOt)، يلائم النموذج النشر على العتاد شديد التقييد. وإذا كنت تبني حلولًا للأجهزة المضمنة باستخدام بيئات تشغيل مثل ONNX أو محركات TensorRT المتخصصة للحوسبة الطرفية، فيوفر DAMO-YOLO إطار عمل عالي الاستجابة.

مواضع تميز RTDETRv2: يتألق RTDETRv2 في السيناريوهات التي تتوفر فيها وحدات GPU بمستوى الخوادم ويكون فيها السياق العام للصورة بالغ الأهمية. وتتيح له بنية Transformer معالجة الصناديق المحيطة المتداخلة طبيعيًا دون NMS، ما يجعله خيارًا موثوقًا لإدارة الحشود الكثيفة أو تتبع الأجسام المعقد، حين تكون العلاقات المكانية بين الأجسام المتباعدة مهمة.

ميزة Ultralytics: تقديم YOLO26#

على الرغم من أن DAMO-YOLO وRTDETRv2 يمثلان إنجازين أكاديميين مهمين، فإن تحويلهما إلى تطبيقات قابلة للتوسع وجاهزة للإنتاج قد يكون صعبًا. فكثيرًا ما يواجه المطورون قواعد شفرات متفرقة، وغياب دعم التعلم متعدد المهام، ومسارات نشر معقدة.

وهنا تتميز منظومة Ultralytics حقًا. فمن خلال إعطاء الأولوية لسهولة الاستخدام وواجهة API بلغة Python تتم صيانتها جيدًا وتعدد استخدامات لا يُضاهى، تضمن Ultralytics أن يقضي المطورون وقتًا أقل في تصحيح الأخطاء ووقتًا أطول في البناء.

يرتقي نموذج Ultralytics YOLO26 الذي أُطلق مؤخرًا بهذه المزايا إلى مستوى جديد، مقدمًا إنجازات تتفوق على كل من DAMO-YOLO وRTDETRv2:

  • تصميم شامل من البداية إلى النهاية بلا NMS: طُرح هذا النهج لأول مرة في YOLOv10، ويوفر YOLO26 رأسًا اختياريًا شاملًا من البداية إلى النهاية (nms=False). يلغي هذا النهج المعالجة اللاحقة باستخدام NMS، ما يجعل النشر أسرع وأبسط بكثير من الشبكات العصبية الالتفافية التقليدية، مع مطابقة مزايا الإخراج المباشر التي يوفرها RTDETRv2.
  • استدلال أسرع على CPU بنسبة تصل إلى 43%: يعمل YOLO26n بسرعة تفوق YOLO11n بنسبة تصل إلى 43% على CPU باستخدام ONNX، وهو محسّن بدرجة كبيرة لـأجهزة الذكاء الاصطناعي الطرفية التي لا تحتوي على وحدات GPU منفصلة، ما يجعله خيارًا أفضل بكثير لتطبيقات إنترنت الأشياء مقارنةً بالمحوّلات كثيفة استهلاك الذاكرة.
  • محسّن MuSGD: استُلهم هذا النهج الهجين من SGD وMuon من Kimi K2 التابع لـMoonshot AI، وينقل ابتكارات تدريب النماذج اللغوية الكبيرة (LLM) إلى الرؤية الحاسوبية، ما يؤدي إلى تدريب مستقر على نحو ملحوظ وتقارب أسرع.
  • ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو مجال تواجه فيه النماذج صعوبات تقليديًا. وهذا أمر بالغ الأهمية لـالصور الجوية وتطبيقات الطائرات المسيّرة.
  • إزالة DFL: أُزيلت دالة خسارة البؤرة التوزيعية لضمان تبسيط تنسيقات التصدير وتحسين التوافق مع الأجهزة الطرفية منخفضة الطاقة.
  • تعدد استخدامات لا يُضاهى: بخلاف النماذج المنافسة التي تقتصر تمامًا على الكشف، يتضمن YOLO26 تحسينات خاصة بكل مهمة على نطاق واسع، مثل خسارة الزاوية المتخصصة لـمربعات الإحاطة الموجّهة (OBB)، وخسارة التجزئة الدلالية لتحقيق دقة على مستوى البكسل، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لـتقدير الوضعية.
كفاءة الذاكرة مهمة

يتطلب تدريب النماذج القائمة على المحوّلات مثل RTDETRv2 تخصيص كميات هائلة من ذاكرة CUDA، ما يستلزم غالبًا إعدادات متعددة وحدات GPU ومكلفة. تحافظ نماذج Ultralytics YOLO على متطلبات ذاكرة أقل بكثير أثناء التدريب والاستدلال، ما يتيح تطوير الذكاء الاصطناعي للباحثين والهواة على حد سواء.

مثال برمجي: واجهة Ultralytics API الموحدة#

من أبرز مزايا منظومة Ultralytics واجهتها الموحدة. يمكنك تحميل مجموعة متنوعة من النماذج وتدريبها والتحقق من صحتها بسلاسة، بما فيها تطبيق RT-DETR في PyTorch وأحدث نماذج YOLO، من دون تغيير سير عملك.

from ultralytics import RTDETR, YOLO

# ⁨تحميل نموذج RT-DETR⁩
model_rtdetr = RTDETR("rtdetr-l.pt")

# ⁨تحميل أحدث طراز YOLO26⁩
model_yolo = YOLO("yolo26n.pt")

# ⁨تنفيذ الاستدلال على صورة باستخدام واجهة موحدة وبسيطة⁩
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# ⁨عرض الكائنات المكتشفة⁩
results_yolo[0].show()

تمتد هذه البساطة إلى تدريب مجموعات البيانات المخصصة والتصدير. وباستخدام حزمة Ultralytics Python، يمكن للمطورين بسهولة إرسال الأوزان المدرّبة إلى منصات النشر مثل CoreML أو OpenVINO باستخدام أمر واحد.

الخلاصة واستكشاف المزيد#

لا شك أن DAMO-YOLO وRTDETRv2 قد دفعا حدود الممكن في الكشف عن الأجسام في الزمن الحقيقي. يوفر DAMO-YOLO هياكل شبكية محسّنة للغاية، تم البحث عنها آليًا لتحقيق الكفاءة الصرفة، بينما يثبت RTDETRv2 قدرة المحوّلات على المنافسة في مجال الزمن الحقيقي من خلال إزالة الاختناقات التقليدية مثل NMS.

ومع ذلك، يظل Ultralytics YOLO models الخيار المعياري الأمثل للمطورين الباحثين عن أفضل توازن بين الأداء والتوثيق الشامل والجاهزية للإنتاج. ومع طرح YOLO26، يحصل المستخدمون على إمكانية استخدام الكشف الاختياري الشامل من البداية إلى النهاية المشابه للمحوّلات، وكفاءة التدريب المستوحاة من LLM، وسرعات CPU لا مثيل لها، وكل ذلك ضمن منظومة سهلة الاستخدام ومتينة.

إذا كنت تقيّم النماذج لمشروعك التالي، فقد تجد فائدة أيضًا في قراءة مقارناتنا بين EfficientDet وRT-DETR، أو استكشاف الجيل السابق YOLO11، أو مراجعة خطوط الأساس الأكاديمية مثل YOLOX. ابدأ البناء اليوم بالاطلاع على دليل البدء السريع من Ultralytics.

التعليقات