Ultralytics YOLO27:

DAMO-YOLO مقابل RTDETRv2#

أفرز المشهد سريع التطور في مجال الرؤية الحاسوبية مجموعة مذهلة من البنى المصممة لتحقيق توازن بين السرعة والدقة والكفاءة الحسابية. ومن بين النموذجين البارزين اللذين قدّما نهجين فريدين للتعامل مع هذه التحديات DAMO-YOLO وRTDETRv2. وبينما يهدف كلا النموذجين إلى تقديم حلول متقدمة للاستدلال في الزمن الحقيقي، فإنهما يختلفان اختلافًا جوهريًا في فلسفتيهما المعماريتين.

يتعمق هذا الدليل الشامل في المواصفات التقنية والابتكارات المعمارية وحالات الاستخدام العملية لكلا النموذجين، كما يستكشف كيف أعادت الحلول الحديثة مثل منصة Ultralytics وYOLO26 المتطور تعريف معايير الصناعة للنشر وسهولة الاستخدام.

نظرة عامة على النماذج#

فهم DAMO-YOLO#

طوّر باحثون في مجموعة Alibaba نموذج DAMO-YOLO، الذي يقدّم طريقة سريعة ودقيقة لاكتشاف الأجسام تعتمد بدرجة كبيرة على البحث عن البنية العصبية (NAS). ويستبدل النماذج الأساسية التقليدية المصممة يدويًا ببنى مولّدة بواسطة NAS ومصممة لتحقيق زمن استجابة منخفض. بالإضافة إلى ذلك، يدمج شبكة هرمية فعّالة للميزات RepGFPN (شبكة هرمية معمّمة للميزات مع إعادة المعلمة) وتصميم ZeroHead لتبسيط تجميع الميزات والتنبؤات بمربعات الإحاطة.

تفاصيل النموذج الأساسية:

تعرف على المزيد حول DAMO-YOLO

فهم RTDETRv2#

يمثّل RTDETRv2 من Baidu قفزة كبيرة في محولات الكشف في الزمن الحقيقي. وعلى خلاف الشبكات العصبية الالتفافية التقليدية (CNNs) التي تعتمد على مربعات الارتساء والقمع غير الأقصى (NMS)، يستخدم RTDETRv2 آليات الانتباه الذاتي لعرض سياق الصورة بالكامل بصورة سياقية. ويُخرج مربعات الإحاطة مباشرةً، متجاوزًا تمامًا خطوة المعالجة اللاحقة الخاصة بـ NMS. ويقدّم هذا النموذج استراتيجية تدريب تُعرف باسم «حزمة المزايا المجانية» لتحسين الدقة الأساسية من دون زيادة زمن الاستدلال.

تفاصيل النموذج الأساسية:

تعرّف على المزيد حول RTDETRv2

اعتماد المحولات في الذكاء الاصطناعي للرؤية

رغم أن المحولات تتطلب موارد حسابية أكبر، فإن قدرتها على معالجة السياق العام تجعلها فعّالة للغاية في فهم المشاهد المعقدة، وهو ما يمثّل نقطة قوة رئيسية في RTDETRv2.

مقارنة الأداء#

عند تقييم هذه النماذج للنشر في العالم الحقيقي، تُعد معلمات مثل متوسط الدقة (mAP) وسرعة الاستدلال وبصمة الذاكرة عوامل حاسمة. وتتطلب النماذج القائمة على المحولات مثل RTDETRv2 عمومًا ذاكرة CUDA أكبر أثناء التدريب والاستدلال مقارنةً بالشبكات العصبية الالتفافية خفيفة الوزن مثل DAMO-YOLO.

فيما يلي مقارنة مفصلة لمقاييس أدائهما.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

حالات الاستخدام المثالية#

مواطن تميّز DAMO-YOLO: بفضل نموذجه الأساسي المحسّن باستخدام NAS وعدد معلماته المنخفض للغاية في إصداراته الأصغر (مثل DAMO-YOLOt)، يناسب هذا النموذج بدرجة كبيرة النشر على الأجهزة ذات القيود الشديدة. وإذا كنت تبني حلولًا للأجهزة المضمّنة باستخدام أُطر تشغيل مثل ONNX أو محركات TensorRT المتخصصة للحوسبة الطرفية، فإن DAMO-YOLO يوفّر إطارًا عالي الاستجابة.

مواطن تميّز RTDETRv2: يتألق RTDETRv2 في السيناريوهات التي تتوفر فيها وحدات GPU بمستوى الخوادم ويكون السياق العام للصورة بالغ الأهمية. وتتيح له بنيته المعتمدة على المحولات معالجة مربعات الإحاطة المتداخلة طبيعيًا من دون NMS، ما يجعله خيارًا قويًا لـإدارة الحشود أو تتبّع الأجسام المعقد، حيث تكون العلاقات المكانية بين الأجسام المتباعدة بالغة الأهمية.

ميزة Ultralytics: تقديم YOLO26#

رغم أن DAMO-YOLO وRTDETRv2 يمثّلان إنجازين أكاديميين مهمين، فإن تحويل هذين النموذجين إلى تطبيقات قابلة للتوسع وجاهزة للإنتاج قد يكون صعبًا. فكثيرًا ما يواجه المطورون قواعد شيفرة مجزأة، وغياب دعم التعلم متعدد المهام، وخطوط نشر معقدة.

وهنا تتميز منظومة Ultralytics بحق. فمن خلال إعطاء الأولوية لسهولة الاستخدام، وتوفير واجهة برمجة تطبيقات Python جيدة الصيانة، وتعدد الاستخدامات الذي لا يُضاهى، تضمن Ultralytics أن يقضي المطورون وقتًا أقل في تصحيح الأخطاء ووقتًا أطول في البناء.

يرتقي نموذج Ultralytics YOLO26 الذي أُطلق حديثًا بهذه المزايا إلى مستوى أعلى، إذ يقدّم إنجازات تتفوق على كل من DAMO-YOLO وRTDETRv2:

  • تصميم شامل من البداية إلى النهاية بلا NMS: طُوّر هذا النهج في الأصل في YOLOv10، ويعمل YOLO26 أصلاً من البداية إلى النهاية. ويزيل ذلك تمامًا المعالجة اللاحقة الخاصة بـ NMS، ما يجعل النشر أسرع وأبسط بكثير من الشبكات العصبية الالتفافية التقليدية، مع الحفاظ على مزايا الإخراج المباشر التي يوفّرها RTDETRv2.
  • استدلال أسرع بنسبة تصل إلى 43% على CPU: جرى تحسينه بدرجة كبيرة لأجهزة الذكاء الاصطناعي الطرفية التي لا تحتوي على وحدات GPU منفصلة، ما يجعله خيارًا أفضل بكثير لتطبيقات إنترنت الأشياء مقارنةً بالمحولات كثيفة استهلاك الذاكرة.
  • مُحسِّن MuSGD: مستوحى من Kimi K2 من Moonshot AI، يجمع هذا المُحسِّن الهجين بين SGD وMuon، وينقل ابتكارات تدريب نماذج اللغة الكبيرة (LLM) إلى مجال الرؤية الحاسوبية، ما يؤدي إلى تدريب مستقر بصورة ملحوظة وتقارب أسرع.
  • ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو مجال تواجه فيه النماذج صعوبات تقليدية. ويكتسب ذلك أهمية حاسمة في الصور الجوية وتطبيقات الطائرات المسيّرة.
  • إزالة DFL: أُزيلت خسارة البؤرة التوزيعية لضمان تبسيط صيغ التصدير وتحسين التوافق مع الأجهزة الطرفية منخفضة الطاقة.
  • تعدد استخدامات لا يُضاهى: على خلاف النماذج المنافسة المحدودة بالكشف فقط، يتضمن YOLO26 تحسينات خاصة بكل مهمة على نطاق واسع، مثل خسارة الزاوية المتخصصة لـمربعات الإحاطة الموجّهة (OBB)، وخسارة التجزئة الدلالية لتحقيق دقة على مستوى البكسل، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) من أجل تقدير الوضعية.
كفاءة الذاكرة مهمة

يتطلب تدريب النماذج القائمة على المحولات مثل RTDETRv2 تخصيصات هائلة من ذاكرة CUDA، وغالبًا ما يستلزم إعدادات متعددة وحدات GPU ومكلفة. وتحافظ نماذج Ultralytics YOLO على متطلبات ذاكرة أقل بكثير أثناء التدريب والاستدلال على حد سواء، ما يتيح تطوير الذكاء الاصطناعي للباحثين والهواة على نطاق أوسع.

مثال على الشيفرة: واجهة برمجة تطبيقات Ultralytics الموحّدة#

تعد واجهة البرمجة التطبيقية الموحدة إحدى أعظم مزايا نظام Ultralytics البيئي. يمكنك تحميل النماذج وتدريبها والتحقق من صحتها بسلاسة—بما في ذلك تنفيذ PyTorch لنموذج RT-DETR ونماذج YOLO الحديثة—دون تغيير سير عملك.

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the cutting-edge YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image with a simple, unified interface
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the detected objects
results_yolo[0].show()

تمتد هذه البساطة إلى تدريب مجموعات البيانات المخصصة وتصديرها. وباستخدام حزمة Ultralytics لـ Python، يستطيع المطورون بسهولة دفع أوزانهم المدرّبة إلى منصات النشر مثل CoreML أو OpenVINO باستخدام أمر واحد.

الخلاصة والاستكشاف الإضافي#

لقد دفع كل من DAMO-YOLO وRTDETRv2 بلا شك حدود ما يمكن تحقيقه في اكتشاف الأجسام في الزمن الحقيقي. إذ يوفّر DAMO-YOLO بنى شبكية محسّنة للغاية ومُكتشفة آليًا لتحقيق الكفاءة الخام، بينما يثبت RTDETRv2 قدرة المحولات على المنافسة في مجال الزمن الحقيقي من خلال إزالة الاختناقات التقليدية مثل NMS.

ومع ذلك، بالنسبة إلى المطورين الذين يبحثون عن التوازن الأمثل بين الأداء والتوثيق الشامل والجاهزية للإنتاج، تظل نماذج Ultralytics YOLO المعيار الذهبي. ومع طرح YOLO26، يحصل المستخدمون على كشف شامل من البداية إلى النهاية شبيه بالمحولات، وكفاءة تدريب مستوحاة من LLM، وسرعات CPU لا مثيل لها —وكل ذلك ضمن منظومة سهلة الاستخدام ومتينة.

إذا كنت تقيم نماذج لمشروعك القادم، فقد تجد فوائد أيضاً في قراءة مقارناتنا بين EfficientDet vs RT-DETR، أو استكشاف الجيل السابق YOLO11، أو مراجعة الأساسيات الأكاديمية مثل YOLOX. ابدأ البناء اليوم من خلال استكشاف دليل البدء السريع لـ Ultralytics.

التعليقات