رؤية YOLO 2026:

DAMO-YOLO مقابل RTDETRv2#

أنتج المشهد سريع التطور للرؤية الحاسوبية مجموعة رائعة من البنى المصممة لتحقيق التوازن بين السرعة والدقة والكفاءة الحسابية. ومن أبرز النماذج التي ساهمت بأساليب فريدة لحل هذه التحديات هما DAMO-YOLO و RTDETRv2. وبينما يهدف كلا النموذجين إلى توفير حلول متطورة للاستنتاج في الوقت الفعلي، فإنهما يختلفان جوهرياً في فلسفتهما المعمارية.

يتعمق هذا الدليل الشامل في المواصفات التقنية، والابتکارات المعمارية، وحالات الاستخدام العملية لكلا النموذجين، مع استكشاف كيف أعادت الحلول الحديثة مثل Ultralytics Platform وYOLO26 المتطور تعريفه لمعايير الصناعة الخاصة بالنشر وسهولة الاستخدام.

نظرة عامة على النماذج#

فهم نموذج DAMO-YOLO#

طوّر باحثون في Alibaba Group نموذج DAMO-YOLO، الذي يقدم طريقة سريعة ودقيقة لاكتشاف الأشياء تعتمد بشكل كبير على البحث في بنية الشبكة العصبية (NAS). حيث يستبدل الهياكل الأساسية التقليدية المصممة يدوياً بهياكل تم إنشاؤها بواسطة NAS ومصممة لتحقيق زمن انتقال منخفض. بالإضافة إلى ذلك، فهو يدمج RepGFPN (شبكة هرمية ميزات معممة معاد برمجتها) وتصميم ZeroHead لتبسيط تجميع الميزات وتوقعات مربع الإحاطة (bounding box).

تفاصيل النموذج الرئيسية:

اعرف المزيد عن DAMO-YOLO

فهم نموذج RTDETRv2#

يمثل نموذج RTDETRv2 من Baidu قفزة كبيرة لنماذج محولات الاكتشاف في الوقت الفعلي (Real-Time Detection Transformers). وعلى عكس الشبكات العصبية التلافيفية التقليدية (CNNs) التي تعتمد على مربعات الارتساء (anchor boxes) و NMS، يستخدم RTDETRv2 آليات الانتباه الذاتي لرؤية سياق الصورة بالكامل. وهو يخرج مربعات الإحاطة مباشرة، متجاوزاً بذلك خطوة ما بعد المعالجة NMS تماماً. يقدم هذا النموذج استراتيجية تدريب "مجموعة الهدايا المجانية" (bag of freebies) لتحسين الدقة الأساسية دون زيادة زمن انتقال الاستنتاج.

تفاصيل النموذج الرئيسية:

اعرف المزيد عن RTDETRv2

تبني المحولات (Transformers) في ذكاء الرؤية الاصطناعي

على الرغم من أن المحولات تتطلب موارد حسابية أعلى، إلا أن قدرتها على معالجة السياق العالمي تجعلها فعالة للغاية لفهم المشاهد المعقدة، وهي نقطة قوة رئيسية لنموذج RTDETRv2.

مقارنة الأداء#

عند تقييم هذه النماذج للنشر في العالم الحقيقي، تعد معايير مثل متوسط الدقة (mAP)، وسرعة الاستنتاج، والبصمة الذاكرية أموراً بالغة الأهمية. تتطلب النماذج القائمة على المحولات مثل RTDETRv2 عموماً ذاكرة CUDA أعلى أثناء التدريب والاستنتاج مقارنة بالشبكات العصبية التلافيفية خفيفة الوزن مثل DAMO-YOLO.

فيما يلي مقارنة تفصيلية لمقاييس أدائهما.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

حالات الاستخدام المثالية#

حيث يتألق نموذج DAMO-YOLO: نظرًا لهيكله الأساسي المحسّن بواسطة NAS وعدد المعاملات المنخفض بشكل استثنائي في متغيراته الأصغر (مثل DAMO-YOLOt)، فهو مناسب للغاية للنشر على الأجهزة المقيدة بشدة. إذا كنت تبني حلولاً للأجهزة المدمجة باستخدام بيئات التشغيل مثل ONNX أو محركات TensorRT المخصصة للحوسبة الطرفية، فإن DAMO-YOLO يوفر إطار عمل سريع الاستجابة للغاية.

حيث يتألق نموذج RTDETRv2: يتألق RTDETRv2 في السيناريوهات التي تتوفر فيها وحدات معالجة رسومية (GPU) بمستوى الخوادم وتكون فيها سياق الصورة العالمي ذات أهمية قصوى. تسمح هندسة المحولات (Transformer) الخاصة به بحل صناديق التقييد المتداخلة بشكل طبيعي بدون NMS، مما يجعله خيارًا قويًا لـ crowd management المكثف أو object tracking المعقد حيث تكون العلاقات المكانية بين الأجسام البعيدة حاسمة.

ميزة Ultralytics: تقديم YOLO26#

على الرغم من أن DAMO-YOLO و RTDETRv2 يمثلان إنجازات أكاديمية كبيرة، إلا أن تحويل هذه النماذج إلى تطبيقات قابلة للتوسع وجاهزة للإنتاج قد يكون أمراً صعباً. وغالباً ما يواجه المطورون قواعد تعليمات برمجية مجزأة، ونقصاً في دعم التعلم متعدد المهام، وخطوط أنابيب نشر معقدة.

وهنا يبرز Ultralytics ecosystem حقًا ويتميز عن غيره. من خلال إعطاء الأولوية سهولة الاستخدام، وواجهة برمجة تطبيقات Python التي يتم صيانتها جيدًا، والتنوع الذي لا يُعارض، يضمن Ultralytics قضاء المطورين وقتًا أقل في تصحيح الأخطاء ووقتًا أطول في البناء.

ينقل نموذج Ultralytics YOLO26 الذي تم إصداره مؤخراً هذه المزايا إلى المستوى التالي، حيث يقدم اختراقات تتفوق على كل من DAMO-YOLO و RTDETRv2:

  • تصميم متكامل خالٍ من NMS: ريادي في الأصل في YOLOv10، فإن YOLO26 متكامل بشكل طبيعي من البداية إلى النهاية. هذا يلغي تمامًا معالجة ما بعد NMS، مما يجعل النشر أسرع وأبسط بكثير مقارنة بـ CNNs التقليدية، مع مطابقة فوائد الإخراج المباشر لـ RTDETRv2.
  • استدلال أسرع بنسبة تصل إلى 43% على وحدة المعالجة المركزية (CPU): محسن بشكل كبير لأجهزة edge AI devices بدون وحدات معالجة رسومية منفصلة، مما يجعله خيارًا متفوقًا بشكل كبير لتطبيقات إنترنت الأشياء (IoT) مقارنة بالمحولات الثقيلة على الذاكرة.
  • محسن MuSGD: مستوحى من Kimi K2 لشركة Moonshot AI، يجلب هذا المزيج من SGD و Muon ابتكارات تدريب نماذج اللغة الكبيرة (LLM) إلى الرؤية الحاسوبية، مما يؤدي إلى تدريب مستقر بشكل ملحوظ وتقارب أسرع.
  • ProgLoss + STAL: تقدم هذه الدوال المتقدمة للخسارة تحسينات ملحوظة في التعرف على الأجسام الصغيرة، وهو مجال تعاني فيه النماذج تقليديًا. هذا أمر بالغ الأهمية لـ aerial imagery وتطبيقات الطائرات بدون طيار.
  • إزالة DFL: تمت إزالة Distribution Focal Loss لضمان تبسيط تنسيقات التصدير وتوافق أفضل مع أجهزة الحافة منخفضة الطاقة.
  • تنوع لا يُنافس: على عكس النماذج المنافسة المقتصرة بدقة على الاكتشاف، يتضمن YOLO26 تحسينات خاصة بالمهمة على طول الخط، مثل خسارة الزاوية المخصصة لـ Oriented Bounding Boxes (OBB)، وخسارة التجزئة الدلالية للحصول على دقة بكسل مثالية، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لـ Pose estimation.

تعرف على المزيد حول YOLO26

كفاءة الذاكرة مهمة

يتطلب تدريب النماذج القائمة على المحولات مثل RTDETRv2 تخصيصات هائلة لذاكرة CUDA، مما يستلزم غالباً إعدادات مكلفة متعددة وحدات معالجة الرسوميات. تحافظ نماذج Ultralytics YOLO على متطلبات ذاكرة أقل بشكل ملحوظ أثناء التدريب والاستنتاج، مما يضفي طابعاً ديمقراطياً على تطوير الذكاء الاصطناعي للباحثين والهواة على حد سواء.

مثال برمجي: واجهة برمجة التطبيقات الموحدة من Ultralytics#

واحدة من أعظم فوائد نظام Ultralytics البيئي هي واجهة برمجة التطبيقات الموحدة (Unified API). يمكنك تحميل وتدريب والتحقق من صحة مجموعة متنوعة من النماذج بسلاسة - بما في ذلك تنفيذ PyTorch لـ RTDETR ونماذج YOLO الحديثة - دون تغيير سير عملك.

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the cutting-edge YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image with a simple, unified interface
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the detected objects
results_yolo[0].show()

تمتد هذه البساطة لتشمل custom dataset training والتصدير. باستخدام حزمة Ultralytics Python package، يمكن للمطورين بسهولة دفع الأوزان المدربة الخاصة بهم إلى منصات النشر مثل CoreML أو OpenVINO باستخدام أمر واحد.

الخاتمة والمزيد من الاستكشاف#

لقد دفع كل من DAMO-YOLO و RTDETRv2 بلا شك حدود ما هو ممكن في اكتشاف الأشياء في الوقت الفعلي. يوفر DAMO-YOLO هياكل شبكة محسنة للغاية ومبحوثة تلقائياً لتحقيق كفاءة خام، بينما يثبت RTDETRv2 أن المحولات يمكنها المنافسة في مساحة الوقت الفعلي عن طريق القضاء على الاختناقات التقليدية مثل NMS.

ومع ذلك، بالنسبة للمطورين الذين يبحثون عن التوازن النهائي للأداء، والتوثيق الشامل، وجاهزية الإنتاج، تظل نماذج Ultralytics YOLO هي المعيار الذهبي. مع تقديم YOLO26، يحصل المستخدمون على وصول إلى اكتشاف متكامل يشبه المحولات، وكفاءة تدريب مستوحاة من LLM، وسرعات CPU لا مثيل لها - كل ذلك مغلف ضمن نظام بيئي بديهي وقوي.

إذا كنت تقيم النماذج لمشروعك القادم، فقد تجد أيضًا قيمة في قراءة مقارناتنا بين EfficientDet vs RTDETR، أو استكشاف الجيل السابق YOLO11، أو مراجعة الأساسيات الأكاديمية مثل YOLOX. ابدأ البناء اليوم من خلال استكشاف Ultralytics quickstart guide.

التعليقات