Ultralytics YOLO27:

RTDETRv2 مقابل YOLO26#

شهد مجال اكتشاف الأجسام في الوقت الفعلي تطورًا هائلًا، إذ يواصل الباحثون دفع حدود السرعة والدقة وكفاءة النشر. ومن أبرز البنى التي تقود هذا التقدم حاليًا البنية المعتمدة على Transformer، RTDETRv2، وشبكة عصبية التفافية متطورة (CNN)، وهي Ultralytics YOLO26. يقدم هذا الدليل تحليلًا معمقًا لبنيتهما ومقاييس أدائهما وحالات الاستخدام المثالية، لمساعدتك على اختيار النموذج المناسب لمشروع الرؤية الحاسوبية التالي.

RTDETRv2: محولات الكشف في الوقت الفعلي#

تستند RTDETRv2 إلى بنية RT-DETR الأصلية، وتهدف إلى الجمع بين الوعي بالسياق الشامل الذي توفره محولات الرؤية والسرعة اللازمة للتطبيقات في الوقت الفعلي.

الخصائص الرئيسية:

  • المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
  • المنظمة: Baidu
  • التاريخ: 2024-07-24
  • الروابط: Arxiv، GitHub، المستندات

البنية ونقاط القوة#

بخلاف كاشفات الأجسام التقليدية المعتمدة على المراسي، تستفيد RTDETRv2 من نهج قائم على Transformer يلغي بطبيعته الحاجة إلى قمع غير الأعظمي (NMS) أثناء المعالجة اللاحقة. ومن خلال استخدام آلية انتباه مرنة، يتميز النموذج بفاعلية كبيرة في فهم المشاهد المعقدة والأجسام المتداخلة. وقد حسّنت تحسينات "Bag-of-Freebies" دقته بدرجة كبيرة على مجموعة بيانات COCO، مع الحفاظ على سرعات استدلال مقبولة على وحدات GPU المتطورة.

القيود#

على الرغم من أن RTDETRv2 تحقق نتائج أكاديمية مثيرة للإعجاب، فإنها غالبًا ما تفرض تحديات في بيئات الإنتاج. إذ تتطلب بنيات Transformer بطبيعتها استخدامًا أكبر للذاكرة أثناء التدريب والاستدلال مقارنةً ببنى CNN. وقد يجعل ذلك نشرها على أجهزة الذكاء الاصطناعي الطرفي محدودة الموارد أمرًا صعبًا. بالإضافة إلى ذلك، يتطلب تدريب Transformer عادةً أحجام دفعات أكبر وذاكرة CUDA أكثر، ما قد يشكل عنق زجاجة للباحثين ذوي العتاد المحدود.

تعرّف على المزيد حول RTDETRv2

YOLO26: ذروة الذكاء الاصطناعي للرؤية أولًا على الحافة#

صدر Ultralytics YOLO26 في أوائل عام 2026، ويعيد تعريف ما يمكن تحقيقه باستخدام اكتشاف الأجسام القائم على CNN. ويتضمن تحسينات متطورة مصممة خصيصًا للنشر السلس في بيئات الإنتاج ولتحقيق كفاءة قصوى في استخدام العتاد.

الخصائص الرئيسية:

اختراقات معمارية#

يقدم YOLO26 العديد من الميزات الثورية التي تعالج نقاط الألم الشائعة في نشر النماذج:

  • تصميم شامل من البداية وخالٍ من NMS: استنادًا إلى المفاهيم التي ابتكرتها YOLOv10، يعمل YOLO26 بطبيعته وفق نهج شامل من البداية إلى النهاية. ومن خلال إزالة المعالجة اللاحقة لـ NMS، يقلل بدرجة كبيرة من تباين زمن الاستجابة، ما يضمن أزمنة استدلال قابلة للتنبؤ بدرجة عالية في بيئات الإنتاج.
  • استدلال على CPU أسرع بنسبة تصل إلى 43%: من خلال تحسينات معمارية استراتيجية وإزالة خسارة البؤرة للتوزيع (DFL)، يحقق YOLO26 سرعات غير مسبوقة على CPU، ما يجعله الخيار الأبرز للحوسبة الطرفية من دون وحدات GPU مخصصة.
  • مُحسِّن MuSGD: مستلهمًا من تقنيات تدريب النماذج اللغوية الكبيرة (LLM)، مثل Kimi K2 من Moonshot AI، يستخدم YOLO26 مُحسِّن MuSGD، وهو مزيج هجين من SGD وMuon. ويضمن ذلك عمليات تدريب مستقرة للغاية وتقاربًا سريعًا بصورة استثنائية.
  • ProgLoss + STAL: توفر دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو تحديث أساسي للتطبيقات التي تتضمن الصور الجوية والمراقبة المعتمدة على الطائرات المسيّرة.
تحسينات خاصة بالمهام في YOLO26

إلى جانب الكشف القياسي، يتضمن YOLO26 تحسينات متخصصة: خسارة التقسيم الدلالي وproto متعدد المقاييس لمهام التقسيم، وتقدير الاحتمال اللوغاريتمي المتبقي (RLE) لتقدير الوضعية، وخسارة زاوية مخصصة لمعالجة مشكلات الحدود في كشف الصندوق المحيط الموجّه (OBB).

مقارنة الأداء#

عند تقييم هذه النماذج، من الضروري تحقيق توازن قوي بين الأداء من حيث الدقة (mAP) والكفاءة الحسابية. يوضح الجدول أدناه كيف يتفوق YOLO26 باستمرار على RTDETRv2 عبر مختلف الإصدارات الحجمية.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

كما هو موضح أعلاه، يحقق نموذج YOLO26x قيمة 57.5 mAP لافتة، متفوقًا بفارق كبير على نموذج RTDETRv2-x، مع استخدام عدد أقل من المعلمات والحفاظ على سرعة استدلال أعلى عبر TensorRT. علاوة على ذلك، فإن متطلبات الذاكرة لدى YOLO26 أقل بوضوح، ما يجعله الخيار الأمثل لعمليات النشر الطرفية في الوقت الفعلي.

المنظومة وسهولة الاستخدام#

على الرغم من أهمية الأداء الخام، فإن المنظومة المحيطة تحدد مدى سرعة نقل النموذج من البحث إلى الإنتاج. وهنا توفر منصة Ultralytics ميزة لا مثيل لها.

منظومة موحدة تتمتع بصيانة جيدة#

يعمل RTDETRv2 أساسًا بوصفه مستودعًا بمستوى بحثي، ما قد يستلزم إعدادات معقدة للبيئة وبرمجة نصية يدوية للمهام المخصصة. وعلى العكس، يستفيد Ultralytics YOLO26 من حزمة Python ناضجة وخضعت لاختبارات مكثفة. توفر منظومة Ultralytics تجربة مستخدم مبسطة للغاية، مع API بسيطة للتدريب والتحقق والتنبؤ والتصدير.

بفضل التكاملات المضمنة مع Weights & Biases وComet ML، تصبح عملية تتبع التجارب سلسة. علاوة على ذلك، تتميز نماذج Ultralytics بمرونة عالية؛ فبينما يركز RTDETRv2 على اكتشاف الأجسام، يدعم YOLO26 بطبيعته تقسيم المثيلات وتقدير الوضعية وتصنيف الصور ضمن الإطار نفسه تمامًا.

مثال برمجي: البساطة موضع التنفيذ#

تتيح API الخاصة بـ Ultralytics للمطورين تحميل النماذج وتدريبها وتشغيل الاستدلال باستخدام بضعة أسطر من التعليمات البرمجية فقط. وهذا يحسن كفاءة التدريب بدرجة كبيرة ويقلل الوقت اللازم لطرح المنتج في السوق.

from ultralytics import RTDETR, YOLO

# Load an RT-DETR model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image seamlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the YOLO26 results
results_yolo[0].show()

# Export YOLO26 to ONNX format with one click
model_yolo.export(format="onnx")

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين RT-DETR وYOLO26 على متطلبات مشروعك المحددة وقيود النشر وتفضيلاتك المتعلقة بالمنظومة.

متى تختار RT-DETR#

يُعد RT-DETR خيارًا قويًا من أجل:

  • أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
  • السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
  • اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.

متى تختار YOLO26#

يوصى باستخدام YOLO26 من أجل:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

استكشاف بنيات أخرى#

بينما يمثل YOLO26 ذروة الأداء الحالية، قد يجد المطورون أيضاً قيمة في استكشاف الإصدارات السابقة. يظل نموذج YOLO11 الناجح للغاية نموذجاً قوياً ومدعوماً بالكامل لمجموعة متنوعة من الأنظمة القديمة. يمكنك التعمق أكثر في قدراته من خلال قراءة مقارنة RT-DETR وYOLO11. بالإضافة إلى ذلك، إذا كنت تحلل بنيات قديمة، فإن الاطلاع على مقارنة EfficientDet وYOLO26 يوفر سياقاً تاريخياً رائعاً حول مدى تقدم بنيات كشف الكائنات.

أفكار ختامية#

يقدم كل من RTDETRv2 وYOLO26 تطورات هائلة في مجال الذكاء الاصطناعي. ومع ذلك، بالنسبة إلى الفرق التي تعطي الأولوية للانتقال السلس إلى الإنتاج، والحد الأدنى من استهلاك الذاكرة، وتعدد المهام على نطاق واسع، فإن Ultralytics YOLO26 هو التوصية الواضحة. تضمن بنيته الخالية من NMS وسرعاته العالية على CPU ودعم منظومة Ultralytics القوية بقاء مشاريع الذكاء الاصطناعي للرؤية لديك قابلة للتوسع وفعالة ومهيأة للمستقبل. وسواء نُشر على خادم سحابي أو على Raspberry Pi محدود الموارد، فإن YOLO26 يقدم أداءً لا هوادة فيه مباشرةً دون إعدادات إضافية.

التعليقات