Ultralytics YOLO27:
Get Started

YOLO11 مقابل RTDETRv2#

اتسع مجال الرؤية الحاسوبية بسرعة، موفرًا للمطورين خيارات عديدة لبناء تطبيقات قوية قائمة على الرؤية. وفي مجال كشف الأجسام في الوقت الفعلي، يحتدم النقاش أكثر من أي وقت مضى حول الشبكات العصبية الالتفافية (CNNs) ومحولات الرؤية (ViTs). تتناول هذه المقارنة التقنية بنيتين رائدتين: YOLO11، الذي يمثل قمة أطر عمل CNN المحسّنة بدرجة عالية، وRTDETRv2، وهو إصدار قوي من عائلة محولات الكشف.

من خلال تحليل البنى ومقاييس الأداء وسيناريوهات النشر المثالية، يهدف هذا الدليل إلى مساعدة مهندسي تعلّم الآلة على اتخاذ قرارات مدروسة. وبينما يتجاوز كلا النموذجين حدود الدقة، توفر نماذج Ultralytics YOLO عادةً توازنًا أفضل بين السرعة ودعم المنظومة وسهولة الاستخدام في بيئات الإنتاج الفعلية.

YOLO11: معيار التنوع في التطبيقات الواقعية#

قدمت Ultralytics نموذج YOLO11 استنادًا إلى سنوات من الأبحاث التأسيسية، ليكون سريعًا ودقيقًا ومتعدد الاستخدامات بدرجة استثنائية. وقد صُمم للتعامل بسلاسة وبشكل أصلي مع كشف الأجسام وتجزئة المثيلات وتصنيف الصور وتقدير الوضعيات واستخراج مربعات الإحاطة الموجّهة (OBB).

البنية ومواطن القوة#

يتميز YOLO11 ببنية CNN أساسية محسّنة وأهرامات متقدمة للسمات المكانية، ما يجعله كفؤًا للغاية في استخدام الموارد. ويعمل بكفاءة في البيئات ذات القيود الصارمة على الأجهزة، مع استهلاك ضئيل للذاكرة أثناء التدريب والاستدلال. وتوفر منصة Ultralytics دعمًا أصليًا لـ YOLO11، ما يتيح مراقبة النماذج وتعليق البيانات والتدريب السحابي بسلاسة دون الحاجة إلى تجميع أدوات MLOps متفرقة.

للمطورين الذين يستهدفون الحوسبة الطرفية، يتميز YOLO11 بزمن استجابة منخفض للغاية. وتتيح طبيعته الخفيفة تشغيله بكفاءة على أجهزة تتراوح من Raspberry Pi إلى الهواتف المحمولة الاستهلاكية، ما يجعله معيارًا لتجارة التجزئة الذكية وضبط جودة التصنيع وإدارة حركة المرور آليًا.

RTDETRv2: المحولات الآنية من Baidu#

يمثل RTDETRv2 (الإصدار الثاني من محول الكشف الآني) مسعى Baidu لجعل البنى القائمة على Transformer صالحة للمهام الآنية. وهو يبني على RT-DETR الأصلي، مستفيدًا من نهج «حزمة التحسينات المجانية» لتحسين دقة خط الأساس دون زيادة زمن الاستدلال.

تعرّف على المزيد حول RTDETRv2

البنية ومواطن القوة#

على خلاف نماذج CNN التقليدية، يستخدم RTDETRv2 بنية مُرمِّز ومُفكِّك ترميز بآليات انتباه ذاتي، ما يتيح له التقاط السياق العام للصورة. ويكون ذلك مفيدًا على نحو خاص في المشاهد المزدحمة التي يكثر فيها الاحتجاب. ويلغي RTDETRv2 الحاجة إلى كبت غير الأعظمية (NMS) في المعالجة اللاحقة، معتمدًا بدلًا من ذلك على المطابقة الهنغارية أثناء التدريب لإجراء مطابقة ثنائية أحادية الاتجاه.

لكن نماذج Transformer تشتهر باستهلاكها الكبير لـذاكرة VRAM وذاكرة CUDA. وغالبًا ما يتطلب تدريب RTDETRv2 من الصفر أو ضبطه الدقيق على مجموعات بيانات مخصصة عناقيد GPU متطورة وكبيرة، ما قد يشكل عائقًا أمام الفرق الصغيرة والمرنة مقارنةً ببصمة التدريب الخفيفة لنماذج Ultralytics.

تحليل الأداء والمقاييس#

عند تقييم هذه النماذج على مجموعة بيانات COCO القياسية، نلاحظ مفاضلات واضحة بين عدد المعلمات وFLOPs والدقة الخام.

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

تحليل النتائج#

كما يبيّن الجدول، يقدم YOLO11 نسبة أداء إلى حجم مذهلة. يحقق YOLO11x متوسط mAPval أعلى (54.7) مقارنةً بـ RTDETRv2-x (54.3)، مع استخدام عدد أقل بكثير من المعلمات (56.9M مقابل 76M) وعدد أقل بكثير من عمليات FLOPs الحسابية (195.3B مقابل 259B).

وفضلًا عن ذلك، تتميز سرعات استدلال YOLO11 على T4 باستخدام TensorRT بأنها فائقة. يُكمل YOLO11s الاستدلال في 2.5ms فقط، بينما يستغرق أصغر طراز من RTDETRv2، وهو RTDETRv2-s، مدة 5.03ms. وهذا يجعل YOLO11 الخيار الأمثل لتدفقات تحليلات الفيديو الآنية عالية السرعة، حيث يكون زمن معالجة الإطار هو عنق الزجاجة الرئيسي.

تكلفة نماذج Transformer

مع أن RTDETRv2 يحقق دقة ممتازة من خلال طبقات الانتباه، فإن متطلبات هذه الآليات تزداد تربيعيًا مع دقة الصورة، ما يؤدي إلى زيادة استهلاك VRAM أثناء التدريب والاستدلال. ويتجنب YOLO11 ذلك باستخدام كتل التفاف فائقة الكفاءة.

منظومة التدريب وسهولة الاستخدام#

تكمن الميزة الأساسية لاعتماد نموذج من Ultralytics في المنظومة المحيطة به. وغالبًا ما يتطلب تدريب RTDETRv2 التعامل مع مستودعات معقدة مخصصة للأبحاث، وضبط أوزان خسارة المطابقة الثنائية المعقدة، وإدارة استهلاك كبير للذاكرة.

في المقابل، تولي Ultralytics اهتمامًا كبيرًا بتجربة المطورين. وتخفي واجهة Python الموحدة التعليمات البرمجية النمطية، وتتكامل بسلاسة مع أدوات مثل Weights & Biases من أجل تتبع التجارب، كما تتولى عمليات زيادة البيانات تلقائيًا.

إليك مدى سهولة تدريب نموذج وتصديره باستخدام حزمة ultralytics:

from ultralytics import YOLO

# ⁨تهيئة نموذج YOLO11 بأوزان مدرّبة مسبقًا⁩
model = YOLO("yolo11n.pt")

# ⁨درّب النموذج بكفاءة على GPU محلي أو مثيل سحابي⁩
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # ⁨استخدم GPU مع CUDA⁩
)

# ⁨صدّر النموذج المدرّب إلى ONNX لنشره على نطاق واسع⁩
export_path = model.export(format="onnx")

بعد التدريب، لا يتطلب تصدير نموذج YOLO11 إلى تنسيقات مثل ONNX أو OpenVINO أو CoreML سوى أمر واحد، ما يضمن سهولة توسيع نطاق مسار الرؤية عبر مختلف منصات الأجهزة.

قدرات متعددة المهام

تذكّر أنه بينما يركز RTDETRv2 حصريًا على كشف مربعات الإحاطة، تدعم بنية YOLO11 أصليًا تجزئة المثيلات وتقدير الوضعيات، ما يتيح لك جمع مهام رؤية متعددة ضمن عائلة نموذجية واحدة.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLO11 وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلاتك المتعلقة بالمنظومة.

متى تختار YOLO11#

يُعد YOLO11 خيارًا قويًا في الحالات التالية:

متى تختار RT-DETR#

يوصى بـRT-DETR في الحالات التالية:

  • أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
  • سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
  • كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
  • البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.

نظرة إلى المستقبل: قوة YOLO26#

مع أن YOLO11 خيار ممتاز للإنتاج، ينبغي للفرق التي تسعى إلى أحدث التقنيات أن تفكر جديًا في YOLO26. صدر YOLO26 في يناير 2026، ويسد الفجوة المعمارية بإدماج رأس اختياري شامل وخالٍ من NMS (nms=False، الذي ظهر لأول مرة في YOLOv10) مباشرةً في بنيته الأساسية، ما يزيل زمن الاستجابة الناتج عن المعالجة اللاحقة لـ NMS وتعقيد منطق النشر.

يقدم YOLO26 أيضًا عدة ميزات ثورية:

  • مُحسِّن MuSGD: استلهامًا من تقنيات تدريب نماذج اللغة الكبيرة لدى Moonshot AI في Kimi K2، يضمن هذا المزيج الهجين من SGD وMuon تدريبًا مستقرًا للغاية وتقاربًا أسرع بكثير.
  • إزالة DFL: أُزيلت خسارة البؤرة التوزيعية لتبسيط عملية التصدير، ما يحسن بدرجة كبيرة التوافق مع الأجهزة الطرفية منخفضة الطاقة.
  • ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو مطلب أساسي لمراقبة الطائرات المسيّرة ومراقبة المحاصيل الزراعية ومستشعرات إنترنت الأشياء الطرفية.
  • استدلال أسرع بنسبة تصل إلى 43% على CPU: حُسِّن YOLO26 خصوصًا للتنفيذ على CPU في عمليات النشر التي تفتقر إلى وحدات GPU مخصصة، متفوقًا بفارق كبير على الأجيال السابقة.

للمهتمين باستكشاف نطاق أوسع من البنى، تقدم وثائق Ultralytics أيضًا معلومات عن YOLOv8 وYOLOv5 واسع الانتشار، ونماذج متخصصة مثل YOLO-World لتطبيقات الكشف بمفردات مفتوحة. وفي نهاية المطاف، سواء أكانت الأولوية للاستقرار المثبت في YOLO11 أم للابتكارات الرائدة في YOLO26، توفر منظومة Ultralytics أدوات استثنائية لتحويل حلول الرؤية الحاسوبية إلى واقع.

التعليقات