مقارنة بين RTDETRv2 وYOLO11#
يشهد مجال الرؤية الحاسوبية تطورًا مستمرًا، إذ تدفع البنى المعمارية الجديدة حدود ما يمكن تحقيقه على الأجهزة الطرفية وخوادم السحابة. ويُعد RTDETRv2 وYOLO11 من أبرز المنافسين في مجال اكتشاف الأجسام الآني حاليًا. وعلى الرغم من أن كلا النموذجين يقدّم أداءً استثنائيًا، فإنهما يجسّدان فلسفتين معماريتين مختلفتين جذريًا: النهج القائم على Transformer مقابل الشبكة العصبية الالتفافية (CNN) عالية التحسين.
في هذه المقارنة التقنية الشاملة، سنستكشف البنى المعمارية، ومقاييس الأداء، ومنهجيات التدريب، وحالات الاستخدام المثالية لكلا النموذجين، لمساعدتك على اتخاذ قرار مستنير لتطبيقك التالي في مجال الذكاء الاصطناعي.
RTDETRv2: المنافس القائم على Transformer#
طُرح RTDETRv2 بوصفه تطورًا لـ Transformer الأصلي للاكتشاف الآني، ويستفيد من آليات الانتباه لمعالجة البيانات المرئية. ومن خلال التعامل مع رقع الصور كسلاسل، يحقق فهمًا شاملًا لسياق الصورة، وهو أمر مفيد للغاية لاكتشاف الأجسام المتداخلة بكثافة في المشاهد المعقدة.
تفاصيل النموذج:
- المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- Arxiv: 2407.17140
- GitHub: مستودع RT-DETR
- الوثائق: وثائق RTDETRv2
نقاط القوة والضعف المعمارية#
يتمثل الابتكار الأساسي في RTDETRv2 في بنيته الشاملة الخالية من NMS. ومن خلال إلغاء الكبت غير الأقصى (NMS)، فإنه يبسّط مسار المعالجة اللاحقة. علاوة على ذلك، حُسّنت قدراته على استخراج الميزات متعددة المقاييس مقارنةً بـنموذج RT-DETR الأصلي، مما يتيح له تحديد الأجسام ذات الأحجام المختلفة بصورة أفضل.
ومع ذلك، نظرًا لاعتماده على Transformer، يعاني RTDETRv2 عادةً من متطلبات ذاكرة أعلى بكثير أثناء التدريب. وتميل نماذج Transformer عمومًا إلى التقارب بوتيرة أبطأ، وتتطلب قدرًا أكبر بكثير من ذاكرة CUDA مقارنةً بنماذج CNN التقليدية، مما يجعلها أقل سهولة للباحثين الذين يعملون على عتاد مخصص للمستهلكين أو ينشرونها في بيئات الذكاء الاصطناعي الطرفي محدودة الموارد.
Ultralytics YOLO11: ذروة كفاءة CNN#
استنادًا إلى سنوات من الأبحاث الأساسية، أطلقت Ultralytics الإصدار YOLO11 بوصفه قفزة هائلة إلى الأمام في سلسلة YOLO. وهو يصقل بنية CNN لتحقيق سرعة ودقة غير مسبوقتين، مع الحفاظ على المرونة والمنظومة الصديقة للمطورين التي اعتاد المجتمع توقعها.
تفاصيل النموذج:
- المؤلفان: Glenn Jocher وJing Qiu
- المنظمة: Ultralytics
- التاريخ: 27 سبتمبر 2024
- GitHub: مستودع Ultralytics
ميزة Ultralytics#
يتألق YOLO11 في التوازن بين الأداء. فهو يحقق مفاضلة استثنائية بين السرعة والدقة، مما يجعله متعدد الاستخدامات بدرجة كبيرة في سيناريوهات النشر الواقعية المتنوعة، بدءًا من عناقيد الحوسبة السحابية الضخمة ووصولًا إلى الأجهزة المحمولة خفيفة الوزن.
علاوة على ذلك، تشتهر نماذج Ultralytics YOLO بانخفاض استهلاك الذاكرة أثناء التدريب والاستدلال. وعلى خلاف نماذج Transformer التي قد تستنفد VRAM بسهولة، يتيح YOLO11 أحجام دفعات أكبر على وحدات GPU القياسية. كما أن YOLO11 لا يقتصر على اكتشاف الأجسام فحسب؛ إذ يتميز بـتعدد استخدامات مذهل، مع دعم أصلي لـتجزئة الكائنات، وتصنيف الصور، وتقدير الوضعية، والمربعات المحيطة الموجّهة (OBB).
مقارنة الأداء والمقاييس#
عند مقارنة الأرقام الأولية، يتضح أنه بينما يحقق RTDETRv2 دقة مثيرة للإعجاب، يوفّر YOLO11 مجموعة أكثر تفصيلًا من أحجام النماذج مع سرعات استدلال أعلى، ولا سيما على TensorRT.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
كما يتضح من الجدول، يحقق نموذج YOLO11x قيمة mAPval أعلى تبلغ 54.7%، مع استخدام عدد أقل من FLOPs (194.9B مقابل 259B) وتوفير استدلال أسرع على TensorRT (11.3ms مقابل 15.03ms) مقارنةً بالصيغة RTDETRv2-x. وتوفر صيغتا YOLO11 nano وsmall خيارات خفيفة الوزن لا مثيل لها للأجهزة محدودة الموارد مثل Raspberry Pi.
المنظومة وسهولة الاستخدام والتدريب#
السمة المميزة لنماذج Ultralytics هي تجربة المستخدم المبسطة. توفر حزمة Python ultralytics واجهة API موحدة وبديهية تتولى الجوانب المعقدة من زيادة البيانات، والتدريب الموزع، وتصدير النماذج. وبينما يتطلب مستودع RTDETRv2 البحثي قدرًا كبيرًا من التعليمات البرمجية التمهيدية والتهيئة، توفر Ultralytics مسارًا ينتقل بك من "الصفر إلى الاحتراف".
ومن المثير للاهتمام أن منظومة Ultralytics قوية إلى حد أنها تدعم أصليًا تشغيل نماذج RT-DETR إلى جانب نماذج YOLO! ويتيح لك ذلك الاستفادة من منظومة Ultralytics جيدة الصيانة —بما في ذلك التكاملات مع Weights & Biases وComet ML— لتتبع التجارب بسهولة.
from ultralytics import RTDETR, YOLO
# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")
# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")تُعد كفاءة التدريب أمرًا بالغ الأهمية في تعلّم الآلة. وتستخدم نماذج Ultralytics أوزانًا مدرّبة مسبقًا تتقارب بسرعة. ولإدارة مجموعات البيانات، وعمليات التدريب، ونقاط نهاية النشر دون كتابة تعليمات برمجية، استكشف منصة Ultralytics للاستفادة من تجربة MLOps متكاملة.
التطبيقات الواقعية#
غالبًا ما يتوقف الاختيار بين هاتين البنيتين المعماريتين على قيود النشر المحددة لمشروعك.
حيث يتفوق RTDETRv2: يتميز العمود الفقري Transformer في RTDETRv2 بفعالية عالية في السيناريوهات التي تتضمن أجسامًا كثيفة ومحجوبة بدرجة كبيرة، حيث تكون هناك حاجة إلى السياق الشامل. وغالبًا ما يُقيَّم في الأبحاث الأكاديمية والتطبيقات التي تكون فيها الميزانية الحاسوبية أقل أهمية من رسم العلاقات الخام القائم على الانتباه.
حيث يهيمن YOLO11: يُعد YOLO11 البطل بلا منازع في النشر العملي الواقعي. فبفضل بصمته الصغيرة من الذاكرة وسرعات الاستدلال الفائقة، يُعد مثاليًا من أجل:
- التصنيع الذكي: تشغيل اكتشاف العيوب في الوقت الفعلي على خطوط الإنتاج باستخدام حواسيب صناعية.
- الزراعة: النشر على الطائرات المسيّرة لمراقبة صحة المحاصيل في الوقت الفعلي وروبوتات الحصاد المؤتمتة.
- تحليلات البيع بالتجزئة: معالجة تدفقات كاميرات متعددة بالتزامن لإدارة قوائم الانتظار وتتبع المخزون دون الحاجة إلى مزارع خوادم ضخمة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين RT-DETR وYOLO11 على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات المنظومة.
متى تختار RT-DETR#
يُعد RT-DETR خيارًا قويًا من أجل:
- أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
- السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
- اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.
متى تختار YOLO11#
يوصى باستخدام YOLO11 من أجل:
- النشر الطرفي في بيئات الإنتاج: التطبيقات التجارية على أجهزة مثل Raspberry Pi أو NVIDIA Jetson، حيث تمثل الموثوقية والصيانة النشطة أولوية قصوى.
- تطبيقات الرؤية متعددة المهام: المشاريع التي تتطلب الكشف، والتقسيم، وتقدير الوضعيات، وOBB ضمن إطار عمل موحد واحد.
- إنشاء النماذج الأولية والنشر بسرعة: الفرق التي تحتاج إلى الانتقال سريعًا من جمع البيانات إلى الإنتاج باستخدام واجهة Ultralytics Python البرمجية المبسطة.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
التطلع إلى المستقبل: ظهور YOLO26#
إذا كنت تبدأ مشروعًا جديدًا، فعليك أيضًا التفكير في الجيل التالي من الذكاء الاصطناعي للرؤية: Ultralytics YOLO26. أُطلق YOLO26 في يناير 2026، ويجمع أفضل ما في العالمين. فهو يقدم تصميمًا شاملًا خاليًا من NMS (طُرح لأول مرة في YOLOv10)، ويلغي تمامًا زمن استجابة المعالجة اللاحقة مثل RTDETRv2، مع الحفاظ على السرعة الفائقة لشبكة CNN.
يتميز YOLO26 بـمُحسِّن MuSGD —المستوحى من ابتكارات تدريب LLM— لتحقيق تقارب مستقر وسريع للغاية، ويوفر استدلالًا أسرع على CPU بنسبة تصل إلى 43% من خلال إزالة خسارة البؤرة التوزيعية (DFL). وبفضل دوال الخسارة المتخصصة ProgLoss + STAL التي تحسّن بدرجة كبيرة التعرّف على الأجسام الصغيرة، يُعد YOLO26 التوصية المثلى لأي مسار حديث للرؤية الحاسوبية.
سواء اخترت YOLO11 لتعدد استخداماته المثبت، أو RTDETRv2 لآليات الانتباه فيه، أو YOLO26 المتطور لتحقيق أفضل أداء طرفي، فإن وثائق Ultralytics توفر جميع الموارد اللازمة للنجاح في رحلتك مع الرؤية الحاسوبية.