RTDETRv2 مقابل YOLO11#
يشهد مجال الرؤية الحاسوبية تطورًا مستمرًا، إذ تدفع البنى الجديدة حدود الإمكانات على الأجهزة الطرفية والخوادم السحابية. ومن أبرز المنافسين في مجال اكتشاف الكائنات الآني حاليًا RTDETRv2 وYOLO11. يقدّم كلا النموذجين أداءً استثنائيًا، لكنهما يجسّدان فلسفتين معماريتين مختلفتين جوهريًا: نهج Transformer مقابل الشبكة العصبية الالتفافية (CNN) المحسّنة بدرجة كبيرة.
في هذه المقارنة التقنية الشاملة، سنستكشف البنى ومقاييس الأداء ومنهجيات التدريب وحالات الاستخدام المثلى لكلا النموذجين، لمساعدتك على اتخاذ قرار مستنير بشأن تطبيق الذكاء الاصطناعي القادم.
RTDETRv2: منافس قائم على Transformer#
طُرح RTDETRv2 بوصفه تطورًا لنموذج Transformer الأصلي للاكتشاف الآني، ويستفيد من آليات الانتباه لمعالجة البيانات المرئية. ومن خلال التعامل مع رقع الصور كسلاسل، يحقق فهمًا شاملًا لسياق الصورة، وهو ما يفيد كثيرًا في اكتشاف الكائنات شديدة التداخل في المشاهد المعقدة.
تفاصيل النموذج:
- المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
- الجهة: Baidu
- التاريخ: 2024-07-24
- Arxiv: 2407.17140
- GitHub: مستودع RT-DETR
- الوثائق: وثائق RTDETRv2
نقاط القوة والضعف المعمارية#
يتمثل الابتكار الأساسي في RTDETRv2 في بنيته الشاملة الخالية من NMS. فمن خلال إزالة الكبت غير الأقصى (NMS)، يبسّط مسار المعالجة اللاحقة. كما تحسّنت قدراته على استخراج السمات متعددة المقاييس مقارنةً بنموذج RT-DETR الأصلي، ما يتيح له تحديد الكائنات ذات الأحجام المختلفة على نحو أفضل.
لكن اعتماد RTDETRv2 على Transformers يجعله عادةً أكثر استهلاكًا للذاكرة بدرجة كبيرة أثناء التدريب. وبوجه عام، يستغرق تقارب Transformers وقتًا أطول ويتطلب ذاكرة CUDA أكبر بكثير مقارنةً بشبكات CNN التقليدية، ما يجعل استخدامها أقل سهولة للباحثين الذين يعملون على أجهزة استهلاكية أو ينشرون في بيئات ذكاء اصطناعي طرفي محدودة الموارد.
Ultralytics YOLO11: قمة كفاءة CNN#
استنادًا إلى سنوات من الأبحاث التأسيسية، أصدرت Ultralytics نموذج YOLO11 بوصفه قفزة هائلة إلى الأمام في سلسلة YOLO. وهو يطوّر بنية CNN لتحقيق سرعة ودقة غير مسبوقتين، مع الحفاظ على المرونة والمنظومة الصديقة للمطوّرين التي اعتاد المجتمع توقعها.
تفاصيل النموذج:
- المؤلفان: Glenn Jocher وJing Qiu
- الجهة: Ultralytics
- التاريخ: 27 سبتمبر 2024
- GitHub: مستودع Ultralytics
ميزة Ultralytics#
يتألق YOLO11 في التوازن بين الأداء. فهو يحقق مفاضلة استثنائية بين السرعة والدقة، ما يجعله متعدد الاستخدامات على نحو ملحوظ في سيناريوهات النشر الواقعية المتنوعة، بدءًا من عناقيد الحوسبة السحابية الضخمة وصولًا إلى الأجهزة المحمولة خفيفة الوزن.
علاوةً على ذلك، تشتهر نماذج Ultralytics YOLO بانخفاض استهلاكها للذاكرة أثناء التدريب والاستدلال. فعلى عكس نماذج Transformer التي قد تستنفد VRAM بسهولة، يتيح YOLO11 استخدام أحجام دفعات أكبر على وحدات GPU القياسية. ولا يقتصر YOLO11 على اكتشاف الكائنات فحسب، بل يتميز أيضًا بتعدد استخدامات مذهل، مع دعم أصلي لكل من تقسيم المثيلات وتصنيف الصور وتقدير الوضعية ومربعات الإحاطة الموجّهة (OBB).
مقارنة الأداء والمقاييس#
عند مقارنة الأرقام الخام، يتضح أنه رغم تحقيق RTDETRv2 دقة مثيرة للإعجاب، يوفّر YOLO11 مجموعة أدق بكثير من أحجام النماذج، مع سرعات استدلال أعلى، ولا سيما على TensorRT.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
كما يبيّن الجدول، يحقق نموذج YOLO11x قيمة mAPval أعلى تبلغ 54.7%، مع استخدام عدد أقل من FLOPs (195.3B مقابل 259B) وتقديم استدلال أسرع على TensorRT (11.3ms مقابل 15.03ms) مقارنةً بنموذج RTDETRv2-x. وتوفّر نسختا YOLO11 nano وsmall خيارات خفيفة الوزن لا مثيل لها للأجهزة محدودة الموارد، مثل Raspberry Pi.
المنظومة وسهولة الاستخدام والتدريب#
تتمثل السمة المميزة لنماذج Ultralytics في تجربة المستخدم المبسطة. توفّر حزمة Python المسماة ultralytics واجهة API موحّدة وبديهية تتولى المهام المعقدة مثل زيادة البيانات والتدريب الموزع وتصدير النماذج. وبينما يتطلب مستودع RTDETRv2 البحثي قدرًا كبيرًا من التعليمات البرمجية التمهيدية والتهيئة، توفّر Ultralytics مسارًا ينقلك من الصفر إلى الاحتراف.
ومن اللافت أن منظومة Ultralytics متينة إلى حد أنها تدعم تشغيل نماذج RT-DETR إلى جانب نماذج YOLO دعمًا أصليًا! وهذا يتيح لك الاستفادة من المنظومة التي تحظى بصيانة جيدة لدى Ultralytics، بما في ذلك التكامل مع Weights & Biases وComet ML، لتتبّع التجارب بسهولة.
from ultralytics import RTDETR, YOLO
# تحميل نموذج RTDETR بسلاسة عبر واجهة API الخاصة بـ Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")
# تحميل نموذج YOLO11 محسّن بدرجة كبيرة
model_yolo = YOLO("yolo11n.pt")
# تدريب YOLO11 باستهلاك فعال جدًا للذاكرة
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# تصدير نموذج YOLO المدرّب إلى تنسيق ONNX
model_yolo.export(format="onnx")تُعد كفاءة التدريب أمرًا بالغ الأهمية في تعلّم الآلة. تستخدم نماذج Ultralytics أوزانًا مدرّبة مسبقًا تتقارب بسرعة. لإدارة مجموعات البيانات وعمليات التدريب ونقاط نهاية النشر من دون كتابة تعليمات برمجية، استكشف منصة Ultralytics للاستفادة من تجربة MLOps متكاملة.
تطبيقات واقعية#
غالبًا ما يتوقف الاختيار بين هاتين البنيتين على قيود النشر المحددة لمشروعك.
الحالات التي يتفوق فيها RTDETRv2: تتميز بنية Transformer الأساسية في RTDETRv2 بفاعلية عالية في السيناريوهات التي تضم كائنات كثيفة ومحتجبة بشدة، والتي تتطلب سياقًا شاملًا. وكثيرًا ما يُقيّم النموذج في الأبحاث الأكاديمية والتطبيقات التي تقل فيها أهمية الميزانية الحاسوبية عن أهمية رسم العلاقات المعتمدة على الانتباه الخام.
الحالات التي يتصدر فيها YOLO11: يُعد YOLO11 الخيار الأبرز بلا منازع للنشر العملي في العالم الحقيقي. ويجعله استهلاكه المحدود للذاكرة وسرعة الاستدلال الفائقة مثاليًا لما يلي:
- التصنيع الذكي: تشغيل اكتشاف العيوب آنيًا على خطوط الإنتاج باستخدام حواسيب صناعية.
- الزراعة: النشر على الطائرات المسيّرة لمراقبة صحة المحاصيل آنيًا وتشغيل روبوتات الحصاد آليًا.
- تحليلات البيع بالتجزئة: معالجة تدفقات كاميرات متعددة بالتزامن لإدارة الطوابير وتتبع المخزون من دون الحاجة إلى مراكز خوادم ضخمة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين RT-DETR وYOLO11 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات النظام البيئي.
متى تختار RT-DETR#
يُعد RT-DETR خيارًا قويًا في الحالات التالية:
- أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
- سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
- كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.
متى تختار YOLO11#
يوصى بـ YOLO11 لما يلي:
- النشر الإنتاجي على الأجهزة الطرفية: التطبيقات التجارية على أجهزة مثل Raspberry Pi أو NVIDIA Jetson، حيث تُعد الموثوقية والصيانة النشطة أمرين أساسيين.
- تطبيقات الرؤية متعددة المهام: المشاريع التي تتطلب الكشف والتقسيم وتقدير الوضعية وOBB ضمن إطار عمل موحد واحد.
- النمذجة الأولية والنشر السريعان: الفرق التي تحتاج إلى الانتقال بسرعة من جمع البيانات إلى الإنتاج باستخدام واجهة Python البرمجية المبسطة من Ultralytics.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
نظرة إلى المستقبل: ظهور YOLO26#
إذا كنت تبدأ مشروعًا جديدًا، فعليك أيضًا التفكير في الجيل التالي من ذكاء الرؤية: Ultralytics YOLO26. صدر YOLO26 في يناير 2026، ويجمع أفضل ما في العالمين. كما يقدّم رأسًا اختياريًا شاملًا وخاليًا من NMS (nms=False، وقد طُرح لأول مرة في YOLOv10) يزيل المعالجة اللاحقة لـ NMS، مثل RTDETRv2، ولكن بسرعة CNN التي لا تُضاهى.
يتميّز YOLO26 بالمحسّن MuSGD Optimizer، المستوحى من ابتكارات تدريب LLM، لتحقيق تقارب سريع ومستقر للغاية، كما يقدّم استدلالًا على CPU أسرع بنسبة تصل إلى 43% من خلال إزالة Distribution Focal Loss (DFL). وبفضل دالتي الخسارة المتخصصتين ProgLoss + STAL اللتين تحسّنان بدرجة كبيرة التعرّف على الكائنات الصغيرة، يُعد YOLO26 الخيار الأمثل لأي مسار حديث للرؤية الحاسوبية.
سواء اخترت YOLO11 لتعدد استخداماته المثبت، أو RTDETRv2 لآليات الانتباه فيه، أو YOLO26 المتطور لتحقيق أفضل أداء على الأجهزة الطرفية، توفّر وثائق Ultralytics جميع الموارد اللازمة للنجاح في رحلتك في مجال الرؤية الحاسوبية.