YOLO11 مقابل RTDETRv2#
شهد مجال الرؤية الحاسوبية توسعًا سريعًا، موفرًا للمطورين عددًا كبيرًا من الخيارات لبناء تطبيقات قوية قائمة على الرؤية. وفي مجال اكتشاف الأجسام في الزمن الحقيقي، أصبح النقاش بين الشبكات العصبية الالتفافية (CNNs) ومحوّلات الرؤية (ViTs) أكثر بروزًا من أي وقت مضى. تتناول هذه المقارنة التقنية بنيتين رائدتين: YOLO11، الذي يمثل ذروة أطر عمل CNN المحسّنة بدرجة عالية، وRTDETRv2، وهو إصدار قوي من عائلة محوّل الاكتشاف.
من خلال تحليل بنيتهما، ومقاييس الأداء، وسيناريوهات النشر المثالية، يهدف هذا الدليل إلى مساعدة مهندسي تعلم الآلة على اتخاذ قرارات مستنيرة. وعلى الرغم من أن كلا النموذجين يدفعان حدود الدقة، فإن نماذج Ultralytics YOLO توفر عادةً توازنًا أفضل بين السرعة، ودعم المنظومة، وسهولة الاستخدام في بيئات الإنتاج الواقعية.
YOLO11: المعيار للتنوع في العالم الحقيقي#
قدمت Ultralytics نموذج YOLO11، الذي يستند إلى سنوات من الأبحاث الأساسية لتقديم نموذج سريع ودقيق ومتعدد الاستخدامات بدرجة كبيرة. وقد صُمم للتعامل بسلاسة وبشكل أصلي مع اكتشاف الأجسام، وتجزئة المثيلات، وتصنيف الصور، وتقدير الوضعية، واستخراج مربعات الإحاطة الموجّهة (OBB).
- المؤلفان: Glenn Jocher وJing Qiu
- المنظمة: Ultralytics
- التاريخ: 2024-09-27
- GitHub: مستودع Ultralytics
- الوثائق: وثائق YOLO11
البنية ونقاط القوة#
يتميز YOLO11 بنية تحتية أساسية محدثة من الشبكات العصبية التلافيفية (CNN) وأهرامات ميزات مكانية متقدمة، مما يجعله فعالاً للغاية في استهلاك الموارد. وهو مزدهر في البيئات ذات القيود الصارمة على الأجهزة، مما يوفر بصمة ذاكرة ضئيلة أثناء التدريب والاستنتاج على حد سواء. توفر منصة Ultralytics دعماً أصلياً لـ YOLO11، مما يتيح مراقبة النماذج المبسطة، وتوسيم البيانات، والتدريب السحابي دون الحاجة إلى دمج أدوات عمليات التعلم الآلي (MLOps) المتباينة.
بالنسبة إلى المطورين الذين يستهدفون الحوسبة الطرفية، يتميز YOLO11 بزمن انتقال منخفض للغاية. وتتيح طبيعته خفيفة الوزن تشغيله بكفاءة على أجهزة تتراوح من Raspberry Pi إلى الهواتف المحمولة المخصصة للمستهلكين، ما يجعله معيارًا للبيع بالتجزئة الذكي، ومراقبة جودة التصنيع، والإدارة الآلية لحركة المرور.
RTDETRv2: محوّلات في الزمن الحقيقي من Baidu#
يمثل RTDETRv2 (محوّل الاكتشاف في الزمن الحقيقي، الإصدار 2) جهود Baidu لجعل البنى القائمة على المحوّلات ملائمة للمهام الآنية. وهو يستند إلى RT-DETR الأصلي من خلال دمج نهج «حزمة من المزايا المجانية» لتحسين الدقة الأساسية من دون زيادة زمن انتقال الاستدلال.
- المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- Arxiv: 2407.17140
- GitHub: مستودع RTDETRv2
- الوثائق: ملف README لـ RTDETRv2
البنية ونقاط القوة#
بخلاف CNNs التقليدية، يستخدم RTDETRv2 بنية مُرمّز-مفكّك مع آليات الانتباه الذاتي، ما يتيح له التقاط السياق العام عبر الصورة. ويفيد ذلك خصوصًا في المشاهد المزدحمة التي يكثر فيها الحجب. ويلغي RTDETRv2 الحاجة إلى الكبت غير الأقصى (NMS) في المعالجة اللاحقة، ويعتمد بدلًا من ذلك على المطابقة الهنغارية أثناء التدريب لإجراء مطابقة ثنائية الطرف واحد لواحد.
ومع ذلك، تشتهر نماذج المحوّلات باستهلاكها الكبير لـ ذاكرة VRAM وذاكرة CUDA. وغالبًا ما يتطلب تدريب RTDETRv2 من الصفر أو ضبطه الدقيق على مجموعات بيانات مخصصة عناقيد GPU متطورة وواسعة الموارد، ما قد يشكل عائقًا أمام الفرق الصغيرة الرشيقة مقارنةً ببصمة التدريب الخفيفة لنماذج Ultralytics.
تحليل الأداء والمقاييس#
عند تقييم هذه النماذج على مجموعة بيانات COCO القياسية، نلاحظ مفاضلات واضحة بين المعلمات، وFLOPs، والدقة الخام.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
تفصيل النتائج#
كما يظهر في الجدول، يوفر YOLO11 نسبة أداء إلى حجم مذهلة. يحقق YOLO11x قيمة mAPval أعلى (54.7) مقارنةً بـ RTDETRv2-x (54.3)، مع استخدام عدد أقل بكثير من المعلمات (56.9M مقابل 76M) وعدد أقل بكثير من عمليات FLOPs الحسابية (194.9B مقابل 259B).
علاوة على ذلك، تتميز سرعات استدلال YOLO11 على T4 [TensorRT](https://ultralytics-translation-0.invalid بأنها عالية للغاية. يُكمل YOLO11s الاستدلال في 2.5ms فقط، في حين يستغرق أصغر نموذج RTDETRv2-s مدة 5.03ms. وهذا يجعل YOLO11 الخيار الحاسم لتدفقات تحليلات الفيديو عالية السرعة وفي الزمن الحقيقي، حيث يمثل وقت معالجة الإطار عنق الزجاجة الرئيسي.
رغم أن RTDETRv2 يحقق دقة ممتازة عبر طبقات الانتباه، فإن هذه الآليات تتوسع تربيعيًا مع دقة الصورة، ما يؤدي إلى استهلاك أعلى لـ VRAM أثناء التدريب والاستدلال على حد سواء. ويتجاوز YOLO11 ذلك باستخدام كتله الالتفافية فائقة الكفاءة.
منظومة التدريب وسهولة الاستخدام#
تكمن الميزة الأساسية لاعتماد نموذج من Ultralytics في المنظومة المحيطة به. وغالبًا ما يتطلب تدريب RTDETRv2 التنقل بين مستودعات معقدة بمستوى المستودعات البحثية، وضبط أوزان خسارة المطابقة الثنائية الطرف المعقدة، وإدارة الحمل الزائد الكبير على الذاكرة.
وعلى النقيض، تركز Ultralytics بدرجة كبيرة على تجربة المطور. إذ تعمل واجهة Python البرمجية الموحدة على تجريد التعليمات البرمجية النمطية، والتكامل بسلاسة مع أدوات مثل Weights & Biases من أجل تتبع التجارب، ومعالجة عمليات زيادة البيانات تلقائيًا.
إليك مدى سهولة تدريب نموذج وتصديره باستخدام الحزمة ultralytics:
from ultralytics import YOLO
# Initialize YOLO11 model with pre-trained weights
model = YOLO("yolo11n.pt")
# Train the model efficiently on a local GPU or cloud instance
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Utilize CUDA GPU
)
# Export the trained model to ONNX for widespread deployment
export_path = model.export(format="onnx")بعد التدريب، لا يتطلب تصدير نموذج YOLO11 إلى تنسيقات مثل ONNX، أو OpenVINO، أو CoreML سوى أمر واحد، ما يضمن قدرة خط أنابيب الرؤية لديك على التوسع بسهولة عبر خلفيات عتادية متنوعة.
تذكّر أنه في حين يركز RTDETRv2 حصريًا على اكتشاف مربعات الإحاطة، تدعم بنية YOLO11 أصليًا تقدير الوضعية وتجزئة المثيلات، ما يتيح لك توحيد مهام رؤية متعددة ضمن عائلة نماذج واحدة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLO11 وRT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلاتك المتعلقة بالمنظومة.
متى تختار YOLO11#
يُعد YOLO11 خيارًا قويًا لـ:
- النشر الطرفي في بيئات الإنتاج: التطبيقات التجارية على أجهزة مثل Raspberry Pi أو NVIDIA Jetson، حيث تمثل الموثوقية والصيانة النشطة أولوية قصوى.
- تطبيقات الرؤية متعددة المهام: المشاريع التي تتطلب الكشف، والتقسيم، وتقدير الوضعيات، وOBB ضمن إطار عمل موحد واحد.
- إنشاء النماذج الأولية والنشر بسرعة: الفرق التي تحتاج إلى الانتقال سريعًا من جمع البيانات إلى الإنتاج باستخدام واجهة Ultralytics Python البرمجية المبسطة.
متى تختار RT-DETR#
يوصى باستخدام RT-DETR في الحالات التالية:
- أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
- السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
- اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
استشراف المستقبل: قوة YOLO26#
مع أن YOLO11 يمثل خيارًا ممتازًا للإنتاج، ينبغي للفرق التي تبحث عن أحدث التقنيات على الإطلاق أن تنظر بجدية في YOLO26. فقد أُطلق YOLO26 في يناير 2026، وسد الفجوة المعمارية من خلال دمج تصميم شامل من الطرف إلى الطرف خالٍ من NMS (طُوّر لأول مرة في YOLOv10) مباشرةً في جوهره، ما يلغي تمامًا زمن انتقال المعالجة اللاحقة وتعقيد منطق النشر.
يقدم YOLO26 أيضًا عدة ميزات ثورية:
- مُحسِّن MuSGD: مستوحى من تقنيات تدريب LLM التي تستخدمها Kimi K2 التابعة لـ Moonshot AI، يضمن هذا المزيج الهجين من SGD وMuon تدريبًا مستقرًا للغاية وتقاربًا أسرع بكثير.
- إزالة DFL: أُزيلت خسارة البؤرة التوزيعية لتوفير عملية تصدير أنظف وأبسط، ما يحسن بدرجة كبيرة التوافق مع الأجهزة الطرفية منخفضة الطاقة.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرف على الأجسام الصغيرة، وهو متطلب حاسم لمراقبة الطائرات المسيّرة، والمراقبة الزراعية، والمستشعرات الطرفية لإنترنت الأشياء.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: بالنسبة إلى عمليات النشر التي تفتقر إلى GPU مخصص، جرى تحسين YOLO26 خصيصًا للتنفيذ على CPU، متفوقًا بفارق كبير على الأجيال السابقة.
بالنسبة إلى المهتمين باستكشاف نطاق أوسع من البنى، توفر وثائق Ultralytics أيضًا رؤى حول YOLOv8، وYOLOv5 واسع الانتشار، ونماذج متخصصة مثل YOLO-World لتطبيقات الاكتشاف ذات المفردات المفتوحة. وفي نهاية المطاف، سواء كانت الأولوية للاستقرار المُثبت لـ YOLO11 أو الابتكارات الرائدة لـ YOLO26، فإن منظومة Ultralytics تقدم أدوات لا مثيل لها لتحويل حلول الرؤية الحاسوبية إلى واقع.