RTDETRv2 مقابل YOLOv10#
لقد كان تطور الرؤية الحاسوبية مدفوعاً إلى حد كبير بالسعي المستمر لتحقيق التوازن بين السرعة والدقة. تقليدياً، اعتمدت خطوط أنابيب اكتشاف الكائنات في الوقت الفعلي على كبح الحد الأقصى غير (NMS) كخطوة معالجة لاحقة لتصفية مربعات الإحاطة المتداخلة. ومع ذلك، يفرض كبح الحد الأقصى غير (NMS) مختنقات في زمن الوصول وضبطاً معقداً للمعلمات الفائقة. في الآونة الأخيرة، ظهر نهجان معماريان متميزان لحل هذه المشكلة بشكل أصلي: النماذج المستندة إلى Transformer مثل RTDETRv2 والنماذج المستندة إلى CNN مثل YOLOv10.
يوفر هذا الدليل مقارنة تقنية شاملة بين هذين النموذجين، حيث يحلل بنياتهما، ومقاييس أدائهما، وحالات الاستخدام المثالية، مع تسليط الضوء أيضاً على كيف توفر أحدث الابتكارات في نظام Ultralytics البيئي الحل الأمثل للتشغيل الحديث.
RTDETRv2: محولات اكتشاف الوقت الفعلي#
يبني نموذج RTDETRv2 على هندسة RT-DETR الأصلية، بهدف الجمع بين فهم السياق العالمي لـ Vision Transformers ومتطلبات السرعة في الوقت الفعلي التي كانت تهيمن عليها عادةً نماذج YOLO.
الخصائص الرئيسية:
- المؤلفون: Wenyu Lv، Yian Zhao، Qinyao Chang، Kui Huang، Guanzhong Wang، و Yi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: https://github.com/lyuwenyu/RT-DETR/tree/main/rtdetrv2_pytorch
البنية ومنهجيات التدريب#
يستخدم RTDETRv2 بنية transformer من النهاية إلى النهاية تتجنب بطبيعتها كبح الحد الأقصى غير (NMS). وهو يتبنى تحسينات على سابقه من خلال تقديم نهج "Bag-of-Freebies"، وتحسين استراتيجية التدريب ودمج إمكانيات الكشف متعددة المقاييس. يستخدم النموذج هيكلاً أساسياً لـ CNN استخراج خرائط الميزات (التفاصيل المرئية مثل الحواف والقوام)، والتي يتم معالجتها بعد ذلك بواسطة بنية مُشفِّر ومُفكِّك شفرة transformer. يتيح ذلك للنموذج تحليل سياق الصورة بالكامل في نفس الوقت، مما يجعله فعالاً للغاية في فهم المشاهد المعقدة حيث تكون الكائنات مكتظة بكثافة أو متداخلة.
نقاط القوة والضعف#
نقاط القوة:
- السياق العالمي: تتيح آلية الانتباه للنموذج التفوق في البيئات المعقدة والمزدحمة.
- خالٍ من NMS: يتنبأ بإحداثيات الأجسام مباشرة، مما يبسط خط أنابيب النشر.
- دقة عالية: يحقق متوسط الدقة المتوسطة (mAP) ممتازة على مجموعة بيانات COCO.
نقاط الضعف:
- مستهلك للموارد: تتطلب بنى Transformer عادةً ذاكرة CUDA أكبر بكثير أثناء التدريب مقارنةً بشبكات CNN، مما يجعل ضبطها الدقيق مكلفاً على الأجهزة القياسية.
- تفاوت سرعة الاستدلال: على الرغم من سرعتها، يمكن أن تؤدي حسابات الانتباه الثقيلة إلى انخفاض إطارات في الثانية في الرؤية الحاسوبية على أجهزة الحافة التي تفتقر إلى مسرعات AI مخصصة.
YOLOv10: اكتشاف كائنات في الوقت الفعلي ومن الطرف إلى الطرف (End-to-End)#
يمثل YOLOv10 تحولاً كبيراً في سلالة اكتشاف الكائنات YOLO من خلال معالجة اختناق كبح الحد الأقصى غير (NMS) القديم مباشرة داخل إطار عمل CNN.
الخصائص الرئيسية:
- المؤلفون: Ao Wang، Hui Chen، Lihao Liu، وآخرون.
- Organization: Tsinghua University
- التاريخ: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
البنية ومنهجيات التدريب#
الابتكار الجوهري في YOLOv10 هو تخصيصاته المزدوجة المتسقة للتدريب بدون NMS. فهو يستخدم رأسي كشف أثناء التدريب: أحدهما بتخصيص واحد-للكثير (مثل YOLOs التقليدية) لتوفير إشارات إشراف غنية، والآخر بتخصيص واحد-لواحد للقضاء على الحاجة إلى NMS. أثناء الاستنتاج، يتم استخدام الرأس واحد-لواحد فقط، مما يؤدي إلى عملية شاملة (end-to-end). علاوة على ذلك، طبق المؤلفون استراتيجية تصميم نموذج قائمة على الكفاءة والدقة الشاملة، مما أدى إلى تحسين المكونات المختلفة بشكل شامل لتقليل التكرار الحسابي.
نقاط القوة والضعف#
نقاط القوة:
- سرعة فائقة: من خلال إزالة كبح الحد الأقصى غير (NMS) وتحسين الهندسة المعمارية، يحقق YOLOv10 زمن وصول استدلال منخفضاً بشكل لا يصدق.
- الكفاءة: يتطلب معلمات أقل وFLOPs لتحقيق دقة قابلة للمقارنة مع النماذج الأخرى، مما يجعله مناسباً للغاية للبيئات المقيدة.
- عمليات انتشار خالية من كبح الحد الأقصى غير (NMS): يُبسط التكامل في تطبيقات الحافة مثل المراقبة الذكية.
نقاط الضعف:
- مفهوم الجيل الأول: باعتباره أول نموذج YOLO يطبق هذه الهندسة المعمارية المحددة الخالية من كبح الحد الأقصى غير (NMS)، فقد وضع الأساس ولكنه ترك مجالاً لتنوع المهام والتحسين الذي شوهد في النماذج اللاحقة مثل YOLO11 وYOLO26.
مقارنة الأداء#
عند تقييم النماذج للإنتاج، يعد موازنة الدقة مع التكلفة الحسابية أمراً بالغ الأهمية. يسلط الجدول أدناه الضوء على مقايضات الأداء بين أحجام مختلفة من RTDETRv2 و YOLOv10.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (ms) | السرعة T4 TensorRT10 (ms) | المعلمات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
في حين أن RTDETRv2 يقدم دقة قوية، فإن YOLOv10 يظهر ميزة ملحوظة في زمن الوصول وكفاءة المعلمات، لا سيما في متغيراته الأصغر (Nano وSmall)، مما يجعله جذاباً للغاية لتطبيقات الحوسبة الطرفية وإنترنت الأشياء الذكي (AIoT).
إذا كنت تنشر على وحدات معالجة رسومات (GPUs) بمستوى الخادم حيث يكون حجم الدفعة وVRAM أقل تقييداً، فإن النماذج الأكبر (مثل -x أو -l) تعظيم الدقة. بالنسبة لأجهزة الحافة مثل Raspberry Pi أو الهواتف المحمولة، أعط الأولوية للمتغيرات الصغير (-n) أو صغير جداً (-s) للحفاظ على معدلات الإطارات في الوقت الفعلي.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين RT-DETR و YOLOv10 على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.
متى تختار RT-DETR#
RT-DETR خيار قوي لـ:
- أبحاث الاكتشاف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وهياكل transformer لاكتشاف الكائنات بنهاية واحدة دون NMS.
- سيناريوهات الدقة العالية مع زمن انتقال مرن: التطبيقات التي تكون فيها دقة الاكتشاف هي الأولوية القصوى ويكون زمن انتقال الاستنتاج الأعلى قليلاً مقبولاً.
- اكتشاف الكائنات الكبيرة: المشاهد التي تحتوي بشكل أساسي على كائنات متوسطة إلى كبيرة حيث توفر آلية الانتباه العالمي للمحولات ميزة طبيعية.
متى تختار YOLOv10#
يوصى باستخدام YOLOv10 في الحالات التالية:
- الكشف الفوري بدون NMS: التطبيقات التي تستفيد من الكشف الشامل (end-to-end) بدون تقنية Non-Maximum Suppression، مما يقلل من تعقيد النشر.
- الموازنة بين السرعة والدقة: المشاريع التي تتطلب توازناً قوياً بين سرعة الاستدلال ودقة الكشف عبر مختلف أحجام النماذج.
- تبيقات ذات زمن استجابة ثابت: سيناريوهات النشر التي تكون فيها أوقات الاستدلال المتوقعة حرجة، مثل robotics أو الأنظمة المستقلة.
متى تختار Ultralytics (YOLO26)#
بالنسبة لمعظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطورين:
- نشر الحافة الخالي من NMS: التطبيقات التي تتطلب استنتاجاً متسقاً ومنخفض زمن الانتقال دون تعقيدات معالجة ما بعد المعالجة باستخدام كبت غير الأقصى.
- بيئات وحدة المعالجة المركزية (CPU) فقط: الأجهزة التي لا تحتوي على تسريع مخصص بوحدة معالجة الرسوميات (GPU)، حيث توفر سرعة استنتاج CPU أسرع بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- الكشف عن الأشياء الصغيرة: السيناريوهات الصعبة مثل صور الطائرات بدون طيار الجوية أو تحليل مستشعرات إنترنت الأشياء (IoT) حيث تعمل ProgLoss و STAL على تعزيز الدقة بشكل كبير على الأشياء الدقيقة.
ميزة Ultralytics: تقديم YOLO26#
في حين أن كل من RTDETRv2 وYOLOv10 يقدمان تطورات أكاديمية مقنعة، فإن نشرها في سيناريوهات العالم الحقيقي يتطلب نظاماً بيئياً برمجياً قوياً ومُصاغاً جيداً. توفر منصة Ultralytics تجربة مطور لا مثيل لها، تجمع بين سهولة الاستخدام، والتوثيق الشامل، والأدوات القوية لـ توسيم البيانات والنشر.
للمطورين الذين يبحثون عن أحدث التقنيات على الإطلاق في عام 2026، Ultralytics YOLO26 هو التوصية النهائية. فهو يدمج أفضل الأفكار من كلا الهندستين مع تقديم تحسينات رائدة:
- تصميم شامل (End-to-End) بدون NMS: بناءً على المفهوم الذي ابتكره YOLOv10، يلغي YOLO26 معالجة NMS اللاحقة أصلاً، مما يؤدي إلى منطق نشر أسرع وأبسط وتباين زمن استجابة صفري.
- إزالة DFL: من خلال إزالة Distribution Focal Loss، يبسط YOLO26 تصدير النموذج ويحسن التوافق بشكل كبير مع الأجهزة الطرفية ومنخفضة الطاقة.
- مُحسن MuSGD: هجين من SGD و Muon (مستوحى من ابتكارات تدريب LLM)، يوفر هذا المُحسن الجديد تدريباً أكثر استقراراً وتقارباً أسرع بكثير مقارنة بالطرق التقليدية.
- استنتاج أسرع بنسبة تصل إلى 43% على وحدة المعالجة المركزية (CPU): تم تحسينه بعناية للبيئات التي لا تحتوي على وحدات معالجة رسومية مخصصة، مما يضفي طابعاً ديمقراطياً على رؤية الذكاء الاصطناعي عالية الأداء.
- ProgLoss + STAL: تحقق وظائف الخسارة المتقدمة هذه تحسينات ملحوظة في التعرف على الكائنات الصغيرة، وهو أمر بالغ الأهمية لـ التطبيقات التي تستخدم الطائرات بدون طيار ومستشعرات إنترنت الأشياء.
- تعدد استخدامات لا يُفوق: على عكس النماذج المقتصرة على مربعات الإحاطة، يدعم YOLO26 مجموعة كاملة من المهام بما في ذلك التجزئة المثيلية، وتقدير الوضعية، وتصنيف الصور، واكتشاف OBB، كاملة مع تحسينات خاصة بالمهام مثل تقدير الاحتمالية اللوغاريتمية المتبقية (RLE) للوضعيات.
تنفيذ سلس باستخدام Python#
تم تصميم تدريب ونشر هذه النماذج باستخدام واجهة برمجة تطبيقات Python لـ Ultralytics ليكون سلساً. متطلبات الذاكرة أقل بشكل ملحوظ أثناء التدريب مقارنة بالبنى الثقيلة لـ transformer، مما يسمح لك بتدريب نماذج قوية على الأجهزة القياسية.
from ultralytics import YOLO
# Load the cutting-edge YOLO26 model (recommended)
# Alternatively, load a YOLOv10 model using YOLO('yolov10n.pt')
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Easily export to various formats for edge deployment
model.export(format="onnx", simplify=True)سواء كنت تقوم بتنفيذ أنظمة إنذار أمني أو إجراء تحليل الصور الطبية، فإن اختيار نموذج مدعوم من مجتمع Ultralytics النشط يضمن حصولك على الأدوات، وأدلة ضبط المعلمات الفائقة، والتحديثات المستمرة اللازمة للنجاح. وفي حين أن YOLOv10 وRTDETRv2 مهدتا الطريق للبنى الخالية من كبح الحد الأقصى غير (NMS)، فإن YOLO26 يُتقن الصيغة، مما يوفر أفضل توازن بين الأداء، وتعدد الاستخدامات، والجاهزية للإنتاج.