YOLOX مقابل RTDETRv2#
يتطلب اختيار البنية المثلى لـتطبيقات الرؤية الحاسوبية تحقيق توازن دقيق بين الدقة وسرعة الاستدلال وإمكانية النشر. في هذا التحليل التقني الشامل، نستكشف الفروق الأساسية بين YOLOX، وهي بنية CNN ناجحة للغاية لا تعتمد على المراسي، وRTDETRv2، وهو محوّل متطور للكشف الآني.
على الرغم من أن كلا النموذجين قدما إسهامات مهمة في مجال الكشف عن الأجسام، فإن المطورين الذين ينشئون تطبيقات جاهزة للإنتاج يجدون غالبًا أن البدائل الحديثة مثل Ultralytics YOLO26 توفر كفاءة تدريب فائقة، ومتطلبات ذاكرة أقل، ومنظومة نشر أكثر متانة.
YOLOX: ردم الفجوة بين البحث والصناعة#
ظهر YOLOX بوصفه تكييفًا شائعًا للغاية لسلسلة YOLO لا يعتمد على المراسي، إذ قدّم تصميمًا مبسطًا حقق تحسينات مذهلة في الأداء وقت إصداره.
- المؤلفون: Zheng Ge وSongtao Liu وFeng Wang وZeming Li وJian Sun
- المنظمة: Megvii
- التاريخ: 18 يوليو 2021
- الروابط: Arxiv، GitHub، المستندات
الابتكارات المعمارية#
نقلت YOLOX عائلة YOLO إلى نموذج لا يعتمد على المراسي، مع دمج رأس مفصول واستراتيجية SimOTA المتقدمة لإسناد التسميات. ومن خلال إزالة مربعات المراسي، قلّلت البنية عدد معلمات التصميم بدرجة كبيرة وحسّنت التعميم عبر مجموعات بيانات القياس المتنوعة. وأصبحت إصداراتها الخفيفة، YOLOX-Nano وYOLOX-Tiny، خيارات شائعة لنشر تطبيقات الذكاء الاصطناعي للرؤية على الأجهزة الطرفية.
على الرغم من أن YOLOX قدمت تطورات ملحوظة، فإن اعتمادها على مسارات تعزيز مكثفة وإجراءات معالجة لاحقة أقدم (مثل NMS التقليدي) قد يؤدي إلى زمن استجابة أعلى مقارنةً بالنماذج الأصلية من طرف إلى طرف.
RTDETRv2: الارتقاء بمحوّلات الرؤية الآنية#
استنادًا إلى أساس سلفه، يستفيد RTDETRv2 من قوة محوّلات الرؤية (ViTs) لتحقيق دقة تنافسية للغاية دون التضحية بسرعات الاستدلال الآني.
- المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- الروابط: Arxiv، GitHub
الابتكارات المعمارية#
يعيد RTDETRv2 تصور مسار الكشف بصورة جوهرية من خلال استخدام بنية قائمة على المحوّلات تتجاوز بطبيعتها كبت القيم غير العظمى (NMS). ويتحقق ذلك عبر مُرمّز هجين واختيار للاستعلامات واعٍ بـ IoU، ما يحسّن تهيئة استعلامات الأجسام. ويتعامل النموذج بفعالية مع الميزات متعددة المقاييس، مما يتيح له التقاط التفاصيل الدقيقة في البيئات المعقدة، مثل الكشف عن حركة المرور في مقاطع الفيديو الليلية.
ومع ذلك، فإن المحوّلات تستهلك الموارد بطبيعتها. ويتطلب تدريب RTDETRv2 عادةً قدرًا أكبر بكثير من ذاكرة GPU ودورات الحوسبة مقارنةً بالبدائل القائمة على CNN، مما قد يشكل عائقًا أمام الفرق التي تعمل ضمن قيود ميزانية صارمة أو تحتاج إلى ضبط النموذج بصورة متكررة.
جدول مقارنة الأداء#
لتقييم هذه البنى بموضوعية، نفحص أداءها على مجموعة بيانات COCO. ويوضح الجدول أدناه المفاضلات بين الدقة (mAP) وعدد المعلمات والتعقيد الحسابي.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
على الرغم من أن RTDETRv2 تحقق دقة مذهلة، تحافظ YOLOX على أفضلية في أحجام المعلمات الخفيفة، لا سيما مع إصداري Nano وTiny.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLOX وRT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلاتك المتعلقة بالمنظومة.
متى تختار YOLOX؟#
يُعد YOLOX خيارًا قويًا لـ:
- أبحاث الاكتشاف دون مراسٍ: الأبحاث الأكاديمية التي تستخدم بنية YOLOX النظيفة المستغنية عن المراسي خط أساس للتجارب على رؤوس اكتشاف أو دوال خسارة جديدة.
- الأجهزة الطرفية فائقة الخفة: النشر على المتحكمات الدقيقة أو الأجهزة المحمولة القديمة التي تكون فيها البصمة الصغيرة للغاية لمتغير YOLOX-Nano (0.91M معلمة) أمرًا بالغ الأهمية.
- دراسات إسناد التسميات SimOTA: مشاريع بحثية تدرس استراتيجيات إسناد التسميات القائمة على النقل الأمثل وتأثيرها في تقارب التدريب.
متى تختار RT-DETR#
يوصى باستخدام RT-DETR في الحالات التالية:
- أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
- السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
- اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
ميزة Ultralytics: YOLO26#
على الرغم من أن كلًا من YOLOX وRTDETRv2 يقدمان نقاط قوة مميزة، فإن Ultralytics YOLO26 الذي أُطلق حديثًا يعيد تعريف أحدث ما توصل إليه المجال في الذكاء الاصطناعي للرؤية، إذ يعالج المفاضلات التاريخية بين السرعة والدقة وسهولة النشر.
1. بنية من طرف إلى طرف لا تعتمد على NMS#
استلهامًا من نماذج المحوّلات مع الحفاظ على كفاءة CNN، تتميز YOLO26 بتصميم أصلي من طرف إلى طرف لا يعتمد على NMS. ومن خلال إزالة كبت القيم غير العظمى بوصفه خطوة للمعالجة اللاحقة، تبسّط YOLO26 مسارات النشر بدرجة كبيرة، مما يضمن زمن استدلال متسقًا عبر مختلف الأجهزة الطرفية دون أعباء الضبط المعقد لحدود العتبة.
2. استدلال أسرع على CPU بنسبة تصل إلى 43%#
على خلاف بُنى المحوّلات مثل RTDETRv2 التي تعتمد بدرجة كبيرة على وحدات GPU المتطورة، صُممت YOLO26 خصيصًا لتناسب بيئات الحوسبة الطرفية. ومن خلال إزالة Distribution Focal Loss (DFL)، تبسّط YOLO26 عملية تصدير النموذج وتحقق استدلالًا أسرع على CPU بنسبة تصل إلى 43%، مما يجعلها الخيار المثالي للدمج في أجهزة مثل Raspberry Pi أو الأجهزة المحمولة القياسية.
3. كفاءة التدريب مع MuSGD#
غالبًا ما يؤدي تدريب نماذج المحوّلات إلى استهلاك مفرط لـذاكرة CUDA وأوقات تدريب طويلة. وتقدم YOLO26 مُحسِّن MuSGD المبتكر، وهو مزيج من الانحدار المتدرج العشوائي ومُحسِّن Muon المستوحى من نماذج LLM. ويوفر هذا الابتكار تدريبًا مستقرًا للغاية وتقاربًا أسرع، مما يقلل متطلبات العتاد بدرجة كبيرة مقارنةً بـ RTDETRv2.
4. منظومة وتعدد استخدامات لا مثيل لهما#
توفر منظومة Ultralytics تجربة مطور بديهية ومبسطة. ومع التوثيق الشامل، ودعم المجتمع النشط، ومنصة Ultralytics المدعومة بالسحابة، لم تعد إدارة دورة حياة الذكاء الاصطناعي الكاملة أسهل من أي وقت مضى. علاوةً على ذلك، تتميز YOLO26 بتعدد استخدامات كبير. ففي حين يركز RTDETRv2 على الكشف عن الأجسام، تدعم YOLO26 بسلاسة مهام تجزئة المثيلات، وتقدير الوضعية، وتصنيف الصور، والمربع المحيط الموجّه (OBB) بصورة أصلية. وبفضل دوال الخسارة الجديدة ProgLoss + STAL، تتفوق YOLO26 أيضًا في التعرف على الأجسام الصغيرة، وهي ميزة مهمة لـالصور الجوية والكشف عن العيوب الصناعية.
تكامل سلس مع Ultralytics#
لا ينبغي أن يتطلب نشر النماذج التعامل مع مستودعات شفرات معقدة ومجزأة. تتيح لك واجهة Python البرمجية لـ Ultralytics تحميل النماذج المتطورة وتدريبها وتصديرها باستخدام بضعة أسطر فقط من الشفرة.
from ultralytics import YOLO
# Load the latest YOLO26 nano model for optimal edge performance
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset with minimal memory overhead
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate the model's performance
metrics = model.val()
# Export seamlessly to ONNX or TensorRT for deployment
model.export(format="onnx", optimize=True)ومن خلال الاستفادة من Ultralytics، تتجنب إعدادات البيئات المعقدة المرتبطة عادةً بمستودعات البحث، مما يسرّع وصولك إلى السوق.
الخلاصة#
تمثل YOLOX وRTDETRv2 محطتين مهمتين في تطور الكشف عن الأجسام في الزمن الحقيقي. فقد أثبتت YOLOX جدوى شبكات CNN عالية الكفاءة التي لا تعتمد على المراسي، في حين نجح RTDETRv2 في تكييف المحوّلات مع قيود الزمن الحقيقي.
ومع ذلك، بالنسبة إلى التطبيقات الحديثة التي تمتد من تحليلات تجارة التجزئة الذكية إلى الروبوتات المضمنة، تقدم Ultralytics YOLO26 الحل الحاسم. فمن خلال الجمع بين الاستدلال الذي لا يعتمد على NMS وسرعات CPU غير المسبوقة، وتقليل استهلاك الذاكرة، والدعم المتين الذي توفره منصة Ultralytics، تمكّن YOLO26 المطورين من بناء الجيل التالي من أنظمة الرؤية الحاسوبية الموثوقة وعالية الأداء.