RTDETRv2 مقابل YOLOv7#
لقد توسع مشهد computer vision بشكل هائل خلال السنوات القليلة الماضية، مدفوعاً بالابتكارات المستمرة في كل من الشبكات العصبية التلافيفية (CNNs) ومحولات الرؤية (ViTs). يتطلب اختيار البنية المناسبة لعملية النشر الخاصة بك فهم المفاضلات الدقيقة بين السرعة، والدقة، والعبء الحسابي. يستكشف هذا الدليل الفروق التقنية بين بنيتين تحظيان بتقدير كبير: RTDETRv2 وYOLOv7، مع تسليط الضوء أيضاً على التطورات الحديثة المتوفرة في الإصدار الأحدث من Ultralytics YOLO26.
RTDETRv2: نهج المحولات (Transformer) للكشف في الوقت الفعلي#
يعتمد نموذج RTDETRv2 (نسخة محول الكشف في الوقت الفعلي 2) على أساس سابقه ليثبت أن البنيات القائمة على المحولات يمكنها المنافسة بفعالية في سيناريوهات الوقت الفعلي دون الاعتماد على خطوات المعالجة اللاحقة التقليدية.
المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
المنظمة: Baidu
التاريخ: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: مستودع RTDETRv2
أبرز ميزات البنية#
تستخدِم بنية RTDETRv2 مشفرًا هجينًا وبنية transformer decoder. من خلال الاستفادة من آليات الانتباه الذاتي، يقوم النموذج بمعالجة الصورة بأكملها بشكل شمولي، مما يسمح له بفهم العلاقات المكانية المعقدة بشكل أفضل مقارنة بالنوى التلافيفية الموضعية البحتة. تتمثل إحدى أبرز ميزاته في تصميمه الخالي من NMS بشكل أصلي. ومن خلال القضاء على كبح التداخل غير الأعظمي (NMS)، تزيل بنية RTDETRv2 عنق الزجاجة الشائع الذي يتسبب في inference latency متغير أثناء النشر.
نقاط القوة والقيود#
تكمن القوة الأساسية لـ RTDETRv2 في قدرته على التعامل مع الكائنات الكثيفة والمتداخلة في المشاهد المعقدة. السياق العالمي الذي توفره طبقات انتباه المحول يجعله دقيقاً للغاية، خاصة في السيناريوهات التي تكون فيها الانسدادات متكررة.
مع ذلك، يأتي هذا بتكلفة حسابية. تتطلب نماذج المحولات تقليديًا بصمة ذاكرة أكبر أثناء التدريب والاستدلال مقارنة بالشبكات العصبية التلافيفية. علاوة على ذلك، تتطلب بنية RTDETRv2 عمومًا المزيد من الحقبة الزمنية (Epochs) للتقارب أثناء distributed training، مما يؤدي إلى دورات تكرار أطول للمطورين الذين يقومون بضبط مجموعات البيانات المخصصة.
YOLOv7: نموذج CNN الأساسي للسرعة#
تم إصدار YOLOv7 قبل عام من RTDETRv2، وقد قدم العديد من التحسينات الهيكلية لإطار عمل YOLO الكلاسيكي، مما وضع معياراً قوياً للكاشفات التي تعتمد على CNN في الوقت الفعلي وقت نشره.
المؤلفون: Chien-Yao Wang، وAlexey Bochkovskiy، وHong-Yuan Mark Liao
المنظمة: معهد علوم المعلومات، أكاديمية سينيكا، تايوان
التاريخ: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: مستودع YOLOv7
أبرز ميزات البنية#
تُبنى بنية YOLOv7 حول مفهوم شبكة تجميع الطبقات الفعالة الموسعة (E-ELAN). يعمل هذا النهج على تحسين مسار التدرج، مما يسمح للنموذج بالتعلم بشكل أكثر فعالية دون زيادة التعقيد الحسابي بشكل كبير. قدم المؤلفون أيضًا "حزمة الأدوات المجانية القابلة للتدريب"، وهي مجموعة من الطرق التي تحسن model accuracy أثناء التدريب دون التأثير على سرعة الاستدلال على الأجهزة الطرفية.
نقاط القوة والقيود#
يظل نموذج YOLOv7 نموذجًا عالي الكفاءة لمهام object detection القياسية، حيث يوفر سرعات معالجة ممتازة على وحدات معالجة الرسومات الخاصة بالمستهلكين. تعني طبيعته القائمة على الشبكات العصبية التلافيفية أنه يتطلب عادةً ذاكرة CUDA أقل أثناء التدريب مقارنة بالنماذج القائمة على المحولات مثل RTDETRv2.
على الرغم من هذه المزايا، لا يزال نموذج YOLOv7 يعتمد على NMS المعالجة اللاحقة. في البيئات ذات الكثافة العالية للتنبؤات، يمكن أن تتسبب خطوة NMS في تقلبات في وقت المعالجة، مما يجعل ضمانات الوقت الحقيقي الصارمة أمرًا صعبًا. بالإضافة إلى ذلك، مقارنة بالأطر الحديثة، يمكن أن تكون عملية التعامل مع المهام المتنوعة مثل instance segmentation وpose estimation مجزأة.
مقارنة الأداء#
يتطلب تقييم هذه النماذج النظر في التوازن الدقيق بين متوسط دقة التنبؤ (mAP)، وعدد المعلمات، وسرعة الاستدلال.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (ms) | السرعة T4 TensorRT10 (ms) | المعلمات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
بينما يحقق RTDETRv2-x أعلى mAP، فإنه يحمل أيضاً أكبر عدد من المعلمات وعمليات FLOPs. توفر المتغيرات الأصغر مثل RTDETRv2-s سرعة تنافسية على TensorRT، ولكن يجب على المستخدمين الذين يستهدفون بيئات الطاقة المنخفضة بدون وحدات معالجة رسومات مخصصة تقييم قدرات استدلال وحدة المعالجة المركزية (CPU) بعناية.
الحل الحديث: YOLO26#
بينما كان نموذجا RTDETRv2 وYOLOv7 محوريين في دفع حدود computer vision applications، فإن مشهد الذكاء الاصطناعي يتطور بسرعة. يُعد نموذج YOLO26، الذي تم إصداره في يناير 2026، خلاصة لأفضل جوانب كفاءة الشبكات العصبية التلافيفية وبنى المحولات الخالية من NMS.
بالنسبة للمطورين والباحثين الذين يبنون أنظمة جديدة، توفر Ultralytics Platform المدمجة ومنظومة Python تجربة موحدة تقلل بشكل كبير من الدين التقني.
الابتكارات الرئيسية في YOLO26#
- تصميم متكامل وخالٍ من NMS: يتميز YOLO26 بأنه متكامل أصلياً من البداية إلى النهاية، مما يلغي معالجة NMS اللاحقة من أجل نشر أسرع وأبسط. تم ريادة هذا النهج الرائد لأول مرة في YOLOv10، مما يضمن استقرار زمن الانتقال بغض النظر عن كثافة الكائنات.
- سرعة استدلال على وحدة المعالجة المركزية أسرع بنسبة تصل إلى 43%: مُحسَّن خصيصًا لـ edge computing والأجهزة التي لا تحتوي على وحدات معالجة رسومات، مما يجعله أكثر تنوعًا لنشر الميداني مقارنة بنماذج المحولات الثقيلة.
- مُحسِّن MuSGD: هجين من SGD و Muon (مستوحى من Kimi K2 لشركة Moonshot AI)، مما يجلب ابتكارات تدريب النماذج اللغوية الكبيرة (LLMs) إلى الرؤية الحاسوبية من أجل تدريب أكثر استقراراً وتقارب أسرع.
- إزالة DFL: تمت إزالة خسارة التركيز التوزعي (Distribution Focal Loss)، مما أدى إلى رسم بياني حسابي مبسط لتصدير أكثر سلاسة إلى الوحدات العصبيّة الطرفية المضمنة وبيئات TensorRT.
- ProgLoss + STAL: تُنتج وظائف الخسارة المحسنة تحسينات ملحوظة في التعرف على الكائنات الصغيرة، وهو أمر بالغ الأهمية لـ robotics وإنترنت الأشياء وتحليل الصور الجوية.
- تحسينات خاصة بالمهام: لا يقتصر YOLO26 على الاكتشاف فقط. فهو يتميز بنماذج أولية متعددة المقاييس للتجزئة، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لتتبع الوضعيات، وخسارة الزاوية المتخصصة التي تعالج مشكلات حدود oriented bounding box (OBB).
تجربة مطور مبسطة#
الميزة الحقيقية لاختيار نموذج Ultralytics مثل YOLO26 (أو YOLO11 الشائع جداً) هي المنظومة المُصانة جيداً. يتطلب تدريب مجموعة بيانات مخصصة الحد الأدنى من التعليمات البرمجية النمطية:
from ultralytics import YOLO
# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)حالات الاستخدام والتطبيقات المثالية#
يعتمد الاختيار بين هذه البنيات بشكل كبير على الأجهزة المستهدفة والمتطلبات التشغيلية المحددة.
متى يجب التفكير في RTDETRv2#
تعتبر بنية RTDETRv2 فعالة للغاية في بيئات server-side processing المجهزة بوحدات معالجة رسومات قوية. تجعلها آلية الانتباه العالمي مناسبة لفهم المشاهد المعقدة، مثل مراقبة الأحداث المزدحمة للغاية أو التصوير الطبي المتخصص حيث تتطلب الميزات المتداخلة تحليلاً سياقيًا عميقًا.
متى يجب التفكير في YOLOv7#
غالباً ما يتم الاحتفاظ بـ YOLOv7 في البحث الأكاديمي القديم كنموذج مقارنة أساسي. كما يوجد في عمليات النشر الصناعية القديمة حيث تكون خطوط الأنابيب الحالية مشفرة بإصدارات PyTorch محددة ولا تتطلب مرونة المهام المتعددة للأطر الأحدث.
لماذا يعد YOLO26 هو المعيار الموصى به#
لبنية smart city الحديثة، وdrone navigation، والتصنيع عالي السرعة، يقدم YOLO26 توازنًا لا مثيل له. تجعل متطلبات الذاكرة المنخفضة الخاصة به hyperparameter tuning والتدريب متاحين على الأجهزة الاستهلاكية، بينما يضمن استدلاله الخالي من NMS التنفيذ السريع على الأجهزة الطرفية المقيدة مثل Raspberry Pi أو NVIDIA Jetson.
هل أنت مهتم بمعرفة كيفية مقارنة هذه النماذج بالبنى الأخرى؟ تحقق من أدلتنا المفصلة حول YOLO11 vs. RTDETR وYOLOv8 vs. YOLOv7 للعثور على الحل الأمثل لمشروع رؤية الذكاء الاصطناعي الخاص بك.