RTDETRv2 مقابل YOLOv7#
شهد مجال الرؤية الحاسوبية توسعًا كبيرًا خلال السنوات القليلة الماضية، مدفوعًا بالابتكارات المتواصلة في كل من الشبكات العصبية الالتفافية (CNN) وTransformers للرؤية (ViT). ويتطلب اختيار البنية المناسبة لعملية النشر فهم المفاضلات الدقيقة بين السرعة والدقة والعبء الحاسوبي. يستكشف هذا الدليل الفروق التقنية بين بنيتين تحظيان بتقدير كبير، RTDETRv2 وYOLOv7، كما يسلط الضوء على التطورات الحديثة المتاحة في YOLO26 الأحدث من Ultralytics.
RTDETRv2: نهج Transformer للكشف الآني#
يستند RTDETRv2 (Transformer للكشف الآني، الإصدار 2) إلى أساس النموذج السابق، ليثبت قدرة البنى القائمة على Transformer على المنافسة بفاعلية في السيناريوهات الآنية دون الاعتماد على خطوات المعالجة اللاحقة التقليدية.
- المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
- الجهة: Baidu
- التاريخ: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: مستودع RTDETRv2
أبرز السمات المعمارية#
يستخدم RTDETRv2 بنية هجينة للمُرمِّز وفك ترميز Transformer. ومن خلال الاستفادة من آليات الانتباه الذاتي، يعالج النموذج الصورة بأكملها بصورة شمولية، ما يتيح له فهم العلاقات المكانية المعقدة على نحو أفضل من نوى الالتفاف ذات المجال المحلي حصرًا. ومن أبرز ميزاته تصميمه الأصلي الخالي من NMS. إذ يلغي RTDETRv2 كبح الحد الأقصى غير المتداخل (NMS)، متجاوزًا بذلك أحد الاختناقات الشائعة التي تسبب تفاوتًا في زمن استجابة الاستدلال أثناء النشر.
نقاط القوة والقيود#
تكمن نقطة القوة الأساسية في RTDETRv2 في قدرته على التعامل مع الأجسام الكثيفة والمتداخلة في المشاهد المعقدة. ويجعل السياق الشامل الذي توفره طبقات انتباه Transformer النموذج دقيقًا للغاية، خصوصًا في الحالات التي يكثر فيها الاحتجاب.
لكن ذلك يأتي على حساب الموارد الحاسوبية. فعادةً ما تتطلب نماذج Transformer ذاكرة أكبر أثناء التدريب والاستدلال مقارنةً بنماذج CNN. علاوة على ذلك، يحتاج RTDETRv2 عمومًا إلى عصور تدريب أكثر لتحقيق التقارب أثناء التدريب الموزع، ما يطيل دورات التكرار للمطورين الذين يضبطون مجموعات بيانات مخصصة.
YOLOv7: نموذج أساسي من CNN للسرعة#
صدر YOLOv7 قبل RTDETRv2 بعامين، وقدم عدة تحسينات بنيوية لإطار عمل YOLO الكلاسيكي، واضعًا معيارًا قويًا للكواشف الآنية القائمة على CNN وقت نشره.
- المؤلفون: Chien-Yao Wang وAlexey Bochkovskiy وHong-Yuan Mark Liao
- المؤسسة: معهد علوم المعلومات، أكاديميا سينيكا، تايوان
- التاريخ: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: مستودع YOLOv7
أبرز السمات المعمارية#
تتمحور بنية YOLOv7 حول مفهوم شبكة تجميع الطبقات الممتدة والفعالة (E-ELAN). ويحسّن هذا النهج مسار التدرج، ما يسمح للنموذج بالتعلم بفاعلية أكبر دون زيادة التعقيد الحاسوبي بدرجة كبيرة. كما قدم المؤلفون «مجموعة من الأساليب القابلة للتدريب دون تكلفة إضافية»، وهي مجموعة من الطرق التي تحسن دقة النموذج أثناء التدريب دون التأثير في سرعة الاستدلال على الأجهزة الطرفية.
نقاط القوة والقيود#
يظل YOLOv7 نموذجًا عالي الكفاءة لمهام كشف الأجسام القياسية، إذ يوفر سرعات معالجة ممتازة على وحدات GPU الاستهلاكية. وبفضل طبيعته القائمة على CNN، يحتاج عادةً إلى ذاكرة CUDA أقل أثناء التدريب مقارنةً بالنماذج القائمة على Transformer مثل RTDETRv2.
على الرغم من هذه المزايا، لا يزال YOLOv7 يعتمد على NMS في المعالجة اللاحقة. وفي البيئات التي تضم تنبؤات كثيفة، قد تؤدي خطوة NMS إلى تقلبات في زمن المعالجة، ما يصعّب ضمان الأداء الآني الصارم. وإضافةً إلى ذلك، قد تكون معالجة المهام المتنوعة مثل تجزئة المثيلات وتقدير الوضعية مجزأة مقارنةً بأطر العمل الحديثة.
مقارنة الأداء#
يتطلب تقييم هذه النماذج النظر في التوازن الدقيق بين متوسط الدقة (mAP) وعدد المعلمات وسرعة الاستدلال.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
على الرغم من أن RTDETRv2-x يحقق أعلى mAP، فإن عدد معلماته وFLOPs هما الأكبر أيضًا. وتوفر الإصدارات الأصغر مثل RTDETRv2-s سرعة تنافسية على TensorRT، لكن على المستخدمين الذين يستهدفون البيئات منخفضة الطاقة دون وحدات GPU مخصصة تقييم إمكانات الاستدلال على CPU بعناية.
الحل الحديث: ظهور YOLO26#
على الرغم من أن RTDETRv2 وYOLOv7 كانا محوريين في دفع حدود تطبيقات الرؤية الحاسوبية، فإن مجال الذكاء الاصطناعي يتطور بسرعة. يجمع YOLO26، الذي أُطلق في يناير 2026، أفضل مزايا كفاءة CNN وبنى Transformer الخالية من NMS.
توفر منصة Ultralytics المتكاملة ومنظومة Python للمطورين والباحثين الذين يبنون أنظمة جديدة تجربة موحدة تقلل الدين التقني بدرجة كبيرة.
أبرز الابتكارات في YOLO26#
- تصميم شامل من البداية إلى النهاية وخالٍ من NMS: يعمل YOLO26 أصليًا من البداية إلى النهاية، متجاوزًا المعالجة اللاحقة لـ NMS باستخدام رأسه الاختياري أحادي المطابقة (
nms=False) لنشر أسرع وأبسط. وقد طُوّر هذا النهج الثوري أولًا في YOLOv10، ما يضمن استقرار زمن الاستجابة بصرف النظر عن كثافة الأجسام. - استدلال أسرع على CPU بنسبة تصل إلى 43%: جرى تحسينه خصيصًا لـالحوسبة الطرفية والأجهزة التي لا تحتوي على وحدات GPU، ما يجعله أكثر تنوعًا بكثير لعمليات النشر الميدانية مقارنةً بنماذج Transformer الثقيلة.
- محسّن MuSGD: مزيج من SGD وMuon، استُلهم من Kimi K2 من Moonshot AI، وينقل ابتكارات تدريب LLM إلى الرؤية الحاسوبية لتوفير تدريب أكثر استقرارًا وتقارب أسرع.
- إزالة DFL: أُزيلت Distribution Focal Loss، ما أدى إلى تبسيط المخطط الحاسوبي وتسهيل التصدير إلى وحدات NPU المضمنة وبيئات TensorRT.
- ProgLoss + STAL: تحقق دوال الخسارة المحسّنة تحسنًا ملحوظًا في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لـالروبوتات وإنترنت الأشياء وتحليل الصور الجوية.
- تحسينات خاصة بكل مهمة: لا يقتصر YOLO26 على الكشف. فهو يتضمن نماذج أولية متعددة المقاييس للتجزئة، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لتقدير الوضعية، ودالة خسارة متخصصة للزوايا تعالج مشكلات حدود مربعات الإحاطة الموجّهة (OBB).
تجربة مطور مبسطة#
الميزة الحقيقية لاختيار نموذج من Ultralytics مثل YOLO26 (أو YOLO11 الشائع جدًا) هي المنظومة التي تحظى بصيانة جيدة. ويتطلب تدريب مجموعة بيانات مخصصة حدًا أدنى من التعليمات البرمجية التمهيدية:
from ultralytics import YOLO
# تهيئة نموذج YOLO26 المتقدم
model = YOLO("yolo26s.pt")
# تدريب النموذج على مجموعة بيانات COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# تصدير سلس للنشر على الأجهزة الطرفية
model.export(format="onnx", dynamic=True)حالات الاستخدام والتطبيقات المثالية#
يعتمد الاختيار بين هذه البنى بدرجة كبيرة على العتاد المستهدف والمتطلبات التشغيلية المحددة.
متى يُنصح باستخدام RTDETRv2#
يتميز RTDETRv2 بفاعليته الكبيرة في بيئات المعالجة على الخوادم المزودة بوحدات GPU قوية. وتجعله آلية الانتباه الشامل مناسبًا لفهم المشاهد المعقدة، مثل مراقبة الفعاليات المكتظة جدًا أو التصوير الطبي المتخصص الذي تتطلب فيه السمات المتداخلة تحليلًا سياقيًا عميقًا.
متى يُنصح بالتفكير في YOLOv7#
غالبًا ما يُحتفظ بـ YOLOv7 في الأبحاث الأكاديمية القديمة كنموذج أساسي للمقارنة. كما يظهر في عمليات النشر الصناعية الأقدم، حيث تكون مسارات العمل الحالية مبرمجة بإصدارات محددة من PyTorch ولا تتطلب مرونة المهام المتعددة التي توفرها أطر العمل الأحدث.
لماذا يُعد YOLO26 المعيار الموصى به#
توفر YOLO26 توازنًا لا مثيل له لبنية المدن الذكية وملاحة الطائرات المسيّرة والتصنيع عالي السرعة. وتجعل متطلباته المنخفضة للذاكرة ضبط المعلمات الفائقة والتدريب ممكنين على العتاد الاستهلاكي، في حين يضمن استدلاله الخالي من NMS تنفيذًا سريعًا على الأجهزة الطرفية محدودة الموارد مثل Raspberry Pi أو NVIDIA Jetson.
هل ترغب في معرفة أداء هذه النماذج مقارنةً ببنى أخرى؟ اطّلع على أدلتنا المفصلة حول YOLO11 مقابل RT-DETR وYOLOv8 مقابل YOLOv7 للعثور على الخيار الأنسب لمشروع الذكاء الاصطناعي البصري.