رؤية YOLO لعام 2026:

مقارنة بين YOLOv7 و RTDETRv2#

يستمر مشهد رؤية الحاسوب في التطور بسرعة، متأثراً بشكل كبير بالمنافسة بين الشبكات العصبية التلافيفية (CNNs) ومحولات الرؤية (ViTs). تتعمق هذه المقارنة التقنية في بنيتين من العيار الثقيل: YOLOv7، وهو كاشف أجسام قائم على الشبكات العصبية التلافيفية ومُحسّن للغاية، وRTDETRv2، وهو محول اكتشاف متطور في الوقت الفعلي.

من خلال تحليل الاختلافات المعمارية، ومقاييس الأداء، وسيناريوهات النشر المثالية، يمكن للمطورين اتخاذ قرارات مستنيرة عند دمج نماذج ذكاء الرؤية الاصطناعي هذه في مسارات العمل الإنتاجية الخاصة بهم.

YOLOv7: معمارية الشبكة العصبية التلافيفية (CNN) القائمة على مجموعة "الفوائد المجانية" (Bag-of-Freebies)#

قدم YOLOv7 العديد من التحسينات الهيكلية التي غيرت المفاهيم في عائلة YOLO التقليدية، مما دفع حدود اكتشاف الأجسام في الوقت الفعلي من خلال سلسلة من "مجموعة الفوائد المجانية القابلة للتدريب".

الخصائص الرئيسية: المؤلفون: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
المنظمة: Institute of Information Science, Academia Sinica
التاريخ: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: WongKinYiu/yolov7

المعمارية ونقاط القوة#

تعتمد YOLOv7 بشكل أساسي على بنية شبكة تجميع الطبقات الفعالة الموسعة (E-ELAN). يتيح هذا التصميم الهيكلي للنموذج تعلم ميزات أكثر تنوعاً دون تدمير مسار التدرج الأصلي. علاوة على ذلك، فهي تدمج عمليات الالتفاف المجدولة المعاد صياغتها، مما يحسن سرعة الاستدلال دون تقليل الدقة. يتيح نهج مجموعة الهدايا المجانية القابلة للتدريب تحقيق مقايضات مثيرة للإعجاب بين السرعة والدقة، مما يجعلها مناسبة للغاية لمهام real-time object detection على وحدات معالجة الرسوميات المخصصة للخوادم.

تتميز YOLOv7 أيضاً بمرونة عالية. فبالإضافة إلى اكتشاف مربعات الإحاطة القياسية، يقدم المستودع فروعاً لتقدير pose estimation وتجزئة الحالات instance segmentation، مما يوضح مدى قابليتها للتكيف.

القيود#

مثل العديد من نماذج الشبكات العصبية التلافيفية (CNN) القديمة، يعتمد YOLOv7 على كبت الحد الأقصى غير (NMS) للمعالجة اللاحقة. يُدخل NMS تأخيراً متغيراً، خاصة في المشاهد المزدحمة، مما قد يعقد ضمانات الأداء الصارمة في الوقت الفعلي على أجهزة الحافة.

اعرف المزيد عن YOLOv7

RTDETRv2: تطوير محولات الوقت الفعلي#

يبني RTDETRv2 على إطار عمل RT-DETR الأصلي، مما يؤكد بشكل أكبر أن المحولات يمكنها منافسة بنيات YOLO في زمن انتقال الوقت الفعلي مع الحفاظ على دقة مكانية عالية.

الخصائص الرئيسية: المؤلفون: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
المنظمة: Baidu
التاريخ: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: lyuwenyu/RT-DETR

المعمارية ونقاط القوة#

يمثل RTDETRv2 خطوة إلى الأمام مهمة لمحولات الرؤية (Vision Transformers). فهو يگیف عملية اختيار مرنة للاستعلامات ومشفراً هجيناً فعالاً لمعالجة الميزات متعددة المقاييس بسرعة. ومن خلال تقديم "مجموعة هدايا مجانية" جديدة مصممة خصيصاً لمحولات الكشف (DETRs)، فإنه يدفع الاستدلال المكاني إلى أقصى حدودها. وباعتباره خالياً من NMS بشكل أصلي، فهو يوفر أوقات استدلال حتمية، وهي ميزة حاسمة لتطبيقات smart city applications والقيادة الذاتية الصارمة.

القيود#

على الرغم من تطوراته، يحمل RTDETRv2 الأعباء التقليدية للبنى القائمة على المحولات (transformers). فهو يتطلب ذاكرة CUDA أعلى بشكل ملحوظ أثناء التدريب والاستدلال مقارنة بشبكات CNN. بالإضافة إلى ذلك، فإن أوقات تقارب التدريب الخاصة به أطول بشكل ملحوظ، مما يتطلب كميات هائلة من البيانات المشروحة عالية الجودة (مثل COCO dataset) وموارد حسابية كثيفة.

تعرف على المزيد حول RTDETRv2

مقارنة الأداء#

عند قياس أداء هذه النماذج، يجب أن ننظر إلى صورة شاملة تشمل الدقة، وسرعة الاستدلال الخام، والبصمة الحوسبية. فيما يلي جدول مقارنة مباشر.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
تفسير المقاييس

بينما يدعي RTDETRv2-x تحقيق أعلى mAPval مطلقة بنسبة 54.3%، فإنه يتطلب 259 مليار FLOPs هائلة. في المقابل، توفر بنيات YOLOv7 خط أساس ممتاز ولكنها تعاني من أعباء NMS القديمة التي لا يتم التقاطها بالكامل في مقاييس زمن انتقال الشبكة البحتة.

ميزة Ultralytics: النظام البيئي والتطور#

بينما يقدم YOLOv7 و RTDETRv2 قدرات قوية، فإن نشرهما في بيئات الإنتاج غالباً ما يكشف عن احتكاكات لوجستية. وهنا يتفوق نظام Ultralytics البيئي. تم تصميم إطار عمل Ultralytics للتكامل السلس من البداية إلى النهاية، ويوفر للمطورين واجهة برمجة تطبيقات (API) موحدة تجرد التعقيدات النموذجية لمسارات عمل رؤية الحاسوب.

تعدد استخدامات لا مثيل له وكفاءة في الذاكرة#

على عكس نماذج المحولات الصارمة التي تستهلك كميات هائلة من ذاكرة VRAM، تحافظ نماذج Ultralytics YOLO على كفاءة صارمة في الذاكرة. يتيح ذلك التدريب السريع للنموذج model training على الأجهزة المتاحة. يدعم النظام البيئي بطبيعته مهام رؤية حاسوبية متعددة من قاعدة كود واحدة، بما في ذلك تصنيف الصور image classification واكتشاف مربعات الإحاطة الموجهة oriented bounding box (OBB) detection، مما يوفر مرونة يفتقر إليها RTDETRv2 حالياً.

نشر سلس#

الانتقال من البحث إلى الإنتاج يتطلب خيارات نشر قوية. تتعامل واجهة برمجة التطبيقات Ultralytics API بشكل أصلي مع تصدير النموذج بنقرة واحدة model export إلى المعايير الصناعية. سواء كنت تستهدف ONNX لتوافق الأنظمة الأساسية أو TensorRT لتحقيق أقصى تسريع لوحدة معالجة الرسوميات، فإن خط الأنابيب مؤتمت بالكامل وموثوق.

الترقية المطلقة: Ultralytics YOLO26#

بالنسبة للمطورين الذين يجادلون بين YOLOv7 و RTDETRv2، فإن المسار الأمثل للمضي قدماً هو في الواقع المعيار الجديد في ذكاء الرؤية الاصطناعي: Ultralytics YOLO26. تم إطلاق YOLO26 في يناير 2026، وهو يسد الفجوة بين سرعة الشبكات العصبية التلافيفية (CNNs) والاستدلال المتطور للمحولات، مع القضاء تماماً على نقاط ضعف كل منهما.

تعرف على المزيد حول YOLO26

يقدم YOLO26 ابتكارات رائدة مصممة لكل من عمليات نشر الخوادم والحافة:

  • تصميم خالٍ من NMS من البداية إلى النهاية: رُدّت ريادته لأول مرة في YOLOv10، حيث تلغي YOLO26 معالجة ما بعد NMS بشكل أصلي. يضمن هذا زمن الانتقال الحتمي الخاص بـ RTDETRv2 دون العبء الحسابي الثقيل للمحول.
  • مُحسِّن MuSGD: مستوحى من تقنيات تدريب النماذج اللغوية الكبيرة (مثل Kimi K2 من Moonshot AI)، يستخدم YOLO26 مزيجاً من SGD و Muon. وهذا يوفر استقراراً غير مسبوق في التدريب وأوقات تقارب أسرع بكثير مقارنة بتطبيقات AdamW القياسية التي تستخدمها ViTs.
  • ProgLoss + STAL: توفر هذه الدوال المتقدمة للخسارة تحسينات ملحوظة في التعرف على الكائنات الصغيرة، حيث تتنافس بشكل مباشر مع مزايا الميزات متعددة المقاييس لـ RTDETRv2، وهو أمر بالغ الأهمية لأتمتة الروبوتات robotic automation.
  • تحسين الحافة وإزالة DFL: من خلال إزالة Distribution Focal Loss (DFL)، يعمل YOLO26 على تبسيط رأس المخرجات، مما يؤدي إلى استدلال أسرع بنسبة تصل إلى 43% على وحدة المعالجة المركزية (CPU)، مما يجعله أكثر قابلية للنشر على أجهزة الحافة من نماذج المحولات الثقيلة.

مثال تدريبي مع Ultralytics#

تسمح بساطة واجهة برمجة تطبيقات Python الخاصة بـ Ultralytics بتدريب نموذج YOLO26 المتطور ببضعة أسطر فقط من الكود:

from ultralytics import YOLO

# Load the highly efficient YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
# The framework automatically manages data augmentation and hyperparameter tuning
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")

# Effortlessly export to TensorRT for deployment
model.export(format="engine", dynamic=True)

حالات الاستخدام المثالية#

يعتمد اختيار البنية الصحيحة بشكل كبير على قيود النشر وتوافر الأجهزة:

متى تفكر في YOLOv7:

  • مشاريع البحث القديمة حيث يعد YOLOv7 خط أساس راسخ.
  • البيئات التي يتوفر فيها تسريع GPU الخام بكثرة ويكون تذبذب زمن انتقال NMS مقبولاً.

متى تفكر في RTDETRv2:

  • عمليات نشر الخوادم المتطورة التي تتطلب أقصى mAP ممكن.
  • السيناريوهات التي يكون فيها زمن استدلال حتمي (بدون NMS) مطلوباً بصرامة، بشرط توفر ذاكرة الوصول العشوائي للفيديو (VRAM) لدعم بنيتها الأساسية القائمة على المحولات.

متى تختار Ultralytics YOLO26:

  • تقريباً دائماً. إنه يوفر حتمية خالية من NMS لـ RTDETRv2، ويتجاوز سرعة ودقة YOLOv7، ويستخدم ذاكرة VRAM أقل بكثير، وهو مدمج بالكامل في Ultralytics Platform لإدارة مجموعات البيانات والتدريب والنشر بسهولة.
استكشف المزيد من النماذج

هل أنت مهتم بكيفية تكديس البنى الأخرى؟ استكشف تحليلاتنا المعميقة للأجيال السابقة مثل YOLO11 و YOLOv8، أو تعرف على كيفية الاستفادة من ضبط المعلمات الفائقة hyperparameter tuning لتحقيق أقصى قدر من دقة مشروعك.

التعليقات