مقارنة بين YOLOv7 وRTDETRv2#
يواصل مشهد الرؤية الحاسوبية تطوره بسرعة، متأثرًا بدرجة كبيرة بالمنافسة بين الشبكات العصبية الالتفافية (CNNs) ومحولات الرؤية (ViTs). تتعمق هذه المقارنة التقنية في بنيتين بارزتين: YOLOv7، وهو كاشف أجسام محسّن للغاية قائم على CNN، وRTDETRv2، وهو محول كشف آني متطور.
ومن خلال تحليل الاختلافات المعمارية ومقاييس الأداء وسيناريوهات النشر المثالية، يمكن للمطورين اتخاذ قرارات مستنيرة عند دمج نماذج الذكاء الاصطناعي للرؤية هذه في مسارات عمل الإنتاج لديهم.
YOLOv7: بنية CNN القائمة على «حقيبة المجانيات»#
قدّم YOLOv7 العديد من التحسينات البنيوية التي غيّرت قواعد اللعبة في عائلة YOLO التقليدية، ودفع حدود كشف الأجسام الآني عبر سلسلة من «حقائب المجانيات القابلة للتدريب».
الخصائص الرئيسية:
- المؤلفون: Chien-Yao Wang، Alexey Bochkovskiy، Hong-Yuan Mark Liao
- الجهة: معهد علوم المعلومات، أكاديمية سينيكا
- التاريخ: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: WongKinYiu/yolov7
البنية ونقاط القوة#
يتفوق YOLOv7 بفضل بنية شبكة تجميع الطبقات الفعّالة الموسعة (E-ELAN). يتيح هذا التصميم البنيوي للنموذج تعلّم ميزات أكثر تنوعًا من دون تدمير مسار التدرج الأصلي. كما يدمج التفافات مُعادَة المعلمات مخططة، تعمل على تحسين سرعة الاستدلال من دون تدهور الدقة. ويتيح له نهج «حقيبة المجانيات القابلة للتدريب» تحقيق موازنة impressive بين السرعة والدقة، ما يجعله مناسبًا للغاية لمهام كشف الأجسام الآني على وحدات GPU مخصصة للخوادم.
يتميز YOLOv7 أيضًا بتعدد الاستخدامات. فبالإضافة إلى كشف مربعات الإحاطة القياسي، يوفر المستودع فروعًا لـتقدير الوضعية وتجزئة المثيلات، مما يبرهن على قابليته للتكيف.
القيود#
مثل العديد من نماذج CNN القديمة، يعتمد YOLOv7 على كبت غير الأعظم (NMS) للمعالجة اللاحقة. ويؤدي NMS إلى زمن استجابة متغير، لا سيما في المشاهد المزدحمة، ما قد يعقّد ضمانات الزمن الآني الصارمة على الأجهزة الطرفية.
RTDETRv2: الارتقاء بالمحولات الآنية#
يبني RTDETRv2 على إطار RT-DETR الأصلي، ويؤكد بدرجة أكبر قدرة المحولات على منافسة بنيات YOLO في زمن الاستجابة الآني مع الحفاظ على دقة مكانية عالية.
الخصائص الرئيسية:
- المؤلفون: Wenyu Lv، Yian Zhao، Qinyao Chang، Kui Huang، Guanzhong Wang، Yi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
البنية ونقاط القوة#
يمثل RTDETRv2 خطوة مهمة إلى الأمام لمحولات الرؤية. فهو يستفيد من عملية مرنة لاختيار الاستعلامات ومشفّر هجين فعّال لمعالجة الميزات متعددة المقاييس بسرعة. ومن خلال تقديم «حقيبة مجانيات» جديدة مصممة خصيصًا لمحولات الكشف (DETRs)، يدفع الاستدلال المكاني إلى أقصى حدوده. وبما أنه خالٍ أصلًا من NMS، فإنه يوفر أزمنة استدلال حتمية، وهي ميزة حاسمة لتطبيقات المدن الذكية الصارمة والقيادة الذاتية.
القيود#
رغم تقدمه، يحمل RTDETRv2 الأعباء التقليدية للبنى القائمة على المحولات. فهو يتطلب قدرًا أكبر بكثير من ذاكرة CUDA أثناء التدريب والاستدلال مقارنةً بنماذج CNN. بالإضافة إلى ذلك، تكون أزمنة تقارب التدريب أطول بوضوح، ما يتطلب كميات هائلة من البيانات المشروحة عالية الجودة، مثل مجموعة بيانات COCO، وموارد حوسبة كبيرة.
مقارنة الأداء#
عند قياس أداء هذه النماذج، يجب النظر إلى صورة شاملة تشمل الدقة وسرعة الاستدلال الخام والبصمة الحوسبية. يرد أدناه جدول مقارنة مباشر.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
بينما يدّعي RTDETRv2-x تحقيق أعلى قيمة mAPval مطلقًا بنسبة 54.3%، فإنه يتطلب 259 مليار عملية FLOPs ضخمة. وعلى العكس، توفر بنيات YOLOv7 خط أساس ممتازًا، لكنها تعاني من الحمل الزائد لـNMS القديم، الذي لا تُلتقط آثاره بالكامل في مقاييس زمن استجابة الشبكة الخالص.
ميزة Ultralytics: المنظومة والتطور#
رغم أن YOLOv7 وRTDETRv2 يقدمان إمكانات قوية، فإن نشرهما في بيئات الإنتاج يكشف غالبًا عن تعقيدات لوجستية. وهنا تتفوق منظومة Ultralytics. وقد صُمم إطار Ultralytics للتكامل السلس من البداية إلى النهاية، ويوفر للمطورين API موحدًا يجرد التعقيدات المعتادة لمسارات عمل الرؤية الحاسوبية.
تعدد استخدامات وكفاءة ذاكرة لا مثيل لهما#
بخلاف نماذج المحولات الجامدة التي تستهلك كميات هائلة من VRAM، تحافظ نماذج Ultralytics YOLO على كفاءة صارمة في استخدام الذاكرة. ويتيح ذلك إجراء تدريب سريع للنماذج على أجهزة متاحة. وتدعم المنظومة بطبيعتها مهام متعددة للرؤية الحاسوبية من قاعدة شيفرة واحدة، بما في ذلك تصنيف الصور وكشف مربعات الإحاطة الموجّهة (OBB)، مما يوفر مرونة يفتقر إليها RTDETRv2 حاليًا.
نشر سلس#
يتطلب الانتقال من البحث إلى الإنتاج خيارات نشر قوية. تتولى API الخاصة بـUltralytics أصلًا تصدير النماذج بنقرة واحدة إلى تنسيقات قياسية في الصناعة. وسواء كنت تستهدف ONNX لتحقيق التوافق بين المنصات أو TensorRT لتحقيق أقصى تسريع لوحدة GPU، فإن مسار العمل مؤتمت وموثوق بالكامل.
الترقية النهائية: Ultralytics YOLO26#
بالنسبة إلى المطورين الذين يوازنون بين YOLOv7 وRTDETRv2، فإن المسار الأمثل إلى الأمام هو في الواقع المعيار الجديد في الذكاء الاصطناعي للرؤية: Ultralytics YOLO26. أُطلق YOLO26 في يناير 2026، وهو يجسر الفجوة بين سرعة CNNs والاستدلال المتطور للمحولات، مع التخلص الكامل من نقاط ضعف كل منهما.
يقدم YOLO26 ابتكارات رائدة مصممة لكل من عمليات النشر على الخوادم والأجهزة الطرفية:
- تصميم شامل خالٍ من NMS: ابتُكر هذا النهج أولًا في YOLOv10، إذ يلغي YOLO26 معالجة NMS اللاحقة أصلًا. ويضمن ذلك زمن الاستجابة الحتمي الذي يقدمه RTDETRv2، من دون الحمل الحوسبي المرهق للمحول.
- مُحسِّن MuSGD: مستلهمًا من تقنيات تدريب نماذج اللغة الكبيرة، مثل Kimi K2 من Moonshot AI، يستخدم YOLO26 مزيجًا هجينًا من SGD وMuon. ويحقق ذلك استقرارًا غير مسبوق في التدريب وأزمنة تقارب أسرع بكثير مقارنةً بتطبيقات AdamW القياسية المستخدمة في ViTs.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وتنافس مباشرةً مزايا الميزات متعددة المقاييس في RTDETRv2، وهو أمر بالغ الأهمية لـالأتمتة الروبوتية.
- تحسين الأجهزة الطرفية وإزالة DFL: من خلال إزالة خسارة البؤرة التوزيعية (DFL)، يبسط YOLO26 رأس المخرجات، ما يؤدي إلى [استدلال أسرع بنسبة تصل إلى 43% على CPU]—ويجعله أكثر قابلية للنشر بدرجة لا نهائية على الأجهزة الطرفية مقارنةً بنماذج المحولات الثقيلة.
مثال على التدريب باستخدام Ultralytics#
تتيح بساطة Python API الخاصة بـUltralytics تدريب نموذج YOLO26 المتطور باستخدام بضعة أسطر فقط من الشيفرة:
from ultralytics import YOLO
# Load the highly efficient YOLO26 small model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
# The framework automatically manages data augmentation and hyperparameter tuning
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")
# Effortlessly export to TensorRT for deployment
model.export(format="engine", dynamic=True)حالات الاستخدام المثالية#
يعتمد اختيار البنية المناسبة بدرجة كبيرة على قيود النشر وتوافر الأجهزة:
متى ينبغي النظر في YOLOv7:
- مشروعات البحث القديمة التي يمثل فيها YOLOv7 خط أساس راسخًا.
- البيئات التي يتوافر فيها تسريع خام لوحدة GPU بوفرة ويكون تقلب زمن استجابة NMS مقبولًا.
متى ينبغي التفكير في RTDETRv2:
- عمليات النشر على خوادم متطورة التي تتطلب أعلى قيمة mAP مطلقًا.
- السيناريوهات التي يكون فيها زمن استجابة الاستدلال الحتمي (الخالي من NMS) مطلوبًا بشدة، شريطة توفر VRAM الكافية لدعم العمود الفقري للمحول.
متى ينبغي اختيار Ultralytics YOLO26:
- تقريبًا دائمًا. فهو يوفر الحتمية الخالية من NMS التي يقدمها RTDETRv2، ويتجاوز YOLOv7 في السرعة والدقة، ويستخدم VRAM أقل بكثير، كما يتكامل بالكامل مع منصة Ultralytics لإدارة مجموعات البيانات والتدريب والنشر بسهولة.
هل تهتم بمعرفة أداء البنى الأخرى؟ استكشف تحليلاتنا المتعمقة للأجيال السابقة مثل YOLO11 وYOLOv8، أو تعلّم كيفية الاستفادة من ضبط المعلمات الفائقة لتحقيق أقصى دقة لمشروعك.