مقارنة بين YOLOv9 و RTDETRv2#
شهد مجال اكتشاف الكائنات الفوري تغيرًا جذريًا في السنوات الأخيرة. وقد ظهرت فلسفتان معم قتان متميزتان لتسيطران على هذا المجال: شبكات العصبونات التلافيفية (CNNs) المحسنة للغاية ومحولات الاكتشاف الفوري (DETRs). ومث ل كل من YOLOv9 و RTDETRv2 قمة هاتين المقاربتين.
يقارن هذا الدليل الشامل بين هذين النموذجين القويين، محل لًا ابتكاراتهما المعمارية، ومقاييس الأداء، وسيناريوهات النشر المثالية لمساعدتك في اختيار النموذج الصحيح لخط أنابيب رؤية الحاسوب الخاص بك.
ملخص تنفيذي#
يحقق كلا النموذجين نتائج متطورة، لكنهما يلبيان قيود نشر وبيئات تطوير مختلفة قليلاً.
- اختر YOLOv9 إذا كنت: تحتاج إلى استخدام فعال للغاية للمعاملات واستدلال سريع على أجهزة الحافة. تدفع YOLOv9 الحدود النظرية لكفاءة CNN، مما يجعلها مثالية للبيئات التي تكون فيها الموارد الحسابية محدودة للغاية.
- اختر RTDETRv2 إذا كنت: تحتاج إلى فهم السياق الدقيق الذي توفره المحولات (Transformers)، خاصة في المشاهد التي تحتوي على انسداد شديد أو علاقات معقدة بين الكائنات، وكان لديك العتاد اللازم لدعم معمارية أثقل قليلاً.
- اختر YOLO26 (موصى به) إذا: كنت تريد الأفضل تمامًا من العالمين معًا. باعتباره أحدث جيل متوفر على منصة Ultralytics، يتميز YOLO26 بتصميم أصلي End-to-End NMS-Free Design (مشابه لنماذج DETR ولكنه أسرع بكثير)، مما يزيل اختناقات المعالجة اللاحقة ويقدم استدلال وحدة المعالجة المركزية (CPU) أسرع بنسبة تصل إلى 43% مقارنة بالأجيال السابقة.
المواصفات الفنية والتأليف#
يوفر فهم أصول هذه النماذج وهدف تصميمها سياقاً حاسماً لخياراتها المعمارية.
YOLOv9#
المؤلفون: Chien-Yao Wang و Hong-Yuan Mark Liao
المؤسسة: Institute of Information Science, Academia Sinica
التاريخ: 2024-02-21
Arxiv: https://arxiv.org/abs/2402.13616
GitHub: WongKinYiu/yolov9
RTDETRv2#
المؤلفون: Wenyu Lv، و Yian Zhao، و Qinyao Chang، و Kui Huang، و Guanzhong Wang، و Yi Liu
المؤسسة: Baidu
التاريخ: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: lyuwenyu/RT-DETR
الابتكارات المعمارية#
YOLOv9: حل اختناق المعلومات#
يقدم Ultralytics YOLOv9 ابتكارين رئيسيين مصممين لمعالجة فقدان المعلومات أثناء مرور البيانات عبر الشبكات العصبية العميقة:
- معلومات التدرج القابلة للبرمجة (PGI): يضمن إطار الإشراف المساعد هذا توليد تدرجات موثوقة لتحديث أوزان الشبكة، مما يحافظ على معلومات الميزات الحاسمة حتى في طبقات الشبكة العميقة جداً.
- شبكة تجميع الطبقات الفعالة المعممة (GELAN): معمارية جديدة تجمع بين نقاط قوة CSPNet و ELAN. تعمل GELAN على تحسين كفاءة المعاملات، مما يسمح لـ YOLOv9 بتحقيق دقة أعلى مع عدد أقل من FLOPs مقارنة بـ CNNs التقليدية.
RTDETRv2: تحسين المحولات في الوقت الفعلي#
بناءً على نجاح RT-DETR الأصلي، يستخدم RTDETRv2 بنية تعتمد على المحولات تتجنب بطبيعتها الحاجة إلى قمع الحد الأقصى غير (NMS). وتتضمن تحسيناته ما يلي:
- استراتيجية حقيبة الهدايا (Bag-of-Freebies): تتضمن نسخة v2 تقنيات تدريب متقدمة وتعزيزات بيانات تعزز الدقة بشكل كبير دون إضافة أي عبء على زمن استجابة الاستدلال.
- المشفر الهجين الفعال: من خلال معالجة الميزات متعددة النطاقات عبر آلية انتباه مفصولة داخل النطاق وعبر النطاقات، يدير RTDETRv2 بكفاءة التكلفة الحسابية العالية التقليدية لمحولات الرؤية (Vision Transformers).
بينما يستفيد RTDETRv2 من المحولات من أجل الاكتشاف الخالي من NMS، تحقق بنية YOLO26 ذلك بشكل أصلي ضمن هيكل CNN مُحس ن للغاية، مما يوفر نفس النشر الانسيابي ولكن بسرعات استدلال على الحافة فائقة التفوق.
مقارنة الأداء#
عند تقييم النماذج للإنتاج، تعد المفاضلة بين الدقة والمتطلبات الحسابية أمرًا بالغ الأهمية. يوضح الجدول أدناه أداء أحجام النماذج المختلفة عبر المعايير القياسية.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (ms) | السرعة T4 TensorRT10 (ms) | المعلمات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
تحليل#
كما تظهر البيانات، تحتفظ YOLOv9 بميزة صارمة في كفاءة المعاملات. يحقق نموذج YOLOv9c دقة mAP مثيرة للإعجاب تبلغ 53.0 بـ 25.3 مليون معامل فقط، مما يجعله خفيف الوزن بشكل لا يصدق.
على العكس من ذلك، يوفر RTDETRv2 منافسة قوية في فئات النماذج المتوسطة إلى الكبيرة. ومع ذلك، يأتي هذا على حساب أعداد معلمات أعلى وعدد عمليات فاصلة عائمة (FLOPs) أكبر بكثير، وهو أمر نموذجي لـ نماذج المحولات. يترجم هذا الاختلاف المعماري أيضًا إلى استخدام الذاكرة: عادةً ما تتطلب نماذج YOLO ذاكرة CUDA أقل بكثير أثناء التدريب والاستدلال مقارنة بنظيراتها من المحولات.
ميزة Ultralytics: النظام البيئي وتعدد الاستخدامات#
على الرغم من أهمية المقاييس المعمارية البحتة، إلا أن النظام البيئي البرمجي غالبًا ما يحدد نجاح مشروع ذكاء اصطناعي. يوفر الوصول إلى هذه النماذج المتقدمة من خلال واجهة برمجة تطبيقات Ultralytics Python مزايا لا تضاهى.
تدريب ونشر مبسط#
يتطلب تدريب محول الاكتشاف عادةً ملفات تكوين معقدة ووحدات معالجة رسومية (GPUs) عالية الأداء. من خلال الاستفادة من إطار عمل Ultralytics، يمكن للمطورين تدريب كل من نموذجي YOLOv9 و RTDETR باستخدام بناء جملة متطابق وبسيط، مع الاستفادة من خطوط أنابيب التدريب عالية الكفاءة والأوزان المدربة مسبقًا والمتاحة بسهولة.
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")تعدد مهام لا مثيل له#
تتمثل إحدى القيود الرئيسية للنماذج المتخصصة مثل RTDETRv2 في تركيزها الضيق على اكتشاف مربعات الإحاطة. في المقابل، يدعم نظام Ultralytics البيئي الأوسع، والذي يضم نماذج مثل YOLO11 و YOLOv8، مجموعة واسعة من مهام رؤية الحاسوب. ويشمل ذلك تجزئة المثيلات بدقة البكسل، وتقدير الوضعيات الهيكلية، وتصنيف الصور بالكامل، واكتشاف مربعات الإحاطة الموجهة (OBB) للصور الجوية.
تطبيقات العالم الحقيقي#
تحليلات الحافة عالية السرعة#
بالنسبة لبيئات البيع بالتجزئة أو خطوط التصنيع التي تتطلب التعرف على المنتجات في الوقت الفعلي على الأجهزة الطرفية، يعد YOLOv9 الخيار الأفضل. تضمن بنية GELAN الخاصة به معدل إنتاجية عالٍ على الأجهزة المقيدة مثل سلسلة NVIDIA Jetson، مما يتيح مراقبة الجودة الآلية بدون تأخير ملحوظ.
تحليل المشاهد المعقدة#
في سيناريوهات مثل مراقبة الحشود الكثيفة أو تقاطعات المرور المعقدة حيث تحجب الكائنات بعضها البعض بشكل متكرر، تتألق آليات الانتباه العالمية لـ RTDETRv2. تسمح قدرة النموذج على الاستدلال أصلاً حول سياق الصورة بالكامل له بالحفاظ على تتبع وكشف قوي حتى عندما تكون الكائنات مخفية جزئياً.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLOv9 و RT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.
متى تختار YOLOv9#
YOLOv9 هي خيار قوي لـ:
- أبحاث اختناق المعلومات: المشاريع الأكاديمية التي تدرس معمارية معلومات التدرج القابلة للبرمجة (PGI) وشبكة تجميع الطبقات الفعالة المعممة (GELAN).
- دراسات تحسين تدفق التدرج: الأبحاث التي تركز على فهم وتخفيف فقدان المعلومات في طبقات الشبكة العميقة أثناء التدريب.
- قياس أداء الكشف عالي الدقة: السيناريوهات التي تكون فيها أداء معيار COCO القوي لـ YOLOv9 مطلوباً كنقطة مرجعية للمقارنات المعمارية.
متى تختار RT-DETR#
يوصى بـ RT-DETR لـ:
- أبحاث الاكتشاف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وهياكل transformer لاكتشاف الكائنات بنهاية واحدة دون NMS.
- سيناريوهات الدقة العالية مع زمن انتقال مرن: التطبيقات التي تكون فيها دقة الاكتشاف هي الأولوية القصوى ويكون زمن انتقال الاستنتاج الأعلى قليلاً مقبولاً.
- اكتشاف الكائنات الكبيرة: المشاهد التي تحتوي بشكل أساسي على كائنات متوسطة إلى كبيرة حيث توفر آلية الانتباه العالمي للمحولات ميزة طبيعية.
متى تختار Ultralytics (YOLO26)#
بالنسبة لمعظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطورين:
- نشر الحافة الخالي من NMS: التطبيقات التي تتطلب استنتاجاً متسقاً ومنخفض زمن الانتقال دون تعقيدات معالجة ما بعد المعالجة باستخدام كبت غير الأقصى.
- بيئات وحدة المعالجة المركزية (CPU) فقط: الأجهزة التي لا تحتوي على تسريع مخصص بوحدة معالجة الرسوميات (GPU)، حيث توفر سرعة استنتاج CPU أسرع بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- الكشف عن الأشياء الصغيرة: السيناريوهات الصعبة مثل صور الطائرات بدون طيار الجوية أو تحليل مستشعرات إنترنت الأشياء (IoT) حيث تعمل ProgLoss و STAL على تعزيز الدقة بشكل كبير على الأشياء الدقيقة.
المستقبل: دخول YOLO26#
بينما يمثل YOLOv9 و RTDETRv2 إنجازات هائلة، فإن مجال رؤية الحاسوب يتحرك بسرعة. للمطورين الذين يتطلعون لبدء مشاريع جديدة، يعد YOLO26 هو الحل الموصى به والأحدث من نوعه.
تم إطلاق YOLO26 في عام 2026، وهو يدمج أفضل ميزات كل من CNNs و DETRs. فهو يتميز بتصميم أصلي End-to-End NMS-Free Design، مما يلغي تمامًا زمن انتقال المعالجة اللاحقة - وهي تقنية تم ريادتها لأول مرة في YOLOv10. علاوة على ذلك، يزيل YOLO26 فقدان التركيز التوزيعي (DFL) لتحسين التوافق مع الحافة ويقدم محسن MuSGD الثوري. مستوحى من تدريب نماذج اللغات الكبيرة (وتحديدًا Kimi K2 لشركة Moonshot AI)، يضمن هذا المحسن الهجين استقرار تدريب غير مسبوق وتقاربًا أسرع.
إلى جانب وظائف فقدان محسنة مثل ProgLoss و STAL للتعرف الاستثنائي على الكائنات الصغيرة، توفر YOLO26 استدلالاً على وحدة المعالجة المركزية (CPU) أسرع بنسبة تصل إلى 43%، مما يعزز مكانتها كنموذج نهائي لنشرات الذكاء الاصطناعي الحديثة.