RTDETRv2 مقابل YOLOv7#
شهد مجال الرؤية الحاسوبية توسعًا هائلًا خلال السنوات القليلة الماضية، مدفوعًا بالابتكارات المستمرة في كلٍّ من الشبكات العصبية الالتفافية (CNNs) وTransformers للرؤية (ViTs). يتطلب اختيار البنية المناسبة لعملية النشر فهم المفاضلات الدقيقة بين السرعة والدقة والنفقات الحسابية. يستكشف هذا الدليل الفروقات التقنية بين بنيتين تحظيان بتقدير كبير: RTDETRv2 وYOLOv7، مع تسليط الضوء أيضًا على التطورات الحديثة المتاحة في YOLO26 الأحدث من Ultralytics.
RTDETRv2: نهج Transformer للكشف في الوقت الفعلي#
يعتمد RTDETRv2 (Transformer للكشف في الوقت الفعلي، الإصدار 2) على الأساس الذي وضعه سلفه، ليثبت أن البنى القائمة على Transformer قادرة على المنافسة بفاعلية في سيناريوهات الوقت الفعلي من دون الاعتماد على خطوات المعالجة اللاحقة التقليدية.
- المؤلفون: Wenyu Lv، وYian Zhao، وQinyao Chang، وKui Huang، وGuanzhong Wang، وYi Liu
- المنظمة: Baidu
- التاريخ: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: مستودع RTDETRv2
أبرز معالم البنية المعمارية#
يستخدم RTDETRv2 بنية مشفّر هجين ومفكّك Transformer. ومن خلال الاستفادة من آليات الانتباه الذاتي، يعالج النموذج الصورة بأكملها بصورة شاملة، ما يتيح له فهم العلاقات المكانية المعقدة على نحو أفضل من النوى الالتفافية المحلية الصارمة. ومن أبرز ميزاته تصميمه الأصلي الخالي من NMS. وبإلغاء قمع غير الأعظمي (NMS)، يزيل RTDETRv2 عنق زجاجة شائعًا يؤدي إلى تباين زمن الاستدلال أثناء النشر.
نقاط القوة والقيود#
تكمن القوة الأساسية لـ RTDETRv2 في قدرته على التعامل مع الأجسام الكثيفة والمتداخلة في المشاهد المعقدة. ويجعل السياق العام الذي توفره طبقات انتباه Transformer النموذجَ عالي الدقة، ولا سيما في السيناريوهات التي يكثر فيها الحجب.
ومع ذلك، يأتي هذا على حساب التكلفة الحسابية. تتطلب نماذج Transformer تقليديًا مساحة ذاكرة أكبر أثناء التدريب والاستدلال مقارنةً بـ CNNs. علاوةً على ذلك، يحتاج RTDETRv2 عمومًا إلى عدد أكبر من العصور التدريبية للتقارب أثناء التدريب الموزّع، ما يؤدي إلى دورات تكرار أطول للمطورين الذين يضبطون مجموعات بيانات مخصصة.
YOLOv7: خط أساس قائم على CNN للسرعة#
طُرح YOLOv7 قبل RTDETRv2 بعام، وأدخل العديد من التحسينات الهيكلية على إطار YOLO التقليدي، واضعًا معيارًا قويًا لكاشفات الوقت الفعلي القائمة على CNN وقت نشره.
- المؤلفون: Chien-Yao Wang وAlexey Bochkovskiy وHong-Yuan Mark Liao
- الجهة: معهد علوم المعلومات، أكاديميا سينيكا، تايوان
- التاريخ: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: مستودع YOLOv7
أبرز معالم البنية المعمارية#
تتمحور بنية YOLOv7 حول مفهوم شبكة تجميع الطبقات الفعّالة الموسّعة (E-ELAN). يعمل هذا النهج على تحسين مسار التدرج، ما يتيح للنموذج التعلم بفاعلية أكبر من دون زيادة كبيرة في التعقيد الحسابي. كما قدّم المؤلفون «حقيبة الهدايا المجانية القابلة للتدريب»، وهي مجموعة من الأساليب التي تحسّن دقة النموذج أثناء التدريب من دون التأثير في سرعة الاستدلال على الأجهزة الطرفية.
نقاط القوة والقيود#
لا يزال YOLOv7 نموذجًا عالي القدرة لمهام الكشف عن الأجسام القياسية، إذ يوفر سرعات معالجة ممتازة على وحدات GPU الاستهلاكية. وتعني طبيعته القائمة على CNN أنه يحتاج عادةً إلى ذاكرة CUDA أقل أثناء التدريب مقارنةً بالنماذج القائمة على Transformer مثل RTDETRv2.
على الرغم من هذه المزايا، لا يزال YOLOv7 يعتمد على NMS للمعالجة اللاحقة. وفي البيئات التي تتسم بكثافة عالية من التنبؤات، قد تؤدي خطوة NMS إلى تقلبات في زمن المعالجة، ما يجعل ضمانات الوقت الفعلي الصارمة صعبة. بالإضافة إلى ذلك، مقارنةً بالأطر الحديثة، يمكن أن تكون عملية التعامل مع المهام المتنوعة مثل تجزئة المثيلات وتقدير الوضعية مجزأة.
مقارنة الأداء#
يتطلب تقييم هذه النماذج النظر في التوازن الدقيق بين متوسط الدقة ( mAP )، وعدد المعاملات، وسرعة الاستدلال.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
بينما يحقق RTDETRv2-x أعلى قيمة mAP، فإنه يتضمن أيضًا أكبر عدد من المعاملات وFLOPs. وتوفر المتغيرات الأصغر مثل RTDETRv2-s سرعة تنافسية على TensorRT، لكن يجب على المستخدمين الذين يستهدفون البيئات منخفضة الطاقة من دون وحدات GPU مخصصة تقييم قدرات الاستدلال على CPU بعناية.
الحل الحديث: تقديم YOLO26#
مع أن RTDETRv2 وYOLOv7 كانا محوريين في دفع حدود تطبيقات الرؤية الحاسوبية، فإن مجال الذكاء الاصطناعي يتطور بسرعة. وقد جرى إصدار YOLO26 في يناير 2026، وهو يجمع أفضل جوانب كفاءة CNN والبنى الشبيهة بـ Transformer والخالية من NMS.
بالنسبة إلى المطورين والباحثين الذين يبنون أنظمة جديدة، توفر منصة Ultralytics المتكاملة ونظام Python البيئي تجربة موحّدة تقلل الدين التقني بدرجة كبيرة.
الابتكارات الرئيسية في YOLO26#
- تصميم شامل خالٍ من NMS: يتميز YOLO26 بطبيعته الشاملة من البداية إلى النهاية، إذ يلغي المعالجة اللاحقة باستخدام NMS لتحقيق نشر أسرع وأبسط. وقد طُوّر هذا النهج الرائد للمرة الأولى في YOLOv10، ما يضمن زمن استجابة مستقرًا بغض النظر عن كثافة الأجسام.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: جرى تحسينه خصيصًا من أجل الحوسبة الطرفية والأجهزة التي لا تحتوي على وحدات GPU، ما يجعله أكثر تنوعًا بكثير لعمليات النشر الميدانية من نماذج Transformer الثقيلة.
- مُحسِّن MuSGD: مزيج من SGD وMuon (مستوحى من Kimi K2 من Moonshot AI)، يجلب ابتكارات تدريب LLM إلى الرؤية الحاسوبية لتحقيق تدريب أكثر استقرارًا وتقارب أسرع.
- إزالة DFL: أُزيل فقدان البؤرة التوزيعي، ما أدى إلى تبسيط الرسم البياني الحسابي لتحقيق تصدير أكثر سلاسة إلى وحدات NPU المضمنة وبيئات TensorRT.
- ProgLoss + STAL: تؤدي دوال الفقد المحسّنة إلى تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لـالروبوتات وإنترنت الأشياء وتحليل الصور الجوية.
- تحسينات خاصة بالمهام: لا يقتصر YOLO26 على الكشف. فهو يتضمن نماذج أولية متعددة المقاييس للتجزئة، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لتتبع الوضعية، وفقدان زاوية متخصصًا لمعالجة مشكلات حدود الصندوق المحيط الموجّه (OBB).
تجربة مطوّرة للمطورين#
تتمثل الميزة الحقيقية لاختيار نموذج من Ultralytics مثل YOLO26 (أو YOLO11 الشائع للغاية) في نظامه البيئي المُصان جيدًا. يتطلب تدريب مجموعة بيانات مخصصة حدًا أدنى من الشيفرة التمهيدية:
from ultralytics import YOLO
# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)حالات الاستخدام والتطبيقات المثلى#
يعتمد الاختيار بين هذه البنى بدرجة كبيرة على العتاد المستهدف والمتطلبات التشغيلية المحددة.
متى ينبغي النظر في RTDETRv2#
يُعد RTDETRv2 فعالًا للغاية في بيئات المعالجة من جهة الخادم المجهزة بوحدات GPU قوية. وتجعل آلية الانتباه العام فيه مناسبًا لفهم المشاهد المعقدة، مثل مراقبة الفعاليات شديدة الازدحام أو التصوير الطبي المتخصص حيث تتطلب السمات المتداخلة تحليلًا سياقيًا عميقًا.
متى ينبغي التفكير في YOLOv7؟#
غالبًا ما يُحافَظ على YOLOv7 في الأبحاث الأكاديمية القديمة كنموذج للمقارنة وخط أساس. كما يوجد في عمليات النشر الصناعية الأقدم حيث تكون خطوط المعالجة الحالية مبرمجة بإحكام لإصدارات محددة من PyTorch ولا تتطلب مرونة المهام المتعددة التي توفرها الأطر الأحدث.
لماذا يُعد YOLO26 المعيار الموصى به#
بالنسبة إلى البنية التحتية الحديثة لـالمدن الذكية، وملاحة الطائرات المسيّرة، والتصنيع عالي السرعة، يوفر YOLO26 توازنًا لا مثيل له. وتتيح متطلباته المنخفضة من الذاكرة إجراء ضبط المعلمات الفائقة والتدريب على العتاد الاستهلاكي، بينما يضمن استدلاله الخالي من NMS تنفيذًا سريعًا على الأجهزة الطرفية محدودة الموارد مثل Raspberry Pi أو NVIDIA Jetson.
هل أنت مهتم بمعرفة كيف تقارن هذه النماذج بالمعماريات الأخرى؟ اطلع على أدلتنا المفصلة حول YOLO11 مقابل RT-DETR وYOLOv8 مقابل YOLOv7 للعثور على النموذج الأنسب لمشروع الذكاء الاصطناعي للرؤية الخاص بك.