رؤية YOLO 2026:

RTDETRv2 مقابل YOLOv7#

لقد توسع مشهد الرؤية الحاسوبية بشكل كبير على مدى السنوات القليلة الماضية، مدفوعاً بالابتكارات المستمرة في كل من الشبكات العصبية التلافيفية (CNNs) ومحولات الرؤية (ViTs). يتطلب اختيار البنية المناسبة لنشر نماذجك فهم المقايضات الدقيقة بين السرعة والدقة والحمل الحسابي. يستكشف هذا الدليل الاختلافات التقنية بين اثنتين من البنيات المرموقة: RTDETRv2 و YOLOv7، مع تسليط الضوء أيضاً على التطورات الحديثة المتاحة في نموذج Ultralytics YOLO26 الأحدث.

RTDETRv2: نهج المحولات (Transformer) للكشف في الوقت الفعلي#

يعتمد نموذج RTDETRv2 (نسخة محول الكشف في الوقت الفعلي 2) على أساس سابقه ليثبت أن البنيات القائمة على المحولات يمكنها المنافسة بفعالية في سيناريوهات الوقت الفعلي دون الاعتماد على خطوات المعالجة اللاحقة التقليدية.

المؤلفون: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, و Yi Liu
المؤسسة: Baidu التاريخ: 2024-07-24 Arxiv: https://arxiv.org/abs/2407.17140
GitHub: مستودع RTDETRv2

أبرز ميزات البنية#

يستخدِم نموذج RTDETRv2 مُشفِّراً هجيناً وبنية معمارية لمُفكِّك الشفرة من نوع Transformer. ومن خلال الاستفادة من آليات الانتباه الذاتي (self-attention)، يعالج النموذج الصورة بأكملها بشكل شمولي، مما يسمح له بفهم العلاقات المكانية المعقدة بشكل أفضل مقارنة بالنوى الالتفافية (convolutional kernels) المحلية البحتة. وتُعد إحدى أبرز ميزاته تصميمه الخالي من خوارزمية NMS بشكل أصلي. فمن خلال التخلص من كبح الحد الأقصى غير (NMS)، يُزيل RTDETRv2 عُنق الزجاجة الشائع الذي يُدخل زمن استجابة الاستدلال المتغير أثناء النشر.

نقاط القوة والقيود#

تكمن القوة الأساسية لـ RTDETRv2 في قدرته على التعامل مع الكائنات الكثيفة والمتداخلة في المشاهد المعقدة. السياق العالمي الذي توفره طبقات انتباه المحول يجعله دقيقاً للغاية، خاصة في السيناريوهات التي تكون فيها الانسدادات متكررة.

ومع ذلك، يأتي هذا بتكلفة حسابية. فالنماذج القائمة على Transformer تتطلب تقليدياً مساحة ذاكرة أكبر أثناء التدريب والاستدلال مقارنة بالشبكات العصبية الالتفافية (CNNs). وعلاوة على ذلك، يتطلب نموذج RTDETRv2 عموماً المزيد من الحقبات (epochs) للتقارب أثناء التدريب الموزَّع، مما يؤدي إلى دورات تكرار أطول للمطورين الذين يقومون بضبط مجموعات البيانات المخصصة.

اعرف المزيد عن RTDETRv2

YOLOv7: نموذج CNN الأساسي للسرعة#

تم إصدار YOLOv7 قبل عام من RTDETRv2، وقد قدم العديد من التحسينات الهيكلية لإطار عمل YOLO الكلاسيكي، مما وضع معياراً قوياً للكاشفات التي تعتمد على CNN في الوقت الفعلي وقت نشره.

المؤلفون: Chien-Yao Wang, Alexey Bochkovskiy, و Hong-Yuan Mark Liao
المؤسسة: معهد علوم المعلومات، أكاديمية سينيكا، تايوان
التاريخ: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: مستودع YOLOv7

أبرز ميزات البنية#

بُنيت هندسة YOLOv7 حول مفهوم شبكة تجميع الطبقات الفعالة المُوسَّعة (E-ELAN). يُحسين هذا النهج مسار التدرج، مما يسمح للنموذج بالتعلُّم بشكل أكثر فاعلية دون زيادة ملحوظة في التعقيد الحسابي. كما قدَّم المؤلفون "حزمة الهدايا المجانية القابلة للتدريب" (trainable bag-of-freebies)، وهي مجموعة من الطرق التي تُحسِّن دقة النموذج أثناء التدريب دون التأثير على سرعة الاستدلال على أجهزة الحافة (edge devices).

نقاط القوة والقيود#

يظل YOLOv7 نموذجاً عالي القدرة لمهام اكتشاف الكائنات القياسية، حيث يوفر سرعات معالجة ممتازة على وحدات معالجة الرسومات (GPUs) الاستهلاكية. تعني طبيعة CNN الخاصة به أنه يتطلب عادةً ذاكرة CUDA أقل أثناء التدريب مقارنة بنماذج المحولات مثل RTDETRv2.

على الرغم من هذه المزايا، لا يزال YOLOv7 يعتمد على NMS للمعالجة اللاحقة. في البيئات ذات الكثافة العالية للتنبؤات، يمكن لخطوة NMS أن تسبب تقلبات في وقت المعالجة، مما يجعل ضمانات الوقت الفعلي الصارمة صعبة التحقيق. بالإضافة إلى ذلك، مقارنة بالأطر الحديثة، قد تكون عملية التعامل مع مهام متنوعة مثل تجزئة المثيلات وتقدير الوضعية مجزأة.

اعرف المزيد عن YOLOv7

مقارنة الأداء#

يتطلب تقييم هذه النماذج النظر في التوازن الدقيق بين متوسط الدقة الوسطى (mAP)، وعدد المعلمات، وسرعة الاستدلال.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
سياق الأداء

بينما يحقق RTDETRv2-x أعلى mAP، فإنه يحمل أيضاً أكبر عدد من المعلمات وعمليات FLOPs. توفر المتغيرات الأصغر مثل RTDETRv2-s سرعة تنافسية على TensorRT، ولكن يجب على المستخدمين الذين يستهدفون بيئات الطاقة المنخفضة بدون وحدات معالجة رسومات مخصصة تقييم قدرات استدلال وحدة المعالجة المركزية (CPU) بعناية.

الحل الحديث: YOLO26#

في حين كان RTDETRv2 و YOLOv7 محوريين في دفع حدود تطبيقات الرؤية الحاسوبية، يتطور مشهد الذكاء الاصطناعي بسرعة. تم إصدار YOLO26 في يناير 2026، وهو يجمع بين أفضل جوانب كفاءة CNN وبنيات المحولات الخالية من NMS.

بالنسبة للمطورين والباحثين الذين يبنون أنظمة جديدة، توفر منصة Ultralytics المتكاملة ونظام Python البيئي تجربة موحدة تقلل بشكل كبير من الديون التقنية.

الابتكارات الرئيسية في YOLO26#

  • تصميم شامل وخالٍ من NMS: يتميز YOLO26 بأنه شامل (end-to-end) بشكل أصلي، مما يلغي المعالجة اللاحقة لـ NMS لنشر أسرع وأبسط. تم ابتكار هذا النهج الرائد لأول مرة في YOLOv10، مما يضمن استقرار زمن الاستجابة بغض النظر عن كثافة الكائنات.
  • أسرع بنسبة تصل إلى 43% في استدلال المعالج (CPU): مُهسَّل خصيصاً للحوسبة الطرفية والأجهزة التي لا تحتوي على وحدات معالجة رسومية (GPUs)، مما يجعله أكثر تنوعاً لعمليات النشر الميدانية مقارنة بنماذج Transformer الثقيلة.
  • مُحسِّن MuSGD: هجين من SGD و Muon (مستوحى من Kimi K2 لشركة Moonshot AI)، مما يجلب ابتكارات تدريب النماذج اللغوية الكبيرة (LLMs) إلى الرؤية الحاسوبية من أجل تدريب أكثر استقراراً وتقارب أسرع.
  • إزالة DFL: تمت إزالة توزيع الخسارة البؤرية (Distribution Focal Loss)، مما أدى إلى رسم بياني حسابي مبسط لتصدير أكثر سلاسة إلى وحدات NPU المدمجة وبيئات TensorRT.
  • ProgLoss + STAL: تُنتج دوال الخسارة المُحسَّنة تحسينات ملحوظة في التعرف على الأجسام الصغيرة، وهو أمر بالغ الأهمية لروبوتات، وإنترنت الأشياء (IoT)، وتحليل الصور الجوية.
  • تحسينات خاصة بالمهام: YOLO26 ليس للاكتشاف فقط. فهو يتميز بنماذج أولية متعددة المقاييس للتجزئة، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لتتبع الوضعية، وخسارة زاوية متخصصة تعالج مشكلات حدود مربع التحديد الموجه (OBB).

تجربة مطور مبسطة#

الميزة الحقيقية لاختيار نموذج Ultralytics مثل YOLO26 (أو YOLO11 الشهير للغاية) هي النظام البيئي الذي يتم صيانته جيداً. يتطلب تدريب مجموعة بيانات مخصصة الحد الأدنى من الكود المكرر:

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)

تعرف على المزيد حول YOLO26

حالات الاستخدام والتطبيقات المثالية#

يعتمد الاختيار بين هذه البنيات بشكل كبير على الأجهزة المستهدفة والمتطلبات التشغيلية المحددة.

متى يجب التفكير في RTDETRv2#

يعد RTDETRv2 فعالاً للغاية في بيئات المعالجة من جانب الخادم المجهزة بوحدات معالجة رسومات قوية. آلية الانتباه العالمية تجعله مناسباً لفهم المشاهد المعقدة، مثل مراقبة الأحداث المزدحمة للغاية أو التصوير الطبي المتخصص حيث تتطلب الميزات المتداخلة تحليلاً سياقياً عميقاً.

متى يجب التفكير في YOLOv7#

غالباً ما يتم الاحتفاظ بـ YOLOv7 في البحث الأكاديمي القديم كنموذج مقارنة أساسي. كما يوجد في عمليات النشر الصناعية القديمة حيث تكون خطوط الأنابيب الحالية مشفرة بإصدارات PyTorch محددة ولا تتطلب مرونة المهام المتعددة للأطر الأحدث.

لماذا يعد YOLO26 هو المعيار الموصى به#

بالنسبة للبنية التحتية الحديثة للمدن الذكية، والملاحة بالطائرات بدون طيار، والتصنيع عالي السرعة، يقدم نموذج YOLO26 توازناً لا مثيل له. فمتطلبات الذاكرة الأقل تجعل ضبط المعلمات الفائقة والتدريب متاحين على الأجهزة الاستهلاكية، بينما يضمن استدلاله الخالي من NMS تنفيذاً سريعاً على الأجهزة الطرفية المحدودة مثل Raspberry Pi أو NVIDIA Jetson.

استكشف المزيد من المقارنات

هل أنت مهتم بكيفية مقارنة هذه النماذج بالبنيات الأخرى؟ تحقق من أدلتنا التفصيلية حول YOLO11 مقابل RTDETR و YOLOv8 مقابل YOLOv7 للعثور على الخيار الأمثل لمشروع رؤية الذكاء الاصطناعي الخاص بك.

التعليقات