رؤية YOLO 2026:

YOLOv10 مقابل RTDETRv2#

يتحرك مشهد computer vision بخطى متسارعة، حيث تعيد الهندسات المعمارية الجديدة باستمرار تحديد أحدث ما توصلت إليه التكنولوجيا في اكتشاف الأجسام في الوقت الفعلي. ومن بين المعالم البارزة في هذا التطور YOLOv10 وRTDETRv2. يهدف كلا النموذجين إلى حل عقبة أساسية في خطوط أنابيب الكشف التقليدية من خلال التخلص من الحاجة إلى المعالجة اللاحقة لـ NMS، ومع ذلك فهما يتعاملان مع هذا التحدي من نماذج معمارية مختلفة تماماً.

توفر هذه المقارنة التقنية تحليلاً متعمقاً لهندستها المعمارية، ومنهجيات التدريب، وسيناريوهات النشر المثالية لمساعدة المطورين والباحثين في اختيار الأداة المناسبة لمشروع vision AI التالي.

YOLOv10: الرائد في تقنية NMS-Free#

يركز YOLOv10، الذي طوره باحثون في جامعة تسينغهوا، بشكل كبير على الكفاءة المعمارية وإزالة عقبات المعالجة اللاحقة. ومن خلال تقديم تعيينات مزدوجة متسقة للتدريب بدون NMS، فإنه يحقق أداءً تنافسياً مع خفض زمن انتقال الاستدلال بشكل كبير.

المواصفات الفنية#

الهندسة المعمارية والمنهجيات#

تتمثل الانطلاقة الأساسية لـ YOLOv10 في تصميم النموذج الموجه نحو الكفاءة والدقة الشاملة. فهو يحسن المكونات المختلفة من كلا المنظورين، مما يقلل بشكل كبير من الحمل الحسابي. تتيح استراتيجية التعيينات المزدوجة المتسقة للنموذج التدريب دون الاعتماد على NMS، مما يترجم إلى خط أنابيب نشر مبسط وشامل من البداية إلى النهاية. وهذا مفيد بشكل خاص عند تصدير النماذج إلى تنسيقات الحافة مثل ONNX أو TensorRT، حيث يمكن أن تؤدي عمليات المعالجة اللاحقة إلى تأخير غير متوقع.

نقاط القوة والضعف#

يتميز النموذج بمفاضلات استثنائية بين السرعة والدقة، خاصة في المتغيرات الأصغر (N و S). إن زمن الوصول الأدنى الخاص به يجعله مثاليًا لبيئات الحافة عالية السرعة. ومع ذلك، في حين يتفوق YOLOv10 في سرعة الكشف الخام، إلا أنه يظل نموذجًا متخصصًا للكشف فقط. ستتحتاج الفرق التي تتطلب instance segmentation أو pose estimation إلى البحث عن أطر عمل أكثر تنوعًا.

تعرف على المزيد حول YOLOv10

RTDETRv2: تطوير محول الاكتشاف (Detection Transformer)#

بناءً على محول الاكتشاف الأصلي في الوقت الفعلي، يدمج RTDETRv2 "مجموعة من الميزات الإضافية" لتحسين خط الأساس الخاص به، مما يظهر أن المحولات يمكنها منافسة شبكات CNN في سيناريوهات الوقت الفعلي.

المواصفات الفنية#

الهندسة المعمارية والمنهجيات#

يستخدم RTDETRv2 بنية هجينة، تجمع بين هيكل الشبكة العصبية التلافيفية (CNN) لاستخراج الميزات المرئية ومحول التشفير وفك التشفير لفهم المشهد بشكل شامل. تسمح آلية الانتباه الذاتي في المحول للنموذج برؤية الصورة عالمياً، مما يجعله فعالاً للغاية في التعامل مع المشاهد المعقدة، والكائنات المتداخلة، والحشود الكثيفة.

نقاط القوة والضعف#

توفر بنية المحول دقة ممتازة، خاصة على مقاييس المعلمات الأكبر، وتخرج الاكتشافات النهائية أصلاً دون NMS. ومع ذلك، يأتي هذا بتكلفة. تتطلب نماذج المحولات تقليدياً ذاكرة CUDA أكبر بكثير أثناء التدريب ويمكن أن تكون أبطأ في التقارب مقارنة ببنيات CNN البحتة. في حين أن RTDETRv2 قد حسّن سرعات الاستدلال، فإنه يستهلك عموماً ذاكرة أكثر من متغيرات YOLO خفيفة الوزن.

اعرف المزيد عن RTDETRv2

مقارنة الأداء#

يوفر تقييم مقاييس الأداء صورة أكثر وضوحًا للمكان الذي يتفوق فيه كل نموذج. يسلط الجدول التالي الضوء على قدراتهم على COCO dataset:

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

عند تحليل البيانات، يحافظ YOLOv10 على ميزة صارمة في كفاءة المعلمات وسرعة استدلال TensorRT عبر الأحجام القابلة للمقارنة. يطابق RTDETRv2-x نموذج YOLOv10x الضخم في الدقة ولكنه يتطلب ما يقرب من 20 مليون معلمة إضافية و FLOPs أعلى بكثير.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv10 و RT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.

متى تختار YOLOv10#

يعد YOLOv10 خياراً قوياً لـ:

  • الكشف الفوري بدون NMS: التطبيقات التي تستفيد من الكشف الشامل (end-to-end) بدون تقنية Non-Maximum Suppression، مما يقلل من تعقيد النشر.
  • الموازنة بين السرعة والدقة: المشاريع التي تتطلب توازناً قوياً بين سرعة الاستدلال ودقة الكشف عبر مختلف أحجام النماذج.
  • تبيقات ذات زمن استجابة ثابت: سيناريوهات النشر التي تكون فيها أوقات الاستدلال المتوقعة حرجة، مثل robotics أو الأنظمة المستقلة.

متى تختار RT-DETR#

يوصى بـ RT-DETR لـ:

  • أبحاث الاكتشاف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وهياكل transformer لاكتشاف الكائنات بنهاية واحدة دون NMS.
  • سيناريوهات الدقة العالية مع زمن انتقال مرن: التطبيقات التي تكون فيها دقة الاكتشاف هي الأولوية القصوى ويكون زمن انتقال الاستنتاج الأعلى قليلاً مقبولاً.
  • اكتشاف الكائنات الكبيرة: المشاهد التي تحتوي بشكل أساسي على كائنات متوسطة إلى كبيرة حيث توفر آلية الانتباه العالمي للمحولات ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة لمعظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطورين:

  • نشر الحافة الخالي من NMS: التطبيقات التي تتطلب استنتاجاً متسقاً ومنخفض زمن الانتقال دون تعقيدات معالجة ما بعد المعالجة باستخدام كبت غير الأقصى.
  • بيئات وحدة المعالجة المركزية (CPU) فقط: الأجهزة التي لا تحتوي على تسريع مخصص بوحدة معالجة الرسوميات (GPU)، حيث توفر سرعة استنتاج CPU أسرع بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • الكشف عن الأشياء الصغيرة: السيناريوهات الصعبة مثل صور الطائرات بدون طيار الجوية أو تحليل مستشعرات إنترنت الأشياء (IoT) حيث تعمل ProgLoss و STAL على تعزيز الدقة بشكل كبير على الأشياء الدقيقة.

ميزة Ultralytics: النظام البيئي والابتكار#

في حين يقدم YOLOv10 وRTDETRv2 قدرات كشف قوية، فإن اختيار النموذج يتعلق غالبًا بالنظام البيئي للبرمجيات المحيطة. توفر Ultralytics Platform واجهة موحدة وسلسة تختصر تعقيدات التعلم العميق.

المعيار الجديد: Ultralytics YOLO26#

للمطورين الذين يسعون للحصول على أفضل أداء مطلق، يمثل Ultralytics YOLO26 ذروة التطورات المعمارية الحديثة. تم إطلاق YOLO26 في أوائل عام 2026، وهو يرث تصميم End-to-End NMS-Free Design الذي رياده YOLOv10، مما يلغي تمامًا المعالجة اللاحقة لـ NMS من أجل نشر أسرع وأبسط.

لماذا تختار YOLO26؟

يجلب YOLO26 ابتكارات تدريب LLM إلى الرؤية الحاسوبية عبر MuSGD Optimizer (هجين من SGD و Muon)، مما يؤدي إلى تدريب أكثر استقراراً وتقارب أسرع. كما يتميز بـ استدلال CPU أسرع بنسبة تصل إلى 43%، مما يجعله الخيار الأول لحوسبة الحافة.

علاوة على ذلك، يقدم YOLO26 ميزة ProgLoss + STAL لتحسينات ملحوظة في التعرف على الأجسام الصغيرة، وعلى عكس نموذج YOLOv10 المتخصص، فهو يوفر تنوعًا شديدًا. وهو يدعم محليًا object detection، والتجزئة، والوضع، وoriented bounding boxes (OBB) مع تحسينات خاصّة بالمهمة مثل فقدان التجزئة الدلالية وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) للوضع. علاوة على ذلك، فإن إزالة Distribution Focal Loss (DFL) تضمن تصديرًا مبسطًا وتوافقًا أفضل مع الأجهزة منخفضة الطاقة.

تعرف على المزيد حول YOLO26

سهولة الاستخدام وكفاءة التدريب#

سواء كنت تجرّب نماذج الجيل السابق مثل Ultralytics YOLO11 أو نموذج YOLO26 المتطور، فإن واجهة برمجة التطبيقات Python المُبسّطة تضمن انخفاض استهلاك الذاكرة أثناء التدريب وسرعة فائقة في سير العمل.

from ultralytics import RTDETR, YOLO

# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

يوفر النظام البيئي الصيانة الجيدة أدوات لضبط hyperparameter tuning بسهولة ويتكامل بسلاسة مع حلول التتبع الشسيعة وmodel deployment options.

الخلاصة#

يمثل كل من YOLOv10 و RTDETRv2 معالم هائلة في السعي لاكتشاف الكائنات بدون NMS. يثبت RTDETRv2 أن المحولات يمكنها تحقيق زمن انتقال في الوقت الفعلي مع فهم سياق عالمي ممتاز، وإن كان ذلك بمتطلبات ذاكرة أعلى. يوفر YOLOv10 بديلاً فعالاً وسريعاً لشبكات CNN مصمماً لمهام الاكتشاف محدودة الموارد.

ومع ذلك، من أجل أداء متوازن، وتنوع في المهام المتعددة، والنظام البيئي الأكثر نضجاً، يتم تشجيع المطورين بشدة على الاستفادة من Ultralytics YOLO26. فهو يدمج بشكل جميل الابتكارات المعمارية لسلفه مع الأدوات القوية وسهلة الاستخدام التي تجعل نشر الذكاء الاصطناعي البصري حقيقة سلسة.

التعليقات