Ultralytics YOLO27:

YOLOv10 مقابل RTDETRv2#

يتطور مجال الرؤية الحاسوبية بوتيرة مذهلة، إذ تعيد البنى الجديدة باستمرار تعريف أحدث ما توصل إليه العلم في اكتشاف الأجسام في الوقت الفعلي. ومن المحطات المهمة في هذا التطور YOLOv10 وRTDETRv2. يهدف كلا النموذجين إلى حل عنق زجاجة أساسي في مسارات الكشف التقليدية، وذلك بإلغاء الحاجة إلى المعالجة اللاحقة عبر الكبت غير الأقصى (NMS)، إلا أنهما يتعاملان مع هذا التحدي وفق نمطين معماريين مختلفين تمامًا.

تقدم هذه المقارنة التقنية تحليلًا متعمقًا لبنيتهما المعمارية ومنهجيات تدريبهما وسيناريوهات النشر المثالية لهما، لمساعدة المطورين والباحثين على اختيار الأداة المناسبة لمشروع الذكاء الاصطناعي للرؤية التالي.

YOLOv10: الرائد الخالي من NMS#

طوّر باحثون في جامعة تسينغهوا نموذج YOLOv10، الذي يركز بدرجة كبيرة على الكفاءة المعمارية وإزالة اختناقات المعالجة اللاحقة. ومن خلال تقديم إسنادات مزدوجة متسقة للتدريب الخالي من NMS، يحقق النموذج أداءً تنافسيًا مع خفض زمن الاستدلال بدرجة كبيرة.

المواصفات التقنية#

البنية والمنهجيات#

يتمثل الاختراق الأساسي في YOLOv10 في تصميم نموذجه الشامل المدفوع بالكفاءة والدقة. فهو يحسّن مكونات متعددة من كلا المنظورين، مما يقلل الحمل الحسابي بدرجة كبيرة. وتتيح استراتيجية الإسنادات المزدوجة المتسقة تدريب النموذج دون الاعتماد على NMS، وهو ما يفضي إلى مسار نشر مبسط من البداية إلى النهاية. ويكون ذلك مفيدًا بشكل خاص عند تصدير النماذج إلى صيغ الحافة مثل ONNX أو TensorRT، حيث قد تؤدي عمليات المعالجة اللاحقة إلى زمن استجابة غير متوقع.

نقاط القوة والضعف#

يتميز النموذج بمقايضات استثنائية بين السرعة والدقة، لا سيما في المتغيرين الأصغر (N وS). ويجعله زمن الاستجابة المنخفض للغاية مناسبًا لبيئات الحافة عالية السرعة. ومع ذلك، على الرغم من تفوق YOLOv10 في سرعة الكشف الخام، فإنه يظل نموذجًا متخصصًا للكشف فقط. وستحتاج الفرق التي تتطلب تقسيم المثيلات أو تقدير الوضعيات إلى استخدام أطر عمل أكثر تنوعًا.

Learn more about YOLOv10

RTDETRv2: تطوير محوّل الكشف#

بالاعتماد على محوّل الكشف في الوقت الفعلي الأصلي، يدمج RTDETRv2 «مجموعة من المزايا المجانية» لتحسين خطه الأساسي، موضحًا قدرة المحوّلات على منافسة الشبكات العصبية الالتفافية (CNNs) في سيناريوهات الوقت الفعلي.

المواصفات التقنية#

البنية والمنهجيات#

يستخدم RTDETRv2 بنية هجينة تجمع بين العمود الفقري لشبكة عصبية التفافية (CNN) لاستخراج السمات البصرية، ومشفّر-فك مشفّر من نوع Transformer لفهم المشهد فهمًا شاملًا. وتتيح آلية الانتباه الذاتي في Transformer للنموذج رؤية الصورة على المستوى العالمي، مما يجعله فعالًا للغاية في التعامل مع المشاهد المعقدة والأجسام المتداخلة والحشود الكثيفة.

نقاط القوة والضعف#

توفر بنية Transformer دقة ممتازة، لا سيما عند مقاييس المعلمات الأكبر، كما أنها تُخرج الاكتشافات النهائية أصلًا دون NMS. لكن ذلك يأتي بتكلفة. إذ تتطلب نماذج Transformer تقليديًا قدرًا أكبر بكثير من ذاكرة CUDA أثناء التدريب، وقد تتقارب بوتيرة أبطأ مقارنةً بالبنى المعتمدة على CNN فقط. وعلى الرغم من أن RTDETRv2 حسّن سرعات الاستدلال، فإنه يستهلك عمومًا ذاكرة أكبر من متغيرات YOLO خفيفة الوزن.

تعرّف على المزيد حول RTDETRv2

مقارنة الأداء#

يوفر تقييم مقاييس الأداء صورة أوضح عن المجالات التي يتفوق فيها كل نموذج. يسلط الجدول التالي الضوء على قدراتهما في مجموعة بيانات COCO:

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

عند تحليل البيانات، يحافظ YOLOv10 على تفوق واضح في كفاءة المعلمات وسرعة استدلال TensorRT عبر الأحجام القابلة للمقارنة. ويضاهي RTDETRv2-x نموذج YOLOv10x الضخم في الدقة، لكنه يتطلب نحو 20 مليون معلمة إضافية وعددًا أكبر بكثير من FLOPs.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv10 وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة البرمجية.

متى تختار YOLOv10#

يُعد YOLOv10 خيارًا قويًا من أجل:

  • الاكتشاف في الوقت الفعلي الخالي من NMS: التطبيقات التي تستفيد من الاكتشاف من الطرف إلى الطرف دون كبت القيم غير العظمى، ما يقلل تعقيد النشر.
  • المفاضلة المتوازنة بين السرعة والدقة: المشاريع التي تتطلب توازنًا قويًا بين سرعة الاستدلال ودقة الاكتشاف عبر مقاييس نماذج مختلفة.
  • التطبيقات ذات زمن الانتقال المتسق: سيناريوهات النشر التي تكون فيها أزمنة الاستدلال المتوقعة أمرًا بالغ الأهمية، مثل الروبوتات أو الأنظمة الذاتية.

متى تختار RT-DETR#

يوصى باستخدام RT-DETR في الحالات التالية:

  • أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
  • السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
  • اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

ميزة Ultralytics: المنظومة والابتكار#

مع أن YOLOv10 وRTDETRv2 يقدمان قدرات قوية في الكشف، فإن اختيار النموذج يتعلق غالبًا بالمنظومة البرمجية المحيطة به. توفر منصة Ultralytics واجهة موحدة وسلسة تُخفي تعقيدات التعلم العميق.

المعيار الجديد: Ultralytics YOLO26#

بالنسبة إلى المطورين الذين يبحثون عن أفضل أداء ممكن، يمثل Ultralytics YOLO26 خلاصة التطورات المعمارية الحديثة. أُطلق YOLO26 في أوائل عام 2026، ويرث التصميم الشامل الخالي من NMS الذي ابتكره YOLOv10، مما يلغي تمامًا المعالجة اللاحقة عبر NMS لتحقيق نشر أسرع وأبسط.

لماذا تختار YOLO26؟

ينقل YOLO26 ابتكارات تدريب نماذج LLM إلى مجال الرؤية الحاسوبية عبر محسّن MuSGD (وهو مزيج هجين من SGD وMuon)، مما يؤدي إلى تدريب أكثر استقرارًا وتقارب أسرع. كما يحقق استدلالًا أسرع لوحدة CPU بنسبة تصل إلى 43%، مما يجعله الخيار الأمثل للحوسبة الطرفية.

علاوة على ذلك، يقدم YOLO26 ProgLoss + STAL لتحسين ملحوظ في التعرف على الأجسام الصغيرة، وعلى خلاف YOLOv10 المتخصص، فإنه يوفر تنوعًا استثنائيًا. فهو يدعم أصلًا اكتشاف الأجسام والتقسيم والوضعيات والمربعات المحيطة الموجّهة (OBB)، مع تحسينات خاصة بكل مهمة مثل خسارة التقسيم الدلالي وتقدير اللوغاريتم الاحتمالي المتبقي (RLE) للوضعيات. علاوة على ذلك، يضمن إزالة خسارة التركيز التوزيعي (DFL) تصديرًا مبسطًا وتوافقًا أفضل مع الأجهزة منخفضة الطاقة.

سهولة الاستخدام وكفاءة التدريب#

سواء كنت تختبر نماذج من الأجيال الأقدم مثل Ultralytics YOLO11 أو YOLO26 المتطور، تضمن واجهة Python البرمجية المبسطة استخدامًا أقل للذاكرة أثناء التدريب ومسارات عمل سريعة للغاية.

from ultralytics import RTDETR, YOLO

# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

توفر المنظومة جيدة الصيانة أدوات لإجراء ضبط المعلمات الفائقة بسهولة، وتتكامل بسلاسة مع حلول التتبع الشاملة وخيارات نشر النماذج.

الخلاصة#

يمثل كل من YOLOv10 وRTDETRv2 محطتين بارزتين في السعي إلى اكتشاف الأجسام الخالي من NMS. ويثبت RTDETRv2 قدرة المحوّلات على تحقيق زمن استجابة آني مع فهم ممتاز للسياق العالمي، وإن كان ذلك يتطلب ذاكرة أكبر. أما YOLOv10 فيوفر بديلًا فعالًا وسريعًا قائمًا على CNN، ومصممًا لمهام الكشف المقيدة بالموارد.

ومع ذلك، لتحقيق أداء متوازن وتنوع في المهام ومنظومة ناضجة بأقصى قدر، يُشجَّع المطورون بشدة على الاستفادة من Ultralytics YOLO26. فهو يجمع بمهارة بين الابتكارات المعمارية لأسلافه وأدوات قوية سهلة الاستخدام تجعل نشر الذكاء الاصطناعي للرؤية واقعًا سلسًا.

التعليقات