Ultralytics YOLO27:
Get Started

RTDETRv2 مقابل YOLOv10#

كان تطور الرؤية الحاسوبية مدفوعًا إلى حد كبير بالسعي الدؤوب إلى تحقيق التوازن بين السرعة والدقة. واعتمدت مسارات اكتشاف الكائنات الآني تقليديًا على الكبت غير الأقصى (NMS) كخطوة للمعالجة اللاحقة، بغية تصفية مربعات الإحاطة المتداخلة. لكن NMS يضيف اختناقات في زمن الاستجابة ويعقّد ضبط المعلمات الفائقة. ومؤخرًا، ظهر نهجان معماريان مختلفان لمعالجة هذه المشكلة مباشرةً: نماذج قائمة على Transformer مثل RTDETRv2، ونماذج قائمة على CNN مثل YOLOv10.

يقدّم هذا الدليل مقارنة تقنية شاملة بين هذين النموذجين، ويحلّل بنيتيهما ومقاييس الأداء وحالات الاستخدام المثلى، كما يسلّط الضوء على كيفية تقديم أحدث الابتكارات في منظومة Ultralytics للحل الأمثل للنشر الحديث.

RTDETRv2: محولات الاكتشاف في الوقت الفعلي#

يعتمد RTDETRv2 على بنية RT-DETR الأصلية، بهدف الجمع بين فهم السياق الشامل في Vision Transformers ومتطلبات السرعة الآنية التي هيمنت عليها تقليديًا نماذج YOLO.

الخصائص الرئيسية:

البنية ومنهجيات التدريب#

يستخدم RTDETRv2 بنية Transformer شاملة تتجنب NMS بطبيعتها. ويطوّر النموذج السابق له من خلال اعتماد نهج «Bag-of-Freebies»، لتحسين استراتيجية التدريب وإضافة قدرات اكتشاف متعددة المقاييس. يستخدم النموذج بنية CNN أساسية لاستخراج خرائط السمات (تفاصيل مرئية مثل الحواف والأنسجة)، ثم يعالجها هيكل مُرمّز ومُفكّك ترميز قائم على Transformer. وهذا يمكّن النموذج من تحليل سياق الصورة بأكملها في الوقت نفسه، ما يجعله فعالًا جدًا في فهم المشاهد المعقدة التي تتكدس فيها الكائنات أو تتداخل.

نقاط القوة والضعف#

نقاط القوة:

  • السياق الشامل: تتيح آلية الانتباه للنموذج التفوق في البيئات المعقدة والمزدحمة.
  • خالٍ من NMS: يتنبأ بإحداثيات الكائنات مباشرةً، ما يبسّط مسار النشر.
  • دقة عالية: يحقق متوسط دقة متوسطًا (mAP) ممتازًا على مجموعة بيانات COCO.

نقاط الضعف:

  • يتطلب موارد كبيرة: تتطلب بنى Transformer عادةً ذاكرة CUDA أكبر بكثير أثناء التدريب مقارنةً بشبكات CNN، ما يجعل ضبطها الدقيق مكلفًا على الأجهزة القياسية.
  • تفاوت سرعة الاستدلال: رغم سرعته، قد تؤدي حسابات الانتباه المكثفة إلى انخفاض معدل الإطارات في الثانية في الرؤية الحاسوبية على الأجهزة الطرفية التي تفتقر إلى مسرّعات ذكاء اصطناعي مخصصة.

تعرّف على المزيد حول RTDETRv2

YOLOv10: اكتشاف الأجسام في الزمن الحقيقي من البداية إلى النهاية#

يمثّل YOLOv10 تحولًا كبيرًا في سلسلة اكتشاف الكائنات YOLO، إذ يعالج مباشرةً اختناق NMS طويل الأمد ضمن إطار عمل قائم على CNN.

الخصائص الرئيسية:

البنية ومنهجيات التدريب#

يتمثل الابتكار الأساسي في YOLOv10 في تعييناته المزدوجة المتسقة للتدريب الخالي من NMS. ويستخدم رأسي اكتشاف أثناء التدريب: أحدهما بتعيين واحد إلى متعدد (مثل نماذج YOLO التقليدية) لتوفير إشارات إشراف غنية، والآخر بتعيين واحد إلى واحد لإلغاء الحاجة إلى NMS. وأثناء الاستدلال، يُستخدم رأس الواحد إلى الواحد فقط، ما ينتج عنه تنفيذ شامل. وإضافةً إلى ذلك، طبّق المؤلفون استراتيجية تصميم شاملة للنموذج تستند إلى الكفاءة والدقة، مع تحسين مختلف المكونات على نحو متكامل لتقليل التكرار الحسابي.

نقاط القوة والضعف#

نقاط القوة:

  • سرعة فائقة: يحقق YOLOv10 زمن استدلال منخفضًا للغاية من خلال إزالة NMS وتحسين البنية.
  • الكفاءة: يتطلب عددًا أقل من المعلمات وعمليات FLOPs لتحقيق دقة مماثلة للنماذج الأخرى، ما يجعله مناسبًا جدًا للبيئات محدودة الموارد.
  • عمليات نشر خالية من NMS: يبسّط التكامل في التطبيقات الطرفية، مثل المراقبة الذكية.

نقاط الضعف:

  • مفهوم الجيل الأول: بوصفه أول نموذج YOLO يطبّق هذه البنية المحددة الخالية من NMS، أرسى الأساس، لكنه ترك مجالًا لتعدد المهام والتحسين اللذين ظهرا في النماذج اللاحقة مثل YOLO11 وYOLO26.

تعرّف على المزيد حول YOLOv10

مقارنة الأداء#

عند تقييم النماذج للاستخدام في الإنتاج، من الضروري الموازنة بين الدقة والتكلفة الحاسوبية. يوضّح الجدول أدناه المفاضلات في الأداء بين أحجام RTDETRv2 وYOLOv10 المختلفة.

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

مع أن RTDETRv2 يوفّر دقة قوية، يُظهر YOLOv10 تفوقًا ملحوظًا في زمن الاستجابة وكفاءة المعلمات، ولا سيما في نسختيه الأصغر (Nano وSmall)، ما يجعله جذابًا جدًا لتطبيقات الحوسبة الطرفية وAIoT.

اختيار الحجم المناسب

إذا كنت تنشر على وحدات GPU مخصصة للخوادم، حيث تكون قيود حجم الدفعة وVRAM أقل، فإن النماذج الأكبر (مثل -x أو -l) تحقق أعلى دقة. أما بالنسبة إلى الأجهزة الطرفية، مثل Raspberry Pi أو الهواتف المحمولة، فأعطِ الأولوية للنسخ nano (-n) أو small (-s) للحفاظ على معدلات إطارات آنية.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين RT-DETR وYOLOv10 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات النظام البيئي.

متى تختار RT-DETR#

يُعد RT-DETR خيارًا قويًا في الحالات التالية:

  • أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
  • سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
  • كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.

متى تختار YOLOv10#

يوصى بـ YOLOv10 في الحالات التالية:

  • الكشف الآني دون NMS: التطبيقات التي تستفيد من الكشف الشامل من البداية إلى النهاية من دون الكبت غير الأقصى، مما يقلل تعقيد النشر.
  • موازنة السرعة والدقة: المشاريع التي تتطلب توازناً جيداً بين سرعة الاستدلال ودقة الكشف عبر مقاييس نماذج متعددة.
  • التطبيقات ذات زمن الاستجابة الثابت: سيناريوهات النشر التي تتطلب أوقات استدلال قابلة للتنبؤ، مثل الروبوتات أو الأنظمة ذاتية التشغيل.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
  • البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.

ميزة Ultralytics: تقديم YOLO26#

على الرغم من أن RTDETRv2 وYOLOv10 يقدّمان تطورات أكاديمية واعدة، فإن نشرهما في سيناريوهات العالم الحقيقي يتطلب منظومة برمجية متينة تحظى بصيانة جيدة. توفّر منصة Ultralytics تجربة تطوير لا مثيل لها، إذ تجمع بين سهولة الاستخدام والوثائق الشاملة والأدوات القوية لـتعليق البيانات والنشر.

للمطوّرين الذين يسعون إلى أحدث التقنيات على الإطلاق في عام 2026، يُعد Ultralytics YOLO26 الخيار الأمثل. فهو يجمع أفضل الأفكار من البنيتين، ويقدّم في الوقت نفسه تحسينات رائدة:

  • تصميم شامل وخالٍ من NMS: استنادًا إلى المفهوم الذي طرحه YOLOv10، يوفّر YOLO26 رأسًا اختياريًا من نوع الواحد إلى الواحد (nms=False) يتجاوز المعالجة اللاحقة لـ NMS، ما يؤدي إلى منطق نشر أسرع وأبسط وزمن استجابة أكثر اتساقًا.
  • إزالة DFL: من خلال إزالة Distribution Focal Loss، يبسّط YOLO26 تصدير النماذج ويحسّن بدرجة كبيرة التوافق مع الأجهزة الطرفية ومنخفضة الطاقة.
  • محسّن MuSGD: يجمع هذا المحسّن المبتكر بين SGD وMuon، وهو مستوحى من ابتكارات تدريب LLM، ويوفّر تدريبًا أكثر استقرارًا وتقاربًا أسرع بكثير مقارنةً بالأساليب التقليدية.
  • استدلال على CPU أسرع بنسبة تصل إلى 43%: تحسين دقيق للبيئات التي لا تتوفر فيها وحدات GPU مخصصة، بما يتيح للجميع الاستفادة من ذكاء الرؤية عالي الأداء.
  • ProgLoss + STAL: تحسّن دالتا الخسارة المتقدمتان هاتان التعرّف على الكائنات الصغيرة تحسنًا ملحوظًا، وهو أمر بالغ الأهمية لـالتطبيقات التي تستخدم الطائرات المسيّرة ومستشعرات IoT.
  • تعدد استخدامات لا مثيل له: على عكس النماذج التي تقتصر على مربعات الإحاطة، يدعم YOLO26 مجموعة كاملة من المهام، بما فيها تقسيم المثيلات وتقدير الوضعية وتصنيف الصور واكتشاف OBB، مع تحسينات خاصة بكل مهمة، مثل تقدير الاحتمالية اللوغاريتمية المتبقية (RLE) للوضعية.

تنفيذ سلس باستخدام Python#

صُمّم تدريب هذه النماذج ونشرها باستخدام واجهة Python API من Ultralytics ليكونا سلسين. ومتطلبات الذاكرة أثناء التدريب أقل بوضوح مقارنةً بالبنى كثيفة الاستخدام لـTransformer، ما يتيح لك تدريب نماذج قوية على أجهزة قياسية.

from ultralytics import YOLO

# ⁨تحميل نموذج YOLO26 المتطور (موصى به)⁩
# ⁨بدلًا من ذلك، حمّل نموذج YOLOv10 باستخدام YOLO('yolov10n.pt')⁩
model = YOLO("yolo26n.pt")

# ⁨درّب النموذج على مجموعة البيانات المخصصة⁩
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# ⁨التصدير بسهولة إلى تنسيقات متنوعة للنشر على الأجهزة الطرفية⁩
model.export(format="onnx", simplify=True)

سواء أكنت تطوّر أنظمة إنذار أمني أم تجري تحليلًا للصور الطبية، فإن اختيار نموذج تدعمه مجتمعات Ultralytics النشطة يضمن توافر الأدوات ومواد ضبط المعلمات الفائقة والتحديثات المستمرة اللازمة لنجاحك. ومهّد YOLOv10 وRTDETRv2 الطريق للبنى الخالية من NMS، لكن YOLO26 يتقن الصيغة، مقدّمًا أفضل توازن بين الأداء وتعدد الاستخدامات والجاهزية للإنتاج.

التعليقات