Ultralytics YOLO27:
Get Started

YOLOv10 مقابل RTDETRv2#

يتطور مجال الرؤية الحاسوبية بوتيرة هائلة، إذ تعيد البنى الجديدة باستمرار تعريف أحدث ما توصلت إليه التقنية في كشف الأجسام في الوقت الفعلي. ومن المحطات المهمة في هذا التطور YOLOv10 وRTDETRv2. يهدف كلا النموذجين إلى معالجة عنق زجاجة أساسي في مسارات الكشف التقليدية، وذلك بإلغاء الحاجة إلى المعالجة اللاحقة بالكبت غير الأقصى (NMS)، لكنهما يتبعان نماذج معمارية مختلفة تمامًا.

تقدم هذه المقارنة التقنية تحليلًا متعمقًا لبنيتيهما المعماريتين ومنهجيات التدريب وسيناريوهات النشر المثالية، لمساعدة المطورين والباحثين على اختيار الأداة المناسبة لمشروعهم القادم في الذكاء الاصطناعي للرؤية.

YOLOv10: رائد النماذج الخالية من NMS#

طوّر باحثون في جامعة تسينغهوا YOLOv10، مع تركيز كبير على الكفاءة المعمارية وإزالة اختناقات المعالجة اللاحقة. وبفضل تقديم الإسناد المزدوج المتسق للتدريب الخالي من NMS، يحقق أداءً تنافسيًا مع خفض زمن استجابة الاستدلال بدرجة كبيرة.

المواصفات التقنية#

البنية والمنهجيات#

يتمثل الإنجاز الأساسي لـ YOLOv10 في تصميم نموذجه الشامل القائم على الكفاءة والدقة. فهو يحسّن المكونات المختلفة من كلا المنظورين، ما يقلل العبء الحسابي بدرجة كبيرة. وتتيح استراتيجية الإسناد المزدوج المتسق تدريب النموذج دون الاعتماد على NMS، ما يؤدي إلى مسار نشر مبسط وشامل من البداية إلى النهاية. ويُعد هذا مفيدًا على وجه الخصوص عند تصدير النماذج إلى تنسيقات الأجهزة الطرفية، مثل ONNX أو TensorRT، حيث قد تؤدي عمليات المعالجة اللاحقة إلى زمن استجابة غير متوقع.

نقاط القوة والضعف#

يقدم النموذج مفاضلة استثنائية بين السرعة والدقة، لا سيما في الإصدارات الأصغر (N وS). ويجعل زمن استجابته المنخفض منه خيارًا مثاليًا لبيئات الأجهزة الطرفية عالية السرعة. ومع ذلك، فرغم تفوق YOLOv10 في سرعة الكشف الخام، يظل نموذجًا متخصصًا في الكشف فقط. وستحتاج الفرق التي تتطلب تجزئة المثيلات أو تقدير الوضعية إلى استخدام أطر عمل أكثر تعددًا في الاستخدامات.

تعرّف على المزيد حول YOLOv10

RTDETRv2: تطوير محوّل الكشف#

استنادًا إلى محوّل الكشف الآني الأصلي، يضمّن RTDETRv2 مجموعة من التحسينات المجانية للارتقاء بأدائه الأساسي، مبيّنًا قدرة المحوّلات على منافسة الشبكات العصبية الالتفافية (CNNs) في السيناريوهات الآنية.

المواصفات التقنية#

البنية والمنهجيات#

يستخدم RTDETRv2 بنية هجينة تجمع بين عمود فقري من شبكة عصبية التفافية (CNN) لاستخراج السمات البصرية، ومشفّر-مفكّك ترميز من نوع Transformer لفهم المشهد فهمًا شاملًا. وتتيح آلية الانتباه الذاتي في Transformer للنموذج رؤية الصورة على نحو كلي، ما يجعله فعالًا للغاية في التعامل مع المشاهد المعقدة والأجسام المتداخلة والحشود الكثيفة.

نقاط القوة والضعف#

توفر بنية Transformer دقة ممتازة، لا سيما عند أحجام المعلمات الأكبر، وتُخرج بطبيعتها الاكتشافات النهائية من دون NMS. لكن ذلك يأتي بتكلفة. تتطلب نماذج Transformer تقليديًا ذاكرة CUDA أكبر بكثير أثناء التدريب، وقد يكون تقاربها أبطأ مقارنةً ببنى CNN الخالصة. وعلى الرغم من أن RTDETRv2 حسّن سرعات الاستدلال، فإنه يستهلك عمومًا ذاكرة أكبر من إصدارات YOLO الخفيفة.

تعرّف على المزيد حول RTDETRv2

مقارنة الأداء#

يوفر تقييم مقاييس الأداء صورة أوضح عن نقاط قوة كل نموذج. يبرز الجدول التالي قدراتها على مجموعة بيانات COCO:

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

عند تحليل البيانات، يحافظ YOLOv10 على تفوق واضح في كفاءة المعلمات وسرعة الاستدلال باستخدام TensorRT عبر الأحجام المتقاربة. يضاهي RTDETRv2-x دقة YOLOv10x، لكنه يتطلب أكثر من 2.5 ضعف عدد المعلمات (76M مقابل 29.5M) وعددًا أكبر بكثير من FLOPs.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv10 وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة البرمجية.

متى تختار YOLOv10#

يُعد YOLOv10 خيارًا قويًا لما يلي:

  • الكشف الآني دون NMS: التطبيقات التي تستفيد من الكشف الشامل من البداية إلى النهاية من دون الكبت غير الأقصى، مما يقلل تعقيد النشر.
  • موازنة السرعة والدقة: المشاريع التي تتطلب توازناً جيداً بين سرعة الاستدلال ودقة الكشف عبر مقاييس نماذج متعددة.
  • التطبيقات ذات زمن الاستجابة الثابت: سيناريوهات النشر التي تتطلب أوقات استدلال قابلة للتنبؤ، مثل الروبوتات أو الأنظمة ذاتية التشغيل.

متى تختار RT-DETR#

يوصى بـRT-DETR في الحالات التالية:

  • أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
  • سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
  • كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
  • البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.

ميزة Ultralytics: المنظومة والابتكار#

على الرغم من أن YOLOv10 وRTDETRv2 يقدمان إمكانات قوية للاكتشاف، فإن اختيار النموذج غالبًا ما يتعلق بالمنظومة البرمجية المحيطة به. توفر منصة Ultralytics واجهة موحدة وسلسة تخفي تعقيدات التعلم العميق.

المعيار الجديد: Ultralytics YOLO26#

للمطورين الذين يسعون إلى أفضل أداء ممكن، يمثل Ultralytics YOLO26 خلاصة التطورات المعمارية الحديثة. صدر YOLO26 في أوائل عام 2026، ويرث تصميمًا شاملًا من دون NMS الذي ابتكره YOLOv10، بوصفه خيارًا للرأس (nms=False)، ما يلغي المعالجة اللاحقة باستخدام NMS لتوفير نشر أسرع وأبسط.

لماذا تختار YOLO26؟

يستقدم YOLO26 ابتكارات تدريب نماذج LLM إلى مجال الرؤية الحاسوبية عبر مُحسِّن MuSGD (وهو مزيج من SGD وMuon)، ما يؤدي إلى تدريب أكثر استقرارًا وتقارب أسرع. كما يوفر استدلالًا على CPU أسرع بنسبة تصل إلى 43%، ما يجعله الخيار الأمثل للحوسبة الطرفية.

علاوة على ذلك، يقدم YOLO26 ProgLoss + STAL لتحسين ملحوظ في التعرّف على الأجسام الصغيرة، وعلى خلاف YOLOv10 المتخصص، فإنه يوفر تنوعًا استثنائيًا. يدعم بطبيعته اكتشاف الأجسام والتجزئة وتقدير الوضعية والصناديق المحيطة الموجّهة (OBB)، مع تحسينات خاصة بكل مهمة مثل خسارة التجزئة الدلالية وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لتقدير الوضعية. علاوة على ذلك، يضمن التخلص من خسارة البؤرة التوزيعية (DFL) تصديرًا مبسطًا وتوافقًا أفضل مع الأجهزة منخفضة الطاقة.

سهولة الاستخدام وكفاءة التدريب#

سواء أكنت تختبر نماذج أقدم جيلًا مثل Ultralytics YOLO11 أو YOLO26 المتطور، تضمن واجهة Python API المبسطة استهلاك ذاكرة أقل أثناء التدريب وسير عمل سريعًا للغاية.

from ultralytics import RTDETR, YOLO

# ⁨درّب نموذج YOLOv10 الشامل من البداية إلى النهاية⁩
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# ⁨أو قيّم RTDETR باستخدام واجهة API نفسها⁩
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

توفر المنظومة المصانة جيدًا أدوات لضبط المعلمات الفائقة بسهولة، وتتكامل بسلاسة مع حلول التتبع الشاملة وخيارات نشر النماذج.

الخلاصة#

يمثل كل من YOLOv10 وRTDETRv2 محطتين بارزتين في السعي إلى اكتشاف الأجسام من دون NMS. يثبت RTDETRv2 قدرة نماذج Transformer على تحقيق زمن استجابة آني مع فهم ممتاز للسياق العام، وإن كان ذلك يتطلب ذاكرة أكبر. أما YOLOv10 فيقدم بديل CNN سريعًا وعالي الكفاءة، مصممًا لمهام الاكتشاف محدودة الموارد.

لكن لتحقيق أداء متوازن وتعدد في المهام وأفضل منظومة ناضجة، يُشجَّع المطورون بشدة على الاستفادة من Ultralytics YOLO26. فهو يجمع ببراعة بين الابتكارات المعمارية لأسلافه والأدوات القوية سهلة الاستخدام التي تجعل نشر ذكاء الرؤية واقعًا سلسًا.

التعليقات