Ultralytics YOLO27:
Get Started

YOLOX مقابل YOLOv10#

شهد تطور نماذج الرؤية الحاسوبية الآنية قفزات معمارية كبيرة. ومن المحطات المفصلية في هذا المسار YOLOX وYOLOv10. صدر YOLOX في عام 2021، ونجح في ردم الهوة بين البحث الأكاديمي والتطبيق الصناعي عبر تقديم تصميم فعّال للغاية لا يعتمد على المراسي. وبعد ثلاث سنوات، أحدث YOLOv10 تحولًا في المجال بإلغاء الحاجة إلى كبت غير الأقصى (NMS) أثناء المعالجة اللاحقة، دافعًا حدود الكفاءة والسرعة إلى آفاق جديدة.

تستكشف هذه المقارنة التقنية الشاملة بنية كلا النموذجين ومقاييس الأداء وحالات الاستخدام المثلى، وتقدم رؤى تساعدك على اختيار الأداة المناسبة لمشروعك المقبل لاكتشاف الأجسام.

أصول النماذج وبياناتها الوصفية#

يساعد فهم أصول هذه النماذج على استيعاب الخيارات المعمارية وبيئات النشر المستهدفة لكل منها.

تفاصيل YOLOX

تعرّف على مزيد من المعلومات عن YOLOX

تفاصيل YOLOv10

تعرّف على المزيد حول YOLOv10

ابتكارات البنية#

تكمن الاختلافات الجوهرية بين YOLOX وYOLOv10 في طريقة تعاملهما مع تنبؤات مربعات الإحاطة والمعالجة اللاحقة.

YOLOX: ريادة التصميم الخالي من المراسي#

أحدث YOLOX نقلة نوعية بتحويل عائلة YOLO إلى بنية خالية من المراسي. فمن خلال التنبؤ بمركز الجسم بدلًا من الاعتماد على مربعات مراسٍ محددة مسبقًا، خفّض YOLOX بدرجة كبيرة عدد معلمات التصميم وضبط المعلمات الاستدلالي اللازم لمجموعات البيانات المخصصة. كما قدّم رأسًا مفصولًا يوزع مهام التصنيف والانحدار على مسارين منفصلين. وقد عالج هذا النهج التعارض بين تحديد ماهيّة الجسم وتحديد موقعه، ما أدى إلى تحسن ملحوظ في سرعة التقارب والدقة.

YOLOv10: ثورة الاستغناء عن NMS#

بسّط YOLOX رأس الكشف، لكنه ظل يعتمد على NMS لتصفية تنبؤات مربعات الإحاطة الزائدة. وعالج YOLOv10 هذا الاختناق الجوهري. فمن خلال استخدام إسناد مزدوج متسق أثناء التدريب، يحقق YOLOv10 كشفًا أصيلًا شاملًا من البداية إلى النهاية. ويستخدم رأسًا متعدد المطابقات أثناء التدريب لضمان إشارات إشراف غنية، ورأسًا أحادي المطابقة أثناء الاستدلال لإخراج التنبؤات النهائية مباشرةً. يلغي هذا التصميم الشامل، الذي يوازن بين الكفاءة والدقة، NMS بالكامل، ويقلل بدرجة كبيرة زمن استدلال الشرائح المضمنة.

أثر إزالة NMS

غالبًا ما يصعب تسريع عملية كبت غير الأقصى على وحدات المعالجة العصبية (NPUs). وبإزالتها، يتيح YOLOv10 تنفيذ مخطط النموذج كاملًا بسلاسة على العتاد المتخصص، ما يحسن التوافق بدرجة كبيرة مع أُطر التحسين مثل OpenVINO وTensorRT.

مقاييس الأداء والمقارنة#

عند تقييم النماذج للإنتاج، من الضروري تحقيق توازن بين الدقة والتكلفة الحسابية. يوضح الجدول أدناه المفاضلات بين مختلف أحجام YOLOX وYOLOv10.

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

تحليل البيانات#

تُظهر المقاييس بوضوح القفزة الجيلية التي حققها YOLOv10. فعلى سبيل المثال، يحقق YOLOv10-S متوسط الدقة بنسبة 46.3%، مقارنةً بنسبة 46.9% التي يحققها YOLOX-m، لكنه يفعل ذلك باستخدام أقل من ثلث عدد المعلمات (7.2M مقابل 25.3M) وعدد أقل بكثير من عمليات FLOPs. علاوة على ذلك، يرفع نموذج YOLOv10-X من الفئة العليا قيمة mAP إلى 54.4%، ما يجعله منافسًا قويًا في مهام الدقة التي تتطلب أداءً عاليًا، مع بقائه أسرع من بنية YOLOX-x الأقدم.

ميزة منظومة Ultralytics#

لا يزال YOLOX تطبيقًا بحثيًا مفتوح المصدر موثوقًا، لكن اعتماد YOLOv10 يتيح الوصول الفوري إلى منظومة Ultralytics التي تحظى بصيانة جيدة. ويضمن اختيار نموذج تدعمه Ultralytics تجربة استخدام سلسة تتميز بواجهة API بسيطة ووثائق شاملة.

يستفيد المطورون كثيرًا من متطلبات الذاكرة المنخفضة للإطار البرمجي؛ إذ يستهلك تدريب نماذج Ultralytics عادةً ذاكرة CUDA أقل بكثير من البدائل الثقيلة القائمة على Transformer مثل RT-DETR. وتتيح هذه البصمة التدريبية الفعالة استخدام أحجام دفعات أكبر على العتاد الاستهلاكي، ما يسرّع الانتقال من جمع البيانات إلى نشر النموذج. كما يوفر الإطار البرمجي تعدد استخدامات لا يُضاهى، إذ يتيح للمستخدمين التبديل بسلاسة بين اكتشاف الأجسام وتقسيم المثيلات وتقدير الوضعيات مع تغييرات طفيفة في الشيفرة.

مثال على التدريب والاستدلال#

تجعل واجهة API الموحدة التحقق من الأفكار سريعًا للغاية. يوضح المقتطف التالي مدى سهولة تدريب نموذج YOLOv10 ونشره باستخدام خلفية PyTorch:

from ultralytics import YOLO

# ⁨حمّل نموذج YOLOv10 nano مدرّبًا مسبقًا⁩
model = YOLO("yolov10n.pt")

# ⁨تدريب النموذج على مجموعة بيانات COCO8⁩
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# ⁨إجراء الاستدلال على صورة نموذجية⁩
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# ⁨تصدير النموذج للنشر على الأجهزة الطرفية⁩
model.export(format="engine", quantize=16)

باستخدام إجراءات التصدير المدمجة، لا يتطلب تحويل النماذج إلى تنسيقات مثل TensorRT أو ONNX سوى سطر واحد من الشيفرة، مع تجاوز عقبات التجميع المعقدة بالكامل.

حالات الاستخدام المثالية وسيناريوهات النشر#

يعتمد الاختيار بين هاتين البنيتين إلى حد كبير على قيود العتاد ومتطلبات المجال المحددة.

تحليلات الفيديو الآنية#

للتطبيقات التي تتطلب زمن استجابة بالغ الانخفاض، مثل القيادة الذاتية أو مراقبة حركة المرور آنياً، يُعد YOLOv10 الخيار الأفضل. إذ يضمن تصميمه الشامل من البداية إلى النهاية والخالي من NMS أزمنة تنفيذ حتمية، وهو أمر بالغ الأهمية لأنظمة السلامة التي لا تحتمل تفاوت زمن المعالجة اللاحقة. وتحقق النماذج بسهولة معدلات إطارات عالية على أجهزة مثل سلسلة NVIDIA Jetson.

الخطوط الأساسية الأكاديمية والمتحكمات الدقيقة الطرفية#

لا يزال YOLOX مفيدًا في الأوساط الأكاديمية، حيث يحتاج الباحثون إلى خط أساس واضح ذي رأس مفصول لتجربة استراتيجيات إسناد التسميات. إضافةً إلى ذلك، يمكن تشغيل YOLOX-Nano الصغير للغاية (أقل من مليون معلمة) على أجهزة طرفية شديدة التقييد بالموارد، حيث تكون الذاكرة محدودة جدًا، شريطة أن يدعم العتاد عمليات الالتفاف القياسية.

المعيار الأمثل: Ultralytics YOLO26#

مع أن YOLOv10 حقق قفزة هائلة بإزالة NMS، فإن مجال الرؤية الحاسوبية يتطور بسرعة. ونوصي بشدة المطورين الساعين إلى تطبيق أفضل أداء متاح اليوم باستكشاف YOLO26.

صدر YOLO26 بوصفه أحدث معيار في ذكاء الرؤية، واستفاد من الأفكار الأساسية لأسلافه وعززها بقوة. وهو يقدم أفضل توازن للأداء، مع دعم أصيل لاكتشاف الأجسام وتقسيمها وتقدير الوضعيات ومربعات الإحاطة الموجّهة.

إليك أسباب اعتبار YOLO26 الخيار الموصى به لمسارات عمل الرؤية الحاسوبية الحديثة:

  • تصميم شامل من البداية إلى النهاية بلا NMS: استنادًا إلى إنجازات YOLOv10، يدعم YOLO26 الاستدلال الأصيل الشامل من البداية إلى النهاية (nms=False)، ويوفر أزمنة استدلال أسرع وحتمية دون اختناقات المعالجة اللاحقة باستخدام NMS.
  • استدلال أسرع بنسبة تصل إلى 43% على CPU: حُسّن YOLO26 خصيصًا للحوسبة الطرفية، ما يضمن أداءً استثنائيًا على المعالجات المحمولة والأجهزة التي لا تحتوي على GPU منفصل.
  • مُحسِّن MuSGD: استلهامًا من تدريب نماذج اللغة الكبيرة (وتحديدًا Kimi K2 من Moonshot AI)، يستخدم YOLO26 مزيجًا من SGD وMuon لتحقيق تدريب مستقر للغاية وتقارب سريع.
  • ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرف على الأجسام الصغيرة، وهو أمر بالغ الأهمية في المجالات الصعبة مثل التصوير الجوي وملاحة الطائرات المسيّرة.
  • إزالة DFL: بإزالة خسارة البؤرة التوزيعية، يبسّط YOLO26 مخطط النموذج لتسهيل التصدير إلى الأجهزة الطرفية ومنخفضة الطاقة.
  • تحسينات خاصة بكل مهمة: سواء كنت تستخدم تقدير الاحتمالية اللوغاريتمية المتبقية (RLE) لتقدير الوضعيات أو خسارة زاوية متخصصة لـ OBB، فإن YOLO26 مضبوط بدقة لكل مهمة رئيسية في الرؤية الحاسوبية.

للمطورين المستعدين لتطوير مسارات عملهم باستخدام أكفأ أدوات التدريب والنشر المتاحة، يضمن الانتقال إلى منصة Ultralytics والاستفادة من YOLO26 بقاؤكم في طليعة الذكاء الاصطناعي. ويمكن للمستخدمين المهتمين ببنى أقدم لكنها مستقرة الاطلاع أيضًا على YOLO11 أو YOLOv8 للاستفادة من دعم مجتمعي واسع وموثوقية مثبتة.

التعليقات