مقارنة بين YOLOX وYOLOv9#
لقد تشكّل مشهد الرؤية الحاسوبية بفضل اختراقات معمارية متواصلة توازن بين الكفاءة الحاسوبية والدقة العالية. وعند تقييم نماذج اكتشاف الأجسام في الوقت الفعلي، تُبرز المقارنة بين YOLOX من Megvii وYOLOv9 من Academia Sinica فلسفتين متميزتين في تطوير التعلم العميق. فبينما ابتكر أحدهما نهجًا مبسطًا لا يعتمد على المراسي، قدّم الآخر تقنيات متقدمة لتوجيه التدرجات بهدف زيادة الاحتفاظ بالمعلومات إلى أقصى حد.
يستكشف هذا الدليل التقني الفروق المعمارية الدقيقة بينهما، ومعايير الأداء، وحالات الاستخدام المثلى، كما يوضّح كيف توفر حلول حديثة مثل منصة Ultralytics ونموذج YOLO26 المُطلَق حديثًا بدائل متفوقة لعمليات النشر الجاهزة للإنتاج.
YOLOX: ريادة النهج غير المعتمد على المراسي#
أُطلق YOLOX في منتصف عام 2021، وكان خطوة كبيرة إلى الأمام في سد الفجوة بين البحث الأكاديمي والتطبيق الصناعي. ومن خلال إزالة الحاجة إلى مربعات المراسي المحددة مسبقًا، بسّط بدرجة كبيرة عملية الضبط الاستكشافي المطلوبة لمجموعات البيانات المخصصة.
- المؤلفون: Zheng Ge وSongtao Liu وFeng Wang وZeming Li وJian Sun
- المنظمة: Megvii
- تاريخ الإصدار: 18 يوليو 2021
- المرجع: بحث Arxiv
- شفرة المصدر: مستودع YOLOX على GitHub
- الوثائق: وثائق YOLOX الرسمية
الابتكارات المعمارية#
قدّم YOLOX عدة تغييرات رئيسية على مسار اكتشاف الأجسام القياسي. فقد طبّق رأسًا مفصولًا يفصل بين مهمتَي التصنيف والانحدار، مما خفّض بدرجة كبيرة التعارض بين تحديد الجسم وتعيين حدوده. علاوة على ذلك، اعتمد YOLOX استراتيجية SimOTA متقدمة لإسناد التسميات، تخصص العينات الموجبة ديناميكيًا أثناء التدريب، مما يؤدي إلى تقارب أسرع وأداء عام أفضل على مجموعات البيانات المعيارية القياسية.
نقاط القوة والقيود#
تكمن القوة الأساسية لـ YOLOX في تصميمه المبسط. فآلية عدم الاعتماد على المراسي تعني أن المطورين يقضون وقتًا أقل في تشغيل خوارزميات التجميع للعثور على أحجام المراسي المثلى لبياناتهم الخاصة. ومع ذلك، وباعتباره بنية أقدم صُممت أساسًا من دون التطورات الحديثة في الانتباه الذاتي أو توجيه مسارات التدرج، فإنه يواجه صعوبة في مجاراة كفاءة المعلمات التي توفرها الشبكات الأحدث. كما أنه يفتقر إلى دعم أصلي لمهام متقدمة مثل تجزئة المثيلات وتقدير الوضعية ضمن API موحد.
YOLOv9: تعظيم معلومات التدرج#
وبالانتقال سريعًا إلى عام 2024، قدّم YOLOv9 نهجًا نظريًا بدرجة كبيرة لحل مشكلة عنق الزجاجة المعلوماتي المتأصلة في الشبكات العصبية الالتفافية العميقة.
- المؤلفون: Chien-Yao Wang وHong-Yuan Mark Liao
- الجهة: معهد علوم المعلومات، أكاديمية سينيكا
- تاريخ الإصدار: 21 فبراير 2024
- المرجع: بحث Arxiv
- شفرة المصدر: مستودع YOLOv9 على GitHub
- الوثائق: وثائق Ultralytics لـ YOLOv9
الابتكارات المعمارية#
تتمثل السمة المميزة لـ YOLOv9 في معلومات التدرج القابلة للبرمجة (PGI)، التي تضمن عدم فقدان البيانات الدلالية المهمة أثناء مرورها عبر طبقات متعددة من الشبكة. وبالاقتران مع شبكة تجميع الطبقات الفعّالة المعممة (GELAN)، يحقق YOLOv9 نسبة استثنائية بين عدد المعلمات والدقة. ويتيح ذلك للنموذج الاحتفاظ بتدرجات دقيقة لتحديث الأوزان، مما يجعله فعالًا للغاية حتى في إصداراته خفيفة الوزن.
نقاط القوة والقيود#
يتفوق YOLOv9 في دفع الحدود النظرية لـدقة النموذج. فهو يحقق درجات mAP رائعة على COCO، مما يجعله مفضلًا لدى الباحثين. ومع ذلك، وعلى الرغم من كفاءته، لا يزال YOLOv9 يعتمد على كبت غير الأعظم التقليدي (NMS) للمعالجة اللاحقة، مما يسبب ارتفاعات في زمن الاستدلال. وبالنسبة إلى المهندسين الذين يركزون على نشر الذكاء الاصطناعي على الأجهزة الطرفية، فإن إدارة منطق NMS تضيف تعقيدًا غير ضروري إلى مسار النشر.
تتطلب النماذج التقليدية مثل YOLOX وYOLOv9 استخدام كبت غير الأعظم (NMS) لتصفية مربعات الإحاطة المكررة. وهذه الخطوة متسلسلة بطبيعتها، وغالبًا ما تؤدي إلى اختناق في وحدات CPU، مما يبرز الحاجة إلى البنى الأصلية الشاملة من البداية إلى النهاية الموجودة في أحدث نماذج Ultralytics.
مقارنة الأداء#
عند مقارنة المقاييس الحاسوبية الخام لهذه البنى، يتضح أن YOLOv9 يقدم خط أساس أكثر حداثة، بينما يظل YOLOX خيارًا خفيف الوزن للأنظمة القديمة. فيما يلي تحليل تفصيلي لنماذجهما القياسية.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
مع أن YOLOv9 يبرهن على دقة أعلى ضمن أعداد معلمات قابلة للمقارنة، ينبغي للمطورين الذين يبحثون عن التوازن الأمثل بين السرعة والدقة وسهولة الاستخدام أن ينظروا في أحدث التطورات من Ultralytics.
ميزة Ultralytics: تعرّف إلى YOLO26#
مع أن تقييم النماذج التاريخية مثل YOLOX وYOLOv9 يوفر سياقًا قيّمًا، فإن أحدث ما توصلت إليه التقنيات حاليًا يتمثل في Ultralytics YOLO26. وقد أُطلق YOLO26 في أوائل عام 2026، وأعاد تصميم مسار اكتشاف الأجسام جذريًا ليتوافق مع بيئات المؤسسات الحديثة.
ابتكارات معمارية لا مثيل لها#
يحل YOLO26 بالكامل اختناقات المعالجة اللاحقة في أسلافه من خلال تصميم أصلي شامل من البداية إلى النهاية ولا يعتمد على NMS، مما يضمن نشرًا أبسط على جميع أنواع العتاد. علاوة على ذلك، ومن خلال إزالة خسارة البؤرة التوزيعية (DFL) ودمج مُحسِّن MuSGD المبتكر—وهو مزيج من الانحدار المتدرج العشوائي وMuon—يحقق YOLO26 استقرارًا غير مسبوق أثناء التدريب.
بالنسبة إلى المطورين الذين ينشرون النماذج على بيئات محدودة الموارد مثل Raspberry Pi، يوفر YOLO26 استدلالًا أسرع على CPU بنسبة تصل إلى 43%. كما يقدم دوال الخسارة ProgLoss + STAL، مما يؤدي إلى تحسينات كبيرة في التعرّف على الأجسام الصغيرة، وهو أمر بالغ الأهمية بالنسبة إلى الصور الجوية وتحليلات الطائرات المسيّرة.
منظومة تطوير مبسطة#
على خلاف مستودعات الأبحاث المستقلة، توفر منظومة Ultralytics تجربة تطوير لا مثيل لها. وباستخدام Python API لـ Ultralytics، يستطيع المهندسون تقليل الشفرة النمطية بدرجة كبيرة. علاوة على ذلك، جرى تحسين متطلبات الذاكرة بدرجة كبيرة، مما يعني إمكانية تدريب نماذج متينة باستخدام قدر أقل من ذاكرة GPU VRAM مقارنة بالبنى التي تعتمد بدرجة كبيرة على الانتباه.
from ultralytics import YOLO
# Load the highly optimized, NMS-free YOLO26 small model
model = YOLO("yolo26s.pt")
# Train on a custom dataset with minimal memory footprint
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Easily export to optimized deployment formats
model.export(format="engine", quantize=16) # Exports to TensorRTإلى جانب الاكتشاف، يدعم YOLO26 بسلاسة مجموعة كبيرة من المهام ضمن الإطار نفسه تمامًا. وسواء كنت تحتاج إلى مربعات إحاطة موجهة (OBB) دقيقة للتصوير عبر الأقمار الصناعية أو أقنعة بكسلات دقيقة لـتطبيقات التصوير الطبي، يظل سير العمل متطابقًا. وبالنسبة إلى الفرق التي تعتمد على مسارات عمل الجيل السابق، يتوفر أيضًا Ultralytics YOLO11 مع دعم كامل.
حالات الاستخدام المثالية واستراتيجيات النشر#
يعتمد اختيار البنية المناسبة بالكامل على بيئة النشر المستهدفة ومتطلبات المشروع.
الحوسبة الطرفية والروبوتات#
بالنسبة إلى الأجهزة منخفضة الطاقة، قد يؤدي الاعتماد على نماذج تتطلب معالجة لاحقة مكثفة إلى شل الأداء. وعلى الرغم من صغر YOLOX-Nano بدرجة كبيرة، فإن دقته غالبًا ما تكون غير كافية للمهام الحساسة للسلامة. ويُعد YOLO26 الخيار الحاسم هنا؛ إذ يتيح غياب DFL وNMS تشغيله بسلاسة على خيوط CPU الخام، مما يجعله مثاليًا للروبوتات الذاتية أو إدارة مواقف السيارات الذكية.
المقارنة المعيارية الأكاديمية#
إذا كان الهدف الوحيد هو تحليل تدفق التدرجات ودراسة اختناقات الشبكات العميقة، فلا يزال YOLOv9 موضوعًا ممتازًا للدراسة. إذ يوفر إطار PGI رؤى مهمة حول كيفية الحفاظ على السمات عبر طبقات الشبكات العصبية العميقة، مما يجعله أداة قيّمة للباحثين الجامعيين الذين يستكشفون نظرية الشبكات الالتفافية.
تحليلات الفيديو للمؤسسات#
بالنسبة إلى مهام معالجة الفيديو واسعة النطاق مثل أنظمة إنذار الأمان أو مراقبة حركة المرور، تُعد السرعة وإمكانات التصدير المتنوعة أمرين بالغي الأهمية. وتتيح أدوات التصدير الأصلية التي يوفرها إطار Ultralytics للفرق تجميع YOLO26 مباشرة إلى TensorRT أو OpenVINO باستخدام أمر واحد، مما يقلل بدرجة كبيرة الوقت اللازم للوصول إلى السوق.
ومن خلال الاستفادة من الميزات الشاملة لمنظومة Ultralytics، تستطيع فرق التعلم الآلي تجاوز تعقيدات قواعد شفرات الأبحاث الخام والتركيز مباشرة على بناء تطبيقات ذكاء اصطناعي قابلة للتوسع وواقعية.