YOLO26 مقابل YOLOv9#
يتطور مجال الرؤية الحاسوبية بسرعة، إذ تدفع البنى الجديدة الحدود باستمرار من حيث السرعة والدقة. في هذه المقارنة التقنية، ندرس الفروق بين YOLO26 وYOLOv9، وهما نموذجان مؤثران للغاية في مجال اكتشاف الأجسام في الوقت الفعلي. وعلى الرغم من أن كلا النموذجين يقدّم ابتكارات معمارية متميزة، فإن فهم المفاضلات في الأداء، وإمكانات النشر، ومتطلبات الأجهزة أمر بالغ الأهمية لاختيار الأداة المناسبة لمشروع الرؤية التالي.
YOLO26: القوة المحسّنة للأجهزة الطرفية#
أُطلق Ultralytics YOLO26 في أوائل عام 2026، ويمثل قفزة جيلية في كفاءة النشر واستقرار تدريب النماذج. وقد صُمم ليكون إطار عمل متكاملاً أصلياً من البداية إلى النهاية، ويعالج مباشرةً اختناقات النشر التي طالما عانت منها تطبيقات الذكاء الاصطناعي الطرفية.
تفاصيل النموذج:
- المؤلفان: Glenn Jocher وJing Qiu
- المنظمة: Ultralytics
- التاريخ: 2026-01-14
- GitHub: مستودع Ultralytics
- الوثائق: وثائق YOLO26
البنية والابتكارات#
يعيد YOLO26 تصميم مسار المعالجة اللاحقة جذرياً من خلال تقديم تصميم شامل من البداية إلى النهاية وخالٍ من NMS. وبإلغاء الحاجة إلى الكبت غير الأقصى (NMS)، يحقق النموذج تبايناً أقل بكثير في زمن الاستجابة. وهذا يجعل النشر على المنصات المحمولة والطرفية أسهل كثيراً، ولا سيما عند التصدير إلى أطر عمل مثل ONNX وApple CoreML.
بالإضافة إلى ذلك، تؤدي إزالة خسارة البؤرة التوزيعية (DFL) إلى تبسيط عملية التصدير وتعزيز التوافق مع المتحكمات الدقيقة منخفضة الطاقة. ولتحسين استقرار التدريب، يدمج YOLO26 مُحسِّن MuSGD الجديد، وهو مزيج من الانحدار المتدرج العشوائي (SGD) وMuon (المستوحى من ابتكارات تدريب نماذج اللغة الكبيرة). وينتج عن ذلك تقارب أسرع واستخراج أكثر متانة للسمات عبر مجموعات البيانات الصعبة.
بفضل التبسيطات المعمارية وإزالة DFL، يحقق YOLO26 استدلالاً على CPU أسرع بنسبة تصل إلى 43%، ما يجعله خياراً مثالياً للأجهزة الطرفية محدودة الموارد مثل Raspberry Pi أو NVIDIA Jetson Nano.
لاكتشاف العناصر شديدة الصعوبة في مشاهد مثل الصور الجوية الملتقطة بالطائرات المسيّرة، يستخدم YOLO26 دوال الخسارة المحدّثة ProgLoss + STAL. وتوفر هذه الدوال تحسينات ملحوظة في استرجاع التعرّف على الأجسام الصغيرة. كما يضم تحسينات خاصة بالمهام، تشمل proto متعدد المقاييس من أجل تجزئة المثيلات، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) من أجل تقدير الوضعية، وخسارة زاوية متخصصة لاكتشاف الصناديق المحيطة الموجّهة (OBB).
YOLOv9: المعلومات القابلة للبرمجة للتدرجات#
قُدّم YOLOv9 في أوائل عام 2024، وجلب تطورات نظرية إلى طريقة تعامل الشبكات العصبية مع تدفق التدرجات أثناء مرحلة التدريب، مع التركيز على كفاءة المعلمات والاحتفاظ بالسمات العميقة.
تفاصيل النموذج:
- المؤلفون: Chien-Yao Wang وHong-Yuan Mark Liao
- الجهة: معهد علوم المعلومات، Academia Sinica، تايوان
- التاريخ: 2024-02-21
- Arxiv: ورقة YOLOv9
- GitHub: مستودع YOLOv9
- الوثائق: وثائق YOLOv9
البنية ونقاط القوة#
يعتمد YOLOv9 على مفهومي المعلومات القابلة للبرمجة للتدرجات (PGI) وشبكة تجميع الطبقات الفعّالة المعمّمة (GELAN). ويعالج هذان المفهومان مشكلة عنق الزجاجة المعلوماتي التي تُلاحظ غالباً في الشبكات العصبية العميقة. ومن خلال الحفاظ على المعلومات الأساسية أثناء العملية الأمامية، تضمن GELAN بقاء التدرجات المستخدمة لتحديث الأوزان موثوقة. وتوفر هذه البنية دقة عالية، ما يجعل YOLOv9 مرشحاً قوياً للبحث الأكاديمي في نظرية الشبكات العصبية وتحسين مسارات التدرجات باستخدام إطار عمل PyTorch.
القيود#
على الرغم من كفاءته الممتازة في استخدام المعلمات، يعتمد YOLOv9 بدرجة كبيرة على NMS التقليدي لمعالجة الصناديق المحيطة بعدياً، ما قد يؤدي إلى اختناقات حسابية أثناء الاستدلال على الأجهزة الطرفية. علاوةً على ذلك، يركّز المستودع الرسمي إلى حد كبير على اكتشاف الأجسام، ويتطلب هندسة مخصصة كبيرة لتكييفه مع مهام متخصصة مثل التتبع أو تقدير الوضعية.
مقارنة الأداء#
عند تقييم هذه النماذج للنشر في العالم الحقيقي، تُعد الموازنة بين الدقة (mAP) وسرعة الاستدلال واستخدام الذاكرة أمراً بالغ الأهمية. تشتهر نماذج Ultralytics بمتطلباتها المنخفضة من الذاكرة أثناء التدريب والاستدلال على حد سواء، إذ تتطلب ذاكرة CUDA أقل بكثير من البدائل القائمة على Transformer مثل RT-DETR.
فيما يلي مقارنة مباشرة لأداء YOLO26 وYOLOv9 على مجموعة بيانات COCO. وقد أُبرزت أفضل القيم في كل عمود بخط عريض.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
ملاحظة: أُغفلت سرعات CPU الخاصة بـ YOLOv9 لأنها تختلف بدرجة كبيرة استناداً إلى إعدادات NMS، وتكون عموماً أبطأ من تطبيق YOLO26 الأصلي الخالي من NMS.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLO26 وYOLOv9 على متطلبات مشروعك الخاصة، وقيود النشر، وتفضيلات النظام البيئي.
متى تختار YOLO26#
يُعد YOLO26 خيارًا قويًا من أجل:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
متى تختار YOLOv9#
يوصى باستخدام YOLOv9 من أجل:
- أبحاث عنق الزجاجة المعلوماتي: المشاريع الأكاديمية التي تدرس معماريات المعلومات القابلة للبرمجة للتدرجات (PGI) وشبكة تجميع الطبقات الفعّالة المعمّمة (GELAN).
- دراسات تحسين تدفق التدرجات: الأبحاث التي تركز على فهم فقدان المعلومات في طبقات الشبكات العميقة أثناء التدريب والحد منه.
- قياس أداء اكتشاف عالي الدقة: السيناريوهات التي تحتاج إلى أداء YOLOv9 القوي في معيار COCO بوصفه نقطة مرجعية للمقارنات المعمارية.
ميزة Ultralytics#
ينطوي اختيار النموذج على أكثر من مجرد قراءة معيار للدقة؛ إذ يحدد النظام البرمجي المحيط مدى سرعة انتقالك من جمع البيانات إلى الإنتاج.
سهولة الاستخدام والنظام البيئي#
توفر واجهة Python البرمجية لـ Ultralytics تجربة سلسة من "الصفر إلى الاحتراف". وبدلاً من استنساخ مستودعات معقدة أو إعداد نصوص التدريب الموزع يدوياً، يمكن للمطورين تثبيت الحزمة عبر pip والبدء بالتدريب فوراً. ويضمن نظام Ultralytics البيئي النشط والمُدار باستمرار تحديثات متكررة، وتكاملات آلية مع منصات تعلم الآلة مثل Weights & Biases، ووثائق شاملة.
تعدد الاستخدامات عبر مهام الرؤية#
بينما يُعد YOLOv9 محركاً لاكتشاف الأجسام في المقام الأول، فإن YOLO26 أداة رؤية عامة الغرض. وباستخدام صياغة موحدة واحدة، يمكنك الانتقال بسهولة من اكتشاف الأجسام إلى تجزئة الصور بدقة على مستوى البكسل أو تصنيف الصورة بأكملها. ويقلل هذا التنوع الدين التقني الناتج عن صيانة قواعد شيفرة متعددة ومنفصلة لميزات الرؤية الحاسوبية المختلفة.
التدريب والنشر الفعّالان#
تُعد كفاءة التدريب ركناً أساسياً في فلسفة Ultralytics. ويستخدم YOLO26 أوزاناً مدرّبة مسبقاً ومتاحة بسهولة، كما يتميز باستخدام ذاكرة أقل بكثير مقارنةً بمحوّلات الرؤية الضخمة. وبعد التدريب، تتيح مسارات التصدير المدمجة إجراء تحويلات بنقرة واحدة إلى تنسيقات محسّنة مثل TensorRT أو TensorFlow Lite، ما يمهّد الطريق إلى الإنتاج.
مثال على الشيفرة: بدء استخدام YOLO26#
يُعد تطبيق YOLO26 سهلاً للغاية. يوضح مقتطف Python التالي كيفية تحميل نموذج مدرّب مسبقاً، وتدريبه على بيانات مخصصة، وتشغيل الاستدلال باستخدام واجهة Ultralytics البرمجية.
from ultralytics import YOLO
# Load the latest state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset utilizing the MuSGD optimizer
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Uses GPU 0, or use 'cpu' for CPU training
)
# Run an NMS-free inference on a sample image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Display the bounding boxes and confidences
predictions[0].show()ومن خلال الاستفادة من سرعة YOLO26 وبنيته المبسطة ونظامه البيئي المتين، تستطيع الفرق طرح تطبيقات متقدمة للذكاء الاصطناعي في مجال الرؤية إلى السوق بسرعة أكبر وبعقبات تقنية أقل من أي وقت مضى.