YOLOX مقابل YOLOv6-3.0#
حدّد تطوّر الرؤية الحاسوبية إلى حد كبير التقدّم السريع في سلسلة YOLO. وغالبًا ما ينطوي اختيار البنية المناسبة للنشر على تحقيق توازن بين معدل المعالجة الخام، وبساطة البنية، وكفاءة التدريب. ومن أبرز المحطات في هذه الرحلة تركيز YOLOX البحثي على الكواشف الخالية من المراسي، ومعدل المعالجة الصناعي المحسّن بدرجة كبيرة في YOLOv6-3.0.
يفصّل هذا التقييم التقني الاختلافات المعمارية بينهما، ومقاييس الأداء، وحالات الاستخدام المثالية، كما يقدّم قدرات الجيل التالي من Ultralytics YOLO26 للمطوّرين الباحثين عن الحل الأمثل للنشر على الحافة والسحابة.
YOLOX: جسر بين البحث والصناعة#
طوّر باحثون في Megvii نموذج YOLOX، وقدّموه باعتباره تحوّلًا رئيسيًا نحو تبسيط بنية YOLO عبر جعلها خالية تمامًا من المراسي.
- المؤلفون: Zheng Ge، Songtao Liu، Feng Wang، Zeming Li، Jian Sun
- المنظمة: Megvii
- التاريخ: 2021-07-18
- Arxiv: 2107.08430
- GitHub: Megvii-BaseDetection/YOLOX
أبرز معالم البنية المعمارية#
دمج YOLOX بنجاح تصميمًا خاليًا من المراسي في عائلة YOLO. ومن خلال إزالة الصناديق المرساة المحددة مسبقًا، يقلّل النموذج بدرجة كبيرة عدد معلمات التصميم والضبط الاستكشافي المطلوب أثناء التدريب. وهذا يجعل YOLOX قابلًا للتكيّف بدرجة كبيرة مع مجموعات البيانات المخصّصة المتنوعة، من دون إعادة حساب المراسي يدويًا.
علاوةً على ذلك، قدّم YOLOX بنية رأس غير مترابطة. فمن خلال فصل مهمتَي التصنيف والانحدار إلى فرعين مختلفين، يحلّ النموذج التعارض الملازم بين تحديد ماهيّة الكائن وتحديد موضعه. وبالاقتران مع استراتيجية تعيين التسميات SimOTA، يحقق YOLOX تقاربًا أسرع وتحسنًا في متوسط الدقة (mAP).
غالبًا ما تحقق الكواشف الخالية من المراسي، مثل YOLOX، أداءً أفضل على مجموعات البيانات المخصّصة ذات نسب أبعاد الكائنات غير المعتادة، لأنها لا تعتمد على سوابق ثابتة للصناديق المحيطة قد لا تتوافق مع البيانات الجديدة.
YOLOv6-3.0: العملاق الصناعي#
طوّر قسم الذكاء الاصطناعي للرؤية في Meituan نموذج YOLOv6-3.0، وقد صُمّم بوضوح لتحقيق أقصى معدل معالجة صناعي، ولا سيما على وحدات معالجة الرسومات NVIDIA باستخدام مسرّعات عتادية مثل TensorRT.
- المؤلفون: Chuyi Li، Lulu Li، Yifei Geng، وآخرون.
- الجهة: Meituan
- التاريخ: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
التحسين للنشر#
يركّز YOLOv6-3.0 على تحقيق أقصى استفادة من GPU. ويقدّم وحدة BiC للدمج ثنائي الاتجاه في العنق لتعزيز دمج السمات مع الحفاظ على سرعات استدلال عالية. وعلى الرغم من أن مرحلة الاستدلال خالية تمامًا من المراسي، يستخدم YOLOv6-3.0 استراتيجية مبتكرة للتدريب بمساعدة المراسي (AAT) للاستفادة من استقرار الأساليب القائمة على المراسي أثناء مرحلة التدريب.
تُبنى البنية الأساسية باستخدام بنية EfficientRep الملائمة للعتاد، والمصمّمة عمدًا لتقليل تكاليف الوصول إلى الذاكرة وتعظيم الكثافة الحاسوبية على المسرّعات الحديثة. وهذا يجعل YOLOv6 مرشحًا قويًا للغاية لتحليلات الفيديو على جانب الخادم.
مقارنة الأداء#
عند مقارنة هذه النماذج، يجب على المطوّرين الموازنة بين الدقة الخام وسرعة الاستدلال وعدد المعلمات. يسلّط الجدول التالي الضوء على أداء عائلتَي النموذجين عبر أحجام مختلفة.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
بينما يُظهر YOLOv6-3.0 قيمة mAP أعلى وسرعات TensorRT ممتازة في المتغيرات الأكبر، يظل YOLOX منافسًا قويًا بفضل بساطته وأدائه المتين على العتاد القديم.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLOX وYOLOv6 على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.
متى تختار YOLOX؟#
يُعد YOLOX خيارًا قويًا لـ:
- أبحاث الاكتشاف دون مراسٍ: الأبحاث الأكاديمية التي تستخدم بنية YOLOX النظيفة المستغنية عن المراسي خط أساس للتجارب على رؤوس اكتشاف أو دوال خسارة جديدة.
- الأجهزة الطرفية فائقة الخفة: النشر على المتحكمات الدقيقة أو الأجهزة المحمولة القديمة التي تكون فيها البصمة الصغيرة للغاية لمتغير YOLOX-Nano (0.91M معلمة) أمرًا بالغ الأهمية.
- دراسات إسناد التسميات SimOTA: مشاريع بحثية تدرس استراتيجيات إسناد التسميات القائمة على النقل الأمثل وتأثيرها في تقارب التدريب.
متى تختار YOLOv6#
يوصى باستخدام YOLOv6 في الحالات التالية:
- النشر المراعي للعتاد الصناعي: السيناريوهات التي يوفر فيها تصميم النموذج المراعي للعتاد وإعادة المعلمة الفعالة أداءً محسنًا على عتاد مستهدف محدد.
- الاكتشاف السريع أحادي المرحلة: التطبيقات التي تعطي الأولوية لسرعة الاستدلال الخام على GPU لمعالجة الفيديو في الوقت الفعلي ضمن بيئات خاضعة للرقابة.
- التكامل مع منظومة Meituan: الفرق التي تعمل بالفعل ضمن حزمة تقنيات Meituan وبنيتها التحتية للنشر.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
ميزة Ultralytics#
مع أن كلًا من Megvii وMeituan يوفّر مستودعات بحثية قوية، فإن نشر هذه النماذج في بيئة الإنتاج يتطلب غالبًا جهدًا هندسيًا كبيرًا. ويزيل النظام البيئي لـ Ultralytics هذه العقبات من خلال توفير API موحّد وموثّق على نطاق واسع.
من خلال الاستفادة من حزمة Ultralytics، يحصل المطورون على تجربة مستخدم لا مثيل لها. ويشمل ذلك التوسيع التلقائي المدمج، وإدارة الذاكرة عالية الكفاءة أثناء التدريب (مما يقلل بشكل كبير من متطلبات الذاكرة العشوائية لرسومات الفيديو (VRAM) مقارنة بنماذج المحولات مثل RT-DETR)، وأنابيب التصدير السلسة إلى تنسيقات مثل ONNX وOpenVINO.
بخلاف النماذج المتخصصة، تتميز بُنى Ultralytics بمرونة متأصلة، إذ تدعم اكتشاف الكائنات، وتجزئة المثيلات، وتقدير الوضعية، وتصنيف الصور، والصناديق المحيطة الموجّهة (OBB) مباشرةً.
تعرّف إلى YOLO26: الحل الأمثل للحافة#
بالنسبة إلى الفرق التي تبدأ مشاريع جديدة في مجال الرؤية الحاسوبية، نوصي بشدة بالترقية إلى Ultralytics YOLO26 الذي أُطلق حديثًا. واستنادًا إلى نجاحات YOLO11 وYOLOv8، يقدّم YOLO26 ابتكارات تغيّر قواعد اللعبة:
- تصميم شامل خالٍ من NMS: استُكشف هذا النهج أول مرة في YOLOv10، إذ يلغي YOLO26 أصليًا الحاجة إلى المعالجة اللاحقة لـكبت القيم غير العظمى (NMS). وهذا يضمن استدلالًا حتميًا بزمن انتقال منخفض للغاية، وهو أمر بالغ الأهمية للروبوتات الآنية.
- مُحسِّن MuSGD: مستلهمًا من تقنيات تدريب LLM مثل Kimi K2 من Moonshot AI، يستخدم YOLO26 مُحسِّن MuSGD (وهو مزيج هجين من SGD وMuon) لتحقيق ديناميكيات تدريب مستقرة للغاية وتقارب أسرع.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: من خلال إزالة Distribution Focal Loss (DFL) وتبسيط رأس الشبكة، جرى تحسين YOLO26 بدرجة كبيرة للأجهزة الطرفية التي تعتمد على التنفيذ على CPU، متفوقًا بفارق كبير على YOLOv6 في سيناريوهات الحافة.
- ProgLoss + STAL: توفّر صيغ الخسارة المتقدمة هذه تحسينات ملحوظة في اكتشاف الكائنات الصغيرة، ما يجعل YOLO26 مثاليًا للصور الجوية وفحص العيوب المجهرية.
مثال على التدريب الموحّد#
باستخدام Python API من Ultralytics، لا يتطلب تدريب النماذج المتقدمة سوى بضعة أسطر من التعليمات البرمجية. وتنطبق هذه الواجهة النظيفة نفسها سواء كنت تختبر نموذج YOLO قديمًا أو تنشر إطار عمل YOLO26 المتطور.
from ultralytics import YOLO
# Load the next-generation YOLO26 model (NMS-free, optimized for edge)
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset
# The ecosystem handles downloading, caching, and auto-batching natively
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate the model and print mAP metrics
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")
# Export the model for edge deployment
model.export(format="onnx")للحصول على تجربة أكثر سلاسة، أدر مجموعات بياناتك، وتتبّع تجاربك، ودرّب نماذجك في السحابة باستخدام منصة Ultralytics التي لا تتطلب كتابة تعليمات برمجية.
توصيات حالات الاستخدام#
عند الاختيار بين هذه البُنى، ضع قيود العتاد ومتطلبات المشروع المحددة في الحسبان:
- اختر YOLOX إذا كنت تجري بحثًا أكاديميًا حول استراتيجيات تعيين التسميات، أو تحتاج إلى خط أساس خالص وسهل الفهم وخالٍ من المراسي لإجراء تعديلات معمارية مخصّصة.
- اختر YOLOv6-3.0 إذا كنت تنشر على رف خوادم صناعي مزوّد بوحدات معالجة رسومات NVIDIA متقدمة (مثل A100 أو T4)، حيث يمكنك استخدام أحجام دفعات كبيرة وتحسينات TensorRT لمعالجة مئات تدفقات الفيديو في الوقت نفسه.
- اختر YOLO26 لغالبية التطبيقات الحديثة. فإذا كنت تبني تطبيقات الذكاء الاصطناعي على الحافة لأجهزة إنترنت الأشياء أو الطائرات المسيّرة أو الهواتف المحمولة، فإن تصميم YOLO26 الأصلي الخالي من NMS، وتحسينات CPU، ودعم النظام البيئي الشامل، تجعله الخيار الأفضل بلا منازع لردم الفجوة بين التدريب والإنتاج.