YOLO Vision 2026:

مقارنة بين YOLOv7 وYOLOv10#

شهد مجال الرؤية الحاسوبية تطورات ملحوظة على مدى السنوات القليلة الماضية، حيث قادت عائلة نماذج YOLO (You Only Look Once) الطليعة في مجال اكتشاف الكائنات في الوقت الفعلي. يتطلب اختيار البنية المناسبة لمشاريع الرؤية الحاسوبية فهماً عميقاً للخيارات المتاحة. في هذه المقارنة التقنية الشاملة، سنستكشف الاختلافات الرئيسية بين بنيتين بارزتين: YOLOv7 وYOLOv10.

مقدمة عن النماذج#

يمثل كلا النموذجين علامات فارقة في تاريخ الذكاء الاصطناعي، ومع ذلك فإنهما يتخذان نهجين مختلفين جذرياً لحل تحديات اكتشاف الكائنات.

YOLOv7: الرائد في مفهوم حقيبة الهدايا#

تم إصدار YOLOv7 في 6 يوليو 2022 بواسطة الباحثين Chien-Yao Wang وAlexey Bochkovskiy وHong-Yuan Mark Liao من Institute of Information Science, Academia Sinica، وقد أحدث نموذج YOLOv7 تحولاً جذرياً في كيفية تحسين الشبكات العصبية. ركز البحث الأصلي، المفصل في academic paper الخاص بهم والمستضاف على official GitHub repository الخاص بهم، بشكل كبير على إعادة إعداد المعلمات الهمارية و"حقيبة الهدايا" القابلة للتدريب.

يستفيد YOLOv7 من شبكة تجميع الطبقات الفعالة الموسعة (E-ELAN) لتوجيه الشبكة في تعلم ميزات متنوعة دون تدمير مسار التدرج الأصلي. وهذا يجعله خياراً قوياً لمعايير البحث الأكاديمي والأنظمة التي تعتمد بشكل كبير على وحدات معالجة الرسومات (GPUs) عالية الأداء.

اعرف المزيد عن YOLOv7

YOLOv10: اكتشاف شامل في الوقت الفعلي#

تم تطوير YOLOv10 بواسطة Ao Wang وفريقه في Tsinghua University، وتم إصداره في 23 مايو 2024. وكما هو موضح بالتفصيل في arxiv publication الخاص به وفي Tsinghua GitHub repository، فإن هذا النموذج يلغي عنق الزجاجة طويل الأمد في اكتشاف الأشياء: Non-Maximum Suppression (NMS).

أدخل YOLOv10 مهام مزدوجة متسقة للتدريب بدون NMS، مما أدى إلى تغيير خط معالجة ما بعد المعالجة بشكل جذري. ومن خلال نشر استراتيجية تصميم نموذج شاملة تعتمد على الكفاءة والدقة، يقلل YOLOv10 من التكرار الحسابي. وينتج عن هذا بنية مصممة خصيصاً لأجهزة الحافة التي تتطلب زمن انتقال منخفض للغاية.

تعرف على المزيد حول YOLOv10

بنية خالية من NMS

إن إزالة Non-Maximum Suppression (NMS) في YOLOv10 يتيح تصدير النموذج بأكمله فرداً كرسماً حسابياً واحداً. هذا يسهل بشكل كبير عملية النشر باستخدام بيئات التشغيل مثل TensorRT أو OpenVINO.

مقارنة الأداء والمقاييس#

عند تحليل أداء النموذج، من الضروري تقييم المقايضات بين الدقة والسرعة والوزن الحسابي. يوضح الجدول التالي كيفية مقارنة أحجام مختلفة من هذه النماذج ببعضها البعض.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

تحليل المقايضات#

تكشف المقاييس أعلاه عن فجوة جيلية واضحة. فبينما يقدم YOLOv7x قيمة mAPval قوية جداً تبلغ 53.1%، فإنه يتطلب 71.3 مليون معلمة و189.9 مليار عملية فاصلة عائمة (FLOPs). في المقابل، يتفوق YOLOv10l في الدقة (53.3% mAP) مع تطلبه لأقل من نصف عدد المعلمات (29.5 مليون) وعدد أقل بكثير من عمليات FLOPs (120.3 مليار). علاوة على ذلك، يوفر YOLOv10n المحسن للغاية سرعة استنتاج مذهلة تبلغ 1.56 مللي ثانية، مما يجعله مثالياً لتحليلات الفيديو في الوقت الفعلي وتطبيقات الهاتف المحمول.

حالات الاستخدام في العالم الحقيقي#

تحدد الاختلافات الهيكلية بين هذه النماذج حالات الاستخدام المثلى لها.

متى تستخدم YOLOv7#

نظرًا لتمثيله الغني للميزات، يتفوق YOLOv7 في البيئات شديدة التعقيد. حالات الاستخدام مثل monitoring traffic flow في المناطق الحضرية المزدحمة، أو تحليل صور الأقمار الصناعية، أو تحديد العيوب في manufacturing automation الثقيلة، تستفيد من إعادة إعداد معمارية القوية. كما أنه مفضل بشدة في الأنظمة القديمة المدمجة بعمق بالفعل مع خطوط أنابيب PyTorch 1.12 المحددة.

متى تستخدم YOLOv10#

يبرز التصميم خفيف الوزن والخالي من NMS الخاص بـ YOLOv10 في البيئات المقيدة. يوصى به بشدة لـ edge computing devices مثل NVIDIA Jetson Nano أو Raspberry Pi. يجعل أداءه منخفض الكمون مثالياً للتطبيقات سريعة الحركة مثل sports analytics، والملاحة الذاتية للطائرات بدون طيار، والفرز الآلي عالي السرعة على سيور النقل.

ميزة نظام Ultralytics البيئي#

في حين أن كلا النموذجين لهما جذور أكاديمية قوية، فإن إمكاناتهما الحقيقية يتم فتحها عند استخدامهما ضمن Ultralytics Platform الموحدة. يُعرف عن تطوير نماذج الرؤية الحاسوبية من الصفر أنه صعب للغاية، لكن النظام البيئي لـ Ultralytics يوفر تجربة لا مثيل لها لمهندسي التعلم الآلي.

  • سهولة الاستخدام: توفر واجهة برمجة تطبيقات Python الخاصة بـ Ultralytics واجهة موحدة. يمكنك تدريب النماذج والتحقق منها وتصديرها ببضعة أسطر فقط من التعليمات البرمجية، مما يجنبك كوابيس التبعيات المعقدة المرتبطة بالمستودعات الأكاديمية النموذجية.
  • نظام بيئي مُصان جيداً: تضمن Ultralytics أن الكود الأساسي قيد التطوير النشط. يستفيد المستخدمون من التكامل السلس مع أدوات التعلم الآلي الشهيرة مثل Weights & Biases للتسجيل، أو Hugging Face للعروض التوضيحية السريعة على الويب.
  • متطلبات الذاكرة: غالباً ما تستهلك كواشف الكائنات المستندة إلى Transformer كميات هائلة من ذاكرة CUDA أثناء التدريب. في المقابل، تتطلب نماذج Ultralytics YOLO ذاكرة أقل بكثير، مما يسمح بـ batch sizes أكبر بكثير على الأجهزة الاستهلاكية.
  • التنوع: لا يقتصر خط أنابيب Ultralytics على مربعات الإحاطة القياسية. فهو يدعم بسلاسة pose estimation وinstance segmentation ومربعات الإحاطة الموجهة عبر عائلات النماذج المدعومة مثل YOLO11 وYOLOv8.

مثال على التدريب المبسط#

يعد تشغيل خط معالجة التدريب باستخدام Ultralytics أمراً مباشراً بشكل ملحوظ. وبغض النظر عما إذا كنت تستفيد من القوة التاريخية لـ YOLOv7 أو سرعة YOLOv10 الخالية من NMS، فإن الصيغة تظل ثابتة:

from ultralytics import YOLO

# Load the preferred model (e.g., YOLOv10 Nano)
model = YOLO("yolov10n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run an inference prediction on a sample image
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Export to an edge-friendly format like ONNX
model.export(format="onnx")

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv7 وYOLOv10 على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.

متى تختار YOLOv7#

يعد YOLOv7 خياراً قوياً لـ:

  • قياس الأداء الأكاديمي: إعادة إنتاج نتائج متطورة من حقبة 2022 أو دراسة تأثيرات تقنيات E-ELAN و"حقيبة الأدوات المجانية" القابلة للتدريب.
  • أبحاث إعادة التقييم (Reparameterization): دراسة الالتفافات المعاد تقييمها المخطط لها واستراتيجيات قياس النموذج المركب.
  • خطوط الأنابيب المخصصة الحالية: المشاريع ذات خطوط الأنابيب المخصصة للغاية المبنية حول معمارية YOLOv7 المحددة التي لا يمكن إعادة تصميمها بسهولة.

متى تختار YOLOv10#

يوصى باستخدام YOLOv10 في الحالات التالية:

  • الكشف الفوري بدون NMS: التطبيقات التي تستفيد من الكشف الشامل (end-to-end) بدون تقنية Non-Maximum Suppression، مما يقلل من تعقيد النشر.
  • الموازنة بين السرعة والدقة: المشاريع التي تتطلب توازناً قوياً بين سرعة الاستدلال ودقة الكشف عبر مختلف أحجام النماذج.
  • تبيقات ذات زمن استجابة ثابت: سيناريوهات النشر التي تكون فيها أوقات الاستدلال المتوقعة حرجة، مثل robotics أو الأنظمة المستقلة.

متى تختار Ultralytics (YOLO26)#

بالنسبة لمعظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطورين:

  • نشر الحافة الخالي من NMS: التطبيقات التي تتطلب استنتاجاً متسقاً ومنخفض زمن الانتقال دون تعقيدات معالجة ما بعد المعالجة باستخدام كبت غير الأقصى.
  • بيئات وحدة المعالجة المركزية (CPU) فقط: الأجهزة التي لا تحتوي على تسريع مخصص بوحدة معالجة الرسوميات (GPU)، حيث توفر سرعة استنتاج CPU أسرع بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • الكشف عن الأشياء الصغيرة: السيناريوهات الصعبة مثل صور الطائرات بدون طيار الجوية أو تحليل مستشعرات إنترنت الأشياء (IoT) حيث تعمل ProgLoss و STAL على تعزيز الدقة بشكل كبير على الأشياء الدقيقة.

المستقبل: تقديم YOLO26#

بينما يمثل YOLOv7 وYOLOv10 علامات فارقة مثيرة للإعجاب، فإن حدود الذكاء الاصطناعي تتقدم دائماً. تم إصدار Ultralytics YOLO26 في يناير 2026، وهو المعيار الجديد بلا منازع للكفاءة والدقة عبر جميع سيناريوهات النشر على الحافة والسحابة.

إذا كنت تبدأ مشروع رؤية حاسوبية جديداً اليوم، فإن YOLO26 هو المعمارية الموصى بها. فهو يبني على إرث أسلافه من خلال دمج العديد من الابتكارات الرائدة:

  • تصميم شامل خالٍ من NMS: مستوحى من YOLOv10، يلغي YOLO26 بشكل أصلي معالجة ما بعد الـ NMS، مما يضمن استنتاجاً بزمن انتقال منخفض للغاية للروبوتات الحتمية في الوقت الفعلي.
  • استدلال أسرع على وحدة المعالجة المركزية (CPU) بنسبة تصل إلى 43%: من خلال إزالة وحدة Distribution Focal Loss (DFL) بشكل استراتيجي، يعمل YOLO26 على تسريع التنفيذ بشكل كبير على أجهزة الحوسبة الطرفية التي لا تحتوي على وحدة معالجة رسومية (GPU)، مما يجعله قوة هائلة لـ IoT devices.
  • محسن MuSGD: مستوحى من ابتكارات تدريب النماذج اللغوية الكبيرة الحديثة، يدمج YOLO26 مزيجاً من SGD وMuon، مما يعمل على استقرار مسارات التدريب وضمان تقارب أسرع.
  • ProgLoss + STAL: تحقق وظائف الخسارة المتقدمة هذه تحسينات ملحوظة في التعرف على الكائنات الصغيرة، مما يتغلب على نقطة ضعف تاريخية في أجيال YOLO القديمة.
  • تعدد استخدامات لا مثيل له: يتميز YOLO26 بتحسينات أصلية خاصة بالمهام مثل تقدير احتمالية السجل المتبقي (RLE) لتتبع الوضع وخسائر الزاوية المتخصصة لاكتشاف OBB الدقيق في الصور الجوية.

بالنسبة للمهندسين الذين يبحثون عن التوازن النهائي بين السرعة والدقة وبساطة النشر، فإن الانتقال من النماذج القديمة إلى YOLO26 يوفر ميزة تنافسية فورية وقابلة للقياس.

المساهمون

التعليقات