مقارنة YOLOv10 وYOLOv7#
أدى التقدم السريع في مجال الرؤية الحاسوبية خلال السنوات القليلة الماضية إلى ظهور بنيات أكثر كفاءة باستمرار للتطبيقات الآنية. وتُبرز مقارنة YOLOv10 وYOLOv7 مرحلة انتقالية مهمة في هذا التطور. فبينما قدّم YOLOv7 استراتيجيات تدريب فعّالة للغاية وتوسيعًا معماريًا، أحدث YOLOv10 ثورة في النشر من خلال الاستغناء عن الاعتماد طويل الأمد على كبت القيم غير العظمى (NMS).
دفع كلا النموذجين حدود اكتشاف الأجسام عند إصدارهما، إلا أن منظومة Ultralytics الحديثة وظهور نماذج الجيل التالي مثل YOLO26 يقدّمان سير عمل أفضل بكثير لممارسي الذكاء الاصطناعي اليوم.
ملفات تعريف النماذج وأصولها#
يوفّر فهم أصول هذه النماذج سياقًا قيّمًا بشأن خيارات تصميمها المعماري والبحوث الأكاديمية التي تقودها.
تفاصيل YOLOv10#
- المؤلفون: Ao Wang، Hui Chen، Lihao Liu، وآخرون.
- الجهة: جامعة تسينغهوا
- التاريخ: 2024-05-23
- arXiv: YOLOv10: كشف الكائنات الفوري من النهاية إلى النهاية
- GitHub: THU-MIG/yolov10
- الوثائق: وثائق Ultralytics YOLOv10
تفاصيل YOLOv7#
- المؤلفون: Chien-Yao Wang وAlexey Bochkovskiy وHong-Yuan Mark Liao
- الجهة: معهد علوم المعلومات، أكاديميا سينيكا، تايوان
- التاريخ: 2022-07-06
- arXiv: YOLOv7: مجموعة مجانية التدريب تضع معياراً حديثاً جديداً
- GitHub: WongKinYiu/yolov7
- الوثائق: وثائق Ultralytics YOLOv7
الابتكارات المعمارية#
منهج YOLOv7#
أُطلق YOLOv7 في عام 2022، وركّز بدرجة كبيرة على تحسين مسارات التدرج. وقدّم شبكة تجميع الطبقات الممتدة الفعّالة (E-ELAN)، التي أتاحت للنموذج تعلّم ميزات أكثر تنوعًا من دون تدمير مسار التدرج الأصلي. علاوة على ذلك، طبّق المؤلفون منهجية «مجموعة مزايا قابلة للتدريب»، مستخدمين تقنيات إعادة المعلمة أثناء التدريب يمكن دمجها وإزالتها أثناء الاستدلال للحفاظ على سرعات تنفيذ عالية. وعلى الرغم من هذه التحسينات اللافتة، ظل YOLOv7 يعتمد بدرجة كبيرة على NMS للمعالجة اللاحقة، مما أدى إلى زمن استجابة متغير أثناء تحليل المشاهد الكثيفة.
إنجاز YOLOv10#
عالج YOLOv10 عنق زجاجة NMS مباشرةً. فمن خلال تقديم إسنادات مزدوجة متسقة أثناء التدريب، مكّن فريق جامعة تسينغهوا من إجراء اكتشاف شامل من البداية إلى النهاية من دون NMS. ويستخدم هذا النهج ثنائي الرأس فرعًا بإسنادات واحد إلى متعدد لتوفير إشارات إشراف غنية أثناء التدريب، وفرعًا آخر بإسنادات واحد إلى واحد للاستدلال من دون NMS. ويضمن هذا التحول المعماري زمن استدلال فائق الانخفاض ومتسقًا، مناسبًا لتحليلات الفيديو عالية السرعة. علاوة على ذلك، يعتمد YOLOv10 تصميمًا شاملًا للنموذج مدفوعًا بالكفاءة والدقة، متخلصًا من التكرار الحسابي الموجود في الأجيال السابقة.
لا تؤدي إزالة المعالجة اللاحقة عبر NMS إلى تسريع الاستدلال فحسب، بل تبسّط أيضًا النشر بدرجة كبيرة على عتاد الذكاء الاصطناعي الطرفي، مثل مسرّعات الذكاء الاصطناعي ووحدات NPU، حيث يصعب تجميع عمليات NMS المخصصة على نحو ملحوظ.
مقارنة الأداء#
عند مقارنة المقاييس الأولية على مجموعة بيانات MS COCO، تصبح الفجوة بين الجيلين واضحة. يحقق YOLOv10 مفاضلة أفضل بكثير بين عدد المعلمات والمتطلبات الحسابية والدقة.
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (مللي ثانية) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
كما هو موضح أعلاه، يحقق YOLOv10x قيمة mAP أعلى تبلغ 54.4% مقارنةً بـ53.1% التي يحققها YOLOv7x، مع استخدام معلمات أقل بنحو 20%. علاوة على ذلك، توفر نماذج YOLOv10 خفيفة الوزن (Nano وSmall) سرعات استثنائية في النشر باستخدام TensorRT، مما يجعلها جذابة للغاية للنشر على الأجهزة المحمولة.
ميزة منظومة Ultralytics#
مع أن دراسة الأوراق البحثية المعمارية مفيدة، فإن تطوير الرؤية الحاسوبية الحديثة يعتمد على أطر عمل قوية وتتم صيانتها جيدًا. ويوفر اختيار نموذج مدعوم من Ultralytics ميزة هائلة للمطورين الذين يتطلعون إلى الانتقال سريعًا من النموذج الأولي إلى الإنتاج.
تبسيط التطوير#
يمكن الوصول إلى كل من YOLOv10 وYOLOv7 عبر حزمة Ultralytics Python القياسية. ويوفر ذلك سهولة استخدام لا مثيل لها، إذ يستبدل آلاف الأسطر من التعليمات البرمجية التمهيدية بواجهة API بسيطة وبديهية. علاوة على ذلك، تتطلب نماذج Ultralytics YOLO قدرًا أقل بكثير من ذاكرة CUDA أثناء التدريب مقارنةً ببنيات Transformer الثقيلة، مما يتيح استخدام أحجام دفعات أكبر على العتاد المخصص للمستهلكين.
تعدد استخدامات لا مثيل له#
بينما تركز المستودعات الأقدم غالبًا بشكل صارم على اكتشاف مربعات الإحاطة، يدعم إطار Ultralytics المتكامل بسلاسة مجموعة هائلة ومتنوعة من المهام. سواء كنت تُجري تجزئة المثيلات أو تقدير الوضعية أو اكتشاف مربع الإحاطة الموجّه (OBB)، يظل سير العمل متطابقًا.
مثال برمجي: سير عمل تدريب متسق#
يوضح مقتطف التعليمات البرمجية التالي عملية التدريب السلسة، التي تتولى تلقائيًا زيادة البيانات وجدولة معدل التعلم:
from ultralytics import YOLO
# Load the desired model (YOLOv10, YOLOv7, or the recommended YOLO26)
model = YOLO("yolo26n.pt")
# Train the model effortlessly on your dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Export to ONNX format for rapid deployment
model.export(format="onnx")حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLOv10 وYOLOv7 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار YOLOv10#
يُعد YOLOv10 خيارًا قويًا من أجل:
- الاكتشاف في الوقت الفعلي الخالي من NMS: التطبيقات التي تستفيد من الاكتشاف من الطرف إلى الطرف دون كبت القيم غير العظمى، ما يقلل تعقيد النشر.
- المفاضلة المتوازنة بين السرعة والدقة: المشاريع التي تتطلب توازنًا قويًا بين سرعة الاستدلال ودقة الاكتشاف عبر مقاييس نماذج مختلفة.
- التطبيقات ذات زمن الانتقال المتسق: سيناريوهات النشر التي تكون فيها أزمنة الاستدلال المتوقعة أمرًا بالغ الأهمية، مثل الروبوتات أو الأنظمة الذاتية.
متى تختار YOLOv7#
يوصى باستخدام YOLOv7 من أجل:
- المقارنة المعيارية الأكاديمية: إعادة إنتاج النتائج التي كانت تمثل أحدث ما توصل إليه المجال في عام 2022، أو دراسة تأثيرات E-ELAN وتقنيات مجموعة المزايا القابلة للتدريب.
- بحوث إعادة المعلمة: دراسة الالتفافات المعادَة معلمتها المخططة واستراتيجيات تحجيم النماذج المركبة.
- مسارات المعالجة المخصصة الحالية: المشاريع ذات مسارات المعالجة المخصصة بدرجة كبيرة والمبنية حول بنية YOLOv7 المحددة، والتي لا يمكن إعادة هيكلتها بسهولة.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
- البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.
المعيار الجديد: تقديم YOLO26#
مع أن YOLOv10 مثّل قفزة هائلة إلى الأمام في عام 2024، فإن مشهد الرؤية الحاسوبية يتحرك بسرعة مذهلة. ونوصي بشدة، لجميع عمليات التطوير الجديدة، باستخدام أحدث نموذج من الجيل الحالي: Ultralytics YOLO26. وقد أُطلق في يناير 2026، ويمثل ذروة الذكاء الاصطناعي للرؤية الآنية، متفوقًا بدرجة كبيرة على كل من YOLOv7 وYOLOv10.
يقدم YOLO26 ابتكارات غير مسبوقة مصممة خصيصًا لبيئات النشر الحديثة:
- تصميم شامل من البداية إلى النهاية بلا NMS: انطلاقًا من الأساس الذي أرساه YOLOv10، يلغي YOLO26 معالجة NMS اللاحقة أصلاً، بما يتيح مسارات نشر أبسط واستدلالًا متسقًا عالي السرعة.
- استدلال على CPU أسرع بنسبة تصل إلى 43%: جرى تحسينه بدرجة كبيرة للحوسبة الطرفية والأجهزة التي تفتقر إلى وحدات GPU مخصصة، مما يوفر وفورات هائلة في تكاليف العتاد.
- إزالة DFL: أُزيلت خسارة البؤرة التوزيعية بالكامل، مما يبسّط منطق التصدير جذريًا ويحسّن التوافق بدرجة كبيرة مع الأجهزة الطرفية منخفضة الطاقة والمتحكمات الدقيقة.
- مُحسِّن MuSGD: مستوحى من Kimi K2 من Moonshot AI، ويمزج هذا المحسِّن الهجين بين SGD وMuon ليجلب ابتكارات تدريب النماذج اللغوية الكبيرة (LLM) مباشرةً إلى الرؤية الحاسوبية، مما ينتج ديناميكيات تدريب مستقرة للغاية وتقاربًا أسرع.
- ProgLoss + STAL: توفر دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو مجال صعب تاريخيًا وضروري للطائرات المسيّرة والروبوتات ومراقبة المدن الذكية.
- تحسينات خاصة بالمهام: لا يقتصر YOLO26 على كونه كاشفًا. فهو يتضمن خسارة متخصصة للتجزئة الدلالية، وتقديرًا للباقي من لوغاريتم الترجيح (RLE) لتتبع الوضعية فائق الدقة، وخوارزميات متخصصة لخسارة الزاوية للقضاء على مشكلات حدود OBB.
للحصول على أفضل تجربة ممكنة في إدارة مجموعات بياناتك وتدريب YOLO26 ونشر النماذج على السحابة، استكشف منصة Ultralytics. فهي توفر واجهة بلا تعليمات برمجية تتكامل تمامًا مع Python SDK.
حالات الاستخدام الواقعية#
يعتمد اختيار البنية المناسبة بدرجة كبيرة على قيود العتاد والتطبيق لديك.
متى تستخدم YOLOv7#
يظل YOLOv7 خيارًا موثوقًا للحفاظ على مسارات المعالجة القديمة المدمجة بعمق مع بنيات tensor الخاصة به، أو عند إعادة إنتاج المقاييس المعيارية الأكاديمية من عامي 2022 و2023. ويقدم أداءً ممتازًا على وحدات GPU للخوادم المتطورة.
متى تستخدم YOLOv10#
يتألق YOLOv10 في السيناريوهات التي تتطلب زمن استجابة صارمًا وثابتًا. وبفضل خلوه من NMS، فهو ممتاز لعدّ الحشود عالية الكثافة أو اكتشاف عيوب التصنيع، حيث يتغير عدد الأجسام بشدة بينما يجب أن يظل زمن المعالجة لكل إطار ثابتًا.
متى تستخدم YOLO26#
يُعد YOLO26 الخيار الحاسم لأي مشروع جديد كليًا. فمن نشر أنظمة إنذار أمني متطورة على Raspberry Pi أساسي إلى تشغيل تحليلات فيديو سحابية ضخمة، تتفوق سرعاته على CPU وقدراته المتقدمة في اكتشاف الأجسام الصغيرة بدرجة كبيرة على الأجيال الأقدم.
وللمطورين المهتمين باستكشاف بنيات حديثة بديلة، نوفر أيضًا دعمًا موسعًا للكاشفات القائمة على Transformer مثل RT-DETR، وللنماذج السابقة الراسخة مثل Ultralytics YOLO11.