رؤية YOLO لعام 2026:

كيفية اختبار نماذج الرؤية الحاسوبية#

مقدمة#

يتحقق اختبار النموذج من أداء النموذج المدرب على بيانات حقيقية وغير مرئية من قبل - كالأجسام المتحركة أو ضعيفة الإضاءة أو المخفية جزئيًا، بدلاً من معيار مختار بعناية. وفي حين أن تقييم النموذج يقيس المقاييس على مجموعة بيانات مصنفة، فإن الاختبار يتحقق من أن السلوك المتعلم للنموذج يتطابق مع أهداف تطبيقك قبل النشر. يغطي هذا الدليل إعداد بيانات الاختبار، واختبار نماذج Ultralytics YOLO26، واكتشاف فرط التخصيص، وضعف التخصيص، وتسرّب البيانات.



Watch: How to Test Machine Learning Models | Avoid Data Leakage in Computer Vision 🚀

اختبار النموذج مقابل تقييم النموذج#

يعد اختبار النموذج وتقييم النموذج خطوتين مختلفتين في مشروع رؤية حاسوبية. يقيس التقييم الأداء باستخدام المقاييس على مجموعة بيانات مصنفة؛ بينما يتحقق الاختبار مما إذا كان السلوك المتعلم للنموذج يصمد في ظروف تشبه النشر.

تخيل أنك قمت بتدريب نموذج رؤية حاسوبية التعرف على القطط والكلاب، وتريد نشر هذا النموذج في متجر حيوانات أليفة لمراقبة الحيوانات. خلال مرحلة تقييم النموذج، تستخدم مجموعة بيانات مصنفة لحساب مقاييس مثل الدقة، وإحكام التنبؤ، والاسترجاع. على سبيل المثال، قد تكون دقة النموذج 98% في التمييز بين القطط والكلاب في مجموعة بيانات معينة.

بعد التقييم، تقوم باختبار النموذج باستخدام صور من متجر الحيوانات الأليفة لمعرفة مدى نجاحه في تحديد القطط والكلاب في ظروف أكثر تنوعًا وواقعية. تتحقق مما إذا كان بإمكانه تصنيف القطط والكلاب بشكل صحيح عندما تكون في حالة حركة، أو في ظروف إضاءة مختلفة، أو محجوبة جزئيًا بواسطة أشياء مثل الألعاب أو الأثاث. يتحقق اختبار النموذج من أن النموذج يتصرف كما هو متوقع خارج بيئة التقييم الخاضعة للرقابة.

الاستعداد لاختبار النموذج#

عادة ما يتم تقسيم مجموعات بيانات الرؤية الحاسوبية إلى مجموعات تدريب واختبار لمحاكاة الظروف الواقعية: بيانات التدريب تعلّم النموذج، بينما تتحقق بيانات الاختبار من سلوكه على أمثلة لم يسبق له رؤيتها. تحافظ منصة Ultralytics على تنظيم بيانات التدريب والتعليقات في مكان واحد، مما يساعد عند بناء مجموعة اختبار مصنفة.

قبل الاختبار
  • تمثيل واقعي: يجب أن تكون بيانات الاختبار غير المرئية مشابهة للبيانات التي سيتعامل معها النموذج عند نشره. وهذا يعطي صورة واقعية عن قدرات النموذج.
  • حجم كافٍ: يجب أن تكون مجموعة بيانات الاختبار كبيرة بما يكفي لتقديم رؤى موثوقة حول مدى جودة أداء النموذج.

كيفية اختبار نموذج YOLO26#

يتضمن اختبار نموذج YOLO26 المُدرَّب مساري عمل متكاملين: التحقق من صحة النموذج على تقسيم اختبار مُصنَّف للحصول على مقاييس كمية، والتنبؤ على صور جديدة لفحص السلوك نوعيًا.

التحقق من الصحة على تقسيم اختبار مُصنَّف#

تقارن وضع التحقق من الصحة تنبؤات النموذج بتسميات الحقيقة الأرضية وتُبلغ عن الدقة، والاسترجاع، وmAP50، وmAP50-95 لنماذج الكشف. كما يحفظ مساعدات مرئية مثل مصفوفة الارتباك ومنحنى الدقة والاسترجاع، والتي تساعدك في تحديد المجالات المحددة التي قد لا يؤدي فيها النموذج بشكل جيد.

الاستخدام
from ultralytics import YOLO

# Load a pretrained model or your own trained checkpoint, e.g. "path/to/best.pt"
model = YOLO("yolo26n.pt")

# Validate; add split="test" if your dataset YAML defines a test split
metrics = model.val(data="coco8.yaml")
print(metrics.box.map)  # mAP50-95

بشكل افتراضي، يعمل التحقق من الصحة على تقسيم val الخاص بمجموعة البيانات. لقياس الأداء على مجموعة اختبار محجوزة، حدد تقسيم test: في ملف YAML الخاص بمجموعة البيانات ومرر split="test".

التنبؤ على صور جديدة#

وضع التنبؤ يشغل النموذج على بيانات جديدة وغير مرئية دون الحاجة إلى تسميات. وهو لا ينتج مقاييس الأداء، ولكن حفظ المخرجات المعلقة يتيح لك مراجعة كيفية أداء النموذج على صور الواقع - على سبيل المثال، مجلد كامل من صور الاختبار دفعة واحدة.

الاستخدام
from ultralytics import YOLO

# Load a pretrained model or your own trained checkpoint, e.g. "path/to/best.pt"
model = YOLO("yolo26n.pt")

# Run predictions on a folder of test images and save annotated results
results = model.predict(source="path/to/test_images", save=True)
اختبار نموذج مُدرَّب مسبقًا قبل التدريب المخصص

للتحقق مما إذا كان YOLO26 يناسب تطبيقك قبل الاستثمار في التدريب المخصص، قم بتشغيل وضع التنبؤ باستخدام نقطة تحقق مدرّبة مسبقًا على صورك الخاصة. النماذج مدربة مسبقًا على مجموعات بيانات مثل COCO، لذا تعطيك النتائج فكرة سريعة عن مدى جودة أداء النموذج في سياقك المحدد.

وضع التحقق مقابل وضع التنبؤ#

النمطالغرضيتطلب تسمياتالمخرجات
التحقق من الصحةقياس الأداء مقابل الحقيقة الأرضيةنعمالإحكام، الاستدعاء، mAP50، mAP50-95، مصفوفة الارتباك، منحنيات PR
التنبؤفحص سلوك النموذج على بيانات جديدة غير مصنفةلاصور مشروحة ونتائج تنبؤ، بدون مقاييس

كيفية تحليل نتائج الاختبار#

بمجرد الحصول على التنبؤات والمقاييس، تعمق في معرفة أين ولماذا يفشل النموذج:

  • الصور المصنفة بشكل خاطئ: حدد وراجع الصور التي صنفها النموذج بشكل خاطئ لفهم أين يكمن الخطأ.
  • تحليل الخطأ: قم بإجراء تحليل شامل للأخطاء لفهم أنواع الأخطاء (مثل الإيجابيات الكاذبة مقابل السلبيات الكاذبة) وأسبابها المحتملة.
  • التحيز والعدالة: تحقق من وجود أي تحيزات في تنبؤات النموذج. تأكد من أن النموذج يعمل بشكل جيد بالتساوي عبر المجموعات الفرعية المختلفة للبيانات، خاصة إذا كانت تتضمن سمات حساسة مثل العرق أو الجنس أو العمر.

الفرط في التخصيص ونقص التخصيص في التعلم الآلي#

عند اختبار نموذج تعلم الآلة، خاصة في الرؤية الحاسوبية، من المهم الانتباه إلى فرط التخصيص وضعف التخصيص. يمكن أن تؤثر هذه المشكلات بشكل كبير على مدى نجاح نموذجك في العمل مع البيانات الجديدة.

المشكلةعلامات شائعةكيفية معالجتها
الفرط في التخصيص (Overfitting)دقة تدريب عالية ولكن دقة تحقق منخفضة؛ حساسية مفرطة للتغيرات الطفيفة أو التفاصيل غير ذات الصلة في الصورتطبيق الانتظام مثل الإسقاط، وزيادة حجم مجموعة بيانات التدريب، وتبسيط هيكل النموذج
نقص التخصيص (Underfitting)دقة منخفضة حتى في مجموعة التدريب؛ فشل مستمر في التعرف على الميزات أو الكائنات الواضحةاستخدم نموذجًا أكثر تعقيدًا، ووفر ميزات أكثر صلة، وزد عدد دورات التدريب

المفتاح هو إيجاد توازن بحيث يعمل النموذج بشكل جيد على مجموعتي بيانات التدريب والتحقق. تساعد مراقبة المقاييس بانتظام وفحص التنبؤات بصريًا أثناء الاختبار في اكتشاف الانحراف نحو أي من الطرفين.

Comparison of underfitting, appropriate fitting, and overfitting on the same dataset

تسرب البيانات في الرؤية الحاسوبية وكيفية تجنبه#

يحدث تسرب البيانات عندما يتم استخدام معلومات من خارج مجموعة بيانات التدريب لتدريب النموذج عن طريق الخطأ. قد يبدو النموذج دقيقًا جدًا أثناء التدريب، لكنه لن يعمل بشكل جيد على بيانات جديدة غير مرئية عند حدوث تسرب للبيانات.

قد يكون من الصعب اكتشاف التسرب وغالبًا ما يأتي من تحيزات مخفية في بيانات التدريب:

نوع التحيزكيف يبدو
تحيز الكاميراتُدخل الزوايا والإضاءة والظلال وحركات الكاميرا المختلفة أنماطًا غير مرغوب فيها
تحيز التراكب (Overlay)الشعارات، أو الطوابع الزمنية، أو التراكبات الأخرى في الصور تضلل النموذج
تحيز الخط والكائنالخطوط أو الكائنات المحددة التي تظهر بشكل متكرر في فئات معينة تحرف تعلم النموذج
تحيز مكانيتؤثر الاختلالات بين المقدمة والخلفية وتوزيعات صناديق الإحاطة ومواقع الكائنات على التدريب
تحيز التسمية والمجالتؤدي التسميات غير الصحيحة أو التحولات في أنواع البيانات إلى حدوث تسرب

كيفية اكتشاف وتجنب تسرب البيانات#

للعثور على تسرب البيانات، تحقق مما إذا كانت نتائج النموذج جيدة بشكل مدهش، وانظر ما إذا كانت ميزة واحدة أكثر أهمية من غيرها، وتأكد مرتين من أن قرارات النموذج منطقية بحدس، وتحقق من تقسيم البيانات بشكل صحيح قبل أي معالجة.

ولمنعه، استخدم مجموعة بيانات متنوعة تحتوي على صور أو مقاطع فيديو من كاميرات وبيئات مختلفة، وراجع بياناتك بعناية بحثًا عن تحيزات مخفية - مثل أن تكون جميع العينات الإيجابية قد تم التقاطها في وقت محدد من اليوم. يؤدي تجنب تسرب البيانات إلى جعل نماذج الرؤية الحاسوبية الخاصة بك أكثر موثوقية في مواقف العالم الحقيقي.

ماذا بعد اختبار النموذج؟#

بعد اختبار نموذجك، تعتمد الخطوات التالية على النتائج. إذا كان أداء نموذجك جيدا، يمكنك نشره في بيئة واقعية. إذا لم تكن النتائج مرضية، ستحتاج إلى إجراء تحسينات. قد يشمل ذلك تحليل الأخطاء، أو جمع المزيد من البيانات، أو تحسين جودة البيانات، أو ضبط المعلمات الفائقة، وإعادة تدريب النموذج.

الخلاصة#

إن اختبار النموذج الصارم -التحقق من الصحة على مجموعة اختبار محجوزة، والتنبؤ على صور واقعية، والتحقق من فرط التخصيص وتسرّب البيانات- هو ما يحول نموذجًا مقيّمًا بشكل جيد إلى نموذج موثوق. عالج المشكلات التي يظهرها الاختبار قبل النشر، وستكون فرصة أداء نموذجك كما هو متوقع في الإنتاج أعلى بكثير. إذا ظهرت أسئلة على طول الطريق، فاسأل المجتمع في مستودع GitHub لـ Ultralytics أو خادم Discord لـ Ultralytics.

الأسئلة الشائعة#

  • يقيس تقييم النموذج الأداء بمقاييس على مجموعة بيانات مصنفة، بينما يتحقق اختبار النموذج من سلوك النموذج على بيانات جديدة وغير مرئية تشبه ظروف النشر. ينتج التقييم أرقامًا مثل الدقة وmAP من مجموعة بيانات خاضعة للرقابة؛ يكشف الاختبار ما إذا كان السلوك المتعلم يصمد مع الإضاءة المتنوعة أو الحركة أو الإخفاء. انظر اختبار النموذج مقابل تقييم النموذج للحصول على مثال عملي.

  • استخدم وضع التنبؤ ومرر مسار مجلد كـ source - يقوم YOLO26 بالتشغيل على كل صورة في المجلد ويمكنه حفظ النتائج المعلقة للمراجعة. لا يحسب وضع التنبؤ المقاييس؛ لتحديد الأداء كميًا على مجموعة مصنفة، استخدم وضع التحقق من الصحة بدلاً من ذلك. يتم عرض كلا سير العمل في كيفية اختبار نموذج YOLO26.

  • بالنسبة لنماذج الكشف، يبلغ التحقق عن الدقة، والاسترجاع، وmAP50، وmAP50-95، ويحفظ الرسوم البيانية بما في ذلك مصفوفة الارتباك ومنحنى الدقة والاسترجاع. للتحقق من الصحة على تقسيم اختبار مخصص بدلاً من تقسيم val الافتراضي، حدد test: في ملف YAML الخاص بمجموعة البيانات ومرر split="test". راجع دليل مقاييس الأداء لمعرفة كيفية تفسير كل مقياس.

  • بالنسبة لفرط التخصيص، طبق تقنيات الانتظام مثل الإسقاط، أو قم بزيادة حجم مجموعة بيانات التدريب، أو بسّط هيكل النموذج. لضعف التخصيص، استخدم نموذجًا أكثر تعقيدًا، أو وفّر ميزات أكثر صلة، أو تدرب لدورات أكثر. يتم تلخيص علامات كل مشكلة والإصلاحات المقابلة لها في فرط التخصيص وضعف التخصيص في تعلم الآلة.

  • اشتبه في تسرّب البيانات عندما يبدو أداء الاختبار جيدًا بشكل مدهش، أو عندما تسيطر ميزة واحدة على التنبؤات، أو عندما لا تقنع قرارات النموذج بالمنطق البديهي. امنعه باستخدام مجموعات بيانات متنوعة من كاميرات وبيانات ومحيطات مختلفة، ومراجعة البيانات بحثًا عن التحيزات المخفية، والتحقق من أن تقسيم التدريب/الاختبار قد حدث قبل أي معالجة. راجع تسرّب البيانات في الرؤية الحاسوبية لمعرفة أنواع التحيز الشائعة.

  • إذا كانت النتائج تلبي أهداف مشروعك، فانشر النموذج؛ وإلا، فقم بتحسينه قبل النشر. يمكن أن يعني ذلك تحليل الأخطاء، أو جمع المزيد من البيانات المتنوعة، أو تحسين جودة البيانات، أو ضبط المعلمات الفائقة، وإعادة التدريب. كرّر الاختبار بعد كل جولة من التغييرات للتأكد من نجاح الإصلاحات.

التعليقات