استراتيجيات جمع البيانات وتصنيفها لرؤية الحاسوب#
يُعد جمع البيانات والتعليق عليها الخطوتان الأساسيتان في أي مشروع رؤية حاسوبية: حيث تقوم بجمع صور أو مقاطع فيديو مميزة، ثم تصنيفها ليتسنى للنموذج التعلم منها. وتحدد جودة هذه البيانات أداء النموذج بشكل مباشر، ولهذا السبب فإن تحديد الفئات، والمصادر غير المتحيزة، والتعليقات المتسقة أمور بالغة الأهمية قبل بدء أي عملية تدريب.
Watch: How to Build Effective Data Collection and Annotation Strategies for Computer Vision 🚀
يغطي هذا الدليل إعداد الفئات وجمع البيانات، وما هو التعليق على البيانات إلى جانب أنواع التعليقات والصيغ المتاحة للاختيار من بينها، واستراتيجيات الوسم الفعالة؛ حيث يتوافق كل قرار مع أهداف مشروعك.
إعداد الفئات وجمع البيانات#
يعتمد جمع الصور ومقاطع الفيديو لمشروع رؤية حاسوبية على ثلاثة قرارات: عدد الفئات المطلوب تعريفها، ومكان الحصول على البيانات، وكيفية الحفاظ على مجموعة البيانات خالية من التحيز.
اختيار الفئات المناسبة لمشروعك#
أحد الأسئلة الأولى عند بدء مشروع رؤية حاسوبية هو عدد الفئات التي يجب تضمينها. تحتاج إلى تحديد عضوية الفئة، والتي تشمل الفئات أو التسميات المختلفة التي تريد أن يتعرف عليها نموذجك ويميز بينها. يجب تحديد عدد الفئات من خلال الأهداف المحددة لمشروعك.
على سبيل المثال، إذا كنت تريد مراقبة حركة المرور، فقد تشمل فئاتك "سيارة"، "شاحنة"، "حافلة"، "دراجة نارية"، و"دراجة هوائية". من ناحية أخرى، لتتبع العناصر في متجر، يمكن أن تكون فئاتك "فواكه"، "خضروات"، "مشروبات"، و"وجبات خفيفة". يساعد تحديد الفئات بناءً على أهداف مشروعك في الحفاظ على صلة مجموعة بياناتك وتركيزها.
عند تحديد فئاتك، هناك تمييز مهم آخر يجب القيام به وهو الاختيار بين أعداد الفئات الإجمالية أو الدقيقة. يشير 'العدد' إلى عدد الفئات المميزة التي تهتم بها. يؤثر هذا القرار على دقة بياناتك وتعقيد نموذجك. إليك اعتبارات كل نهج:
- عدد الفئات الإجمالي (Coarse Class-Count): هذه فئات أوسع وأكثر شمولاً، مثل "مركبة" و"غير مركبة". وهي تبسط عملية التصنيف وتتطلب موارد حوسبة أقل ولكنها توفر معلومات أقل تفصيلاً، مما قد يحد من فعالية النموذج في السيناريوهات المعقدة.
- عدد الفئات الدقيق (Fine Class-Count): المزيد من الفئات مع تمييزات أدق، مثل "سيدان"، "سيارة دفع رباعي (SUV)"، "شاحنة صغيرة"، و"دراجة نارية". وهي تلتقط معلومات أكثر تفصيلاً، مما يحسن دقة النموذج وأدائه. ومع ذلك، فهي تستغرق وقتاً أطول وتتطلب جهداً أكبر في التصنيف وتستهلك موارد حوسبة أكثر.
يمكن أن يكون البدء بفئات أكثر تحديداً مفيداً جداً، خاصة في المشاريع المعقدة حيث تكون التفاصيل مهمة. تسمح لك الفئات الأكثر تحديداً بجمع بيانات أكثر تفصيلاً، واكتساب رؤى أعمق، وإنشاء تمييزات أوضح بين الفئات. لا يؤدي ذلك إلى تحسين دقة النموذج فحسب، بل يسهل أيضاً تعديل النموذج لاحقاً إذا لزم الأمر، مما يوفر الوقت والموارد.
مصادر البيانات#
يمكنك استخدام مجموعات البيانات العامة أو جمع بيانات مخصصة خاصة بك. توفر مجموعات البيانات العامة مثل تلك الموجودة على Kaggle وGoogle Dataset Search Engine بيانات موحدة ومصنفة بعناية، مما يجعلها نقاط بداية ممتازة لتدريب النماذج والتحقق من صحتها.
من ناحية أخرى، يسمح لك جمع البيانات المخصصة بتكييف مجموعة بياناتك مع احتياجاتك الخاصة. قد تلتقط صوراً ومقاطع فيديو باستخدام الكاميرات أو الطائرات بدون طيار، أو تقوم بجمع الصور من الويب، أو استخدام بيانات داخلية موجودة من مؤسستك. تمنحك البيانات المخصصة مزيداً من التحكم في جودتها ومدى ملاءمتها. يساعد الجمع بين مصادر البيانات العامة والمخصصة في إنشاء مجموعة بيانات متنوعة وشاملة.
تجنب التحيز في جمع البيانات#
يحدث التحيز عندما تكون بعض المجموعات أو السيناريوهات ممثلة بشكل ناقص أو مبالغ فيه في مجموعة البيانات الخاصة بك. يؤدي ذلك إلى نموذج أداؤه جيد مع بعض البيانات وضعيف مع بيانات أخرى. من الضروري تجنب التحيز في الذكاء الاصطناعي لكي تتمكن من جعل نموذج الرؤية الحاسوبية يعمل بشكل جيد في مجموعة متنوعة من السيناريوهات.
إليك كيفية تجنب التحيز أثناء جمع البيانات:
- مصادر متنوعة: اجمع البيانات من العديد من المصادر لالتقاط وجهات نظر وسيناريوهات مختلفة.
- تمثيل متوازن: قم بتضمين تمثيل متوازن من جميع المجموعات ذات الصلة. على سبيل المثال، ضع في اعتبارك مختلف الأعمار والأجناس والأعراق.
- مراقبة مستمرة: قم بمراجعة وتحديث مجموعة بياناتك بانتظام لتحديد ومعالجة أي تحيزات ناشئة.
- تقنيات تخفيف التحيز: استخدم طرقاً مثل زيادة أخذ العينات للفئات ذات التمثيل الناقص، وزيادة البيانات، والخوارزميات المراعية للإنصاف.
تساعد هذه الممارسات في إنشاء نموذج أكثر قوة وعدالة يمكنه التعميم بشكل جيد في تطبيقات العالم الحقيقي.
ما هو تصنيف البيانات (Data Annotation)؟#
التعليق على البيانات هو عملية تسمية البيانات لجعلها قابلة للاستخدام في تدريب نماذج التعلّم الآلي. في الرؤية الحاسوبية، يعني هذا تسمية الصور أو مقاطع الفيديو بالمعلومات التي يحتاج النموذج إلى التعلم منها. وبدون بيانات معلق عليها بشكل صحيح، لا تستطيع النماذج تعلم العلاقات بدقة بين المدخلات والمخرجات.
أنواع تصنيف البيانات#
اعتماداً على المتطلبات المحددة لـمهمة الرؤية الحاسوبية، توجد أنواع مختلفة من التعليقات على البيانات. إليك بعض الأمثلة:
- صناديق التحديد (Bounding Boxes): مربعات مستطيلة تُرسَم حول الكائنات في الصورة، تُستخدم بشكل أساسي لمهام اكتشاف الكائنات. يتم تعريف هذه المربعات بإحداثيات الزاوية العلوية اليسرى والسفلية اليمنى.
- المضلعات: مخططات تفصيلية للأشخاص أو الأشياء، تتيح تعليقاً أكثر دقة من مربعات الإحاطة. تُستخدم المضلعات في مهام مثل تجزئة المثيلات، حيث يكون شكل العنصر مهماً.
- الأقنعة: أقنعة ثنائية حيث يكون كل بكسل إما جزءاً من عنصر أو من الخلفية. تُستخدم الأقنعة في مهام التجزئة الدلالية لتوفير تفاصيل على مستوى البكسل.
- النقاط الرئيسية: نقاط محددة يتم تحديدها داخل الصورة لتحديد مواقع الاهتمام. تُستخدم النقاط الرئيسية في مهام مثل تقدير الوضعية واكتشاف ملامح الوجه.
تنسيقات التصنيف الشائعة#
بعد اختيار نوع التصنيف، من المهم اختيار التنسيق المناسب لتخزين ومشاركة التصنيفات. التنسيقات الأكثر شيوعاً هي:
| التنسيق | هيكل الملف | يُستخدم عادةً لـ |
|---|---|---|
| COCO | ملف JSON واحد | اكتشاف الكائنات، تجزئة المثيلات، اكتشاف النقاط الرئيسية، العناصر والتجزئة الشاملة، التعليق على الصور |
| Pascal VOC | ملف XML واحد لكل صورة | اكتشاف الكائنات |
| YOLO | ملف .txt واحد لكل صورة | اكتشاف الكائنات، والتقسيم، والوضعية (pose) |
تخزن صيغة YOLO صفاً واحداً لكل كائن مع مؤشرات الفئات بدءاً من 0. بالنسبة لـاكتشاف الكائنات، يكون الصف عبارة عن class x_center y_center width height مع إحداثيات منسقة بين 0-1، بينما تلحق التجزئة نقاط مضلع منسقة وتلحق الوضعية إحداثيات النقاط الرئيسية بالإضافة إلى قيم الرؤية الاختيارية بعد المربع.
وضع إرشادات التصنيف#
بعد اختيار نوع التعليق والصيغة، تتمثل الخطوة التالية في وضع قواعد واضحة وموضوعية للوسم. تعمل هذه القواعد كخريطة طريق للاتساق والدقة طوال عملية التعليق. تتضمن الجوانب الرئيسية لهذه القواعد ما يلي:
- الوضوح والتفصيل: تأكد من أن تعليماتك واضحة. استخدم أمثلة وتوضيحات لإظهار ما هو متوقع.
- الاتساق: اجعل تصنيفاتك موحدة. ضع معايير قياسية لتصنيف أنواع مختلفة من البيانات، بحيث تتبع جميع التصنيفات نفس القواعد.
- تقليل التحيز: كن محايداً. درب نفسك على أن تكون موضوعياً وقلل التحيزات الشخصية لضمان تصنيفات عادلة.
- الكفاءة: اعمل بذكاء، وليس بجهد أكبر. استخدم الأدوات وسير العمل التي تعمل على أتمتة المهام المتكررة، مما يجعل عملية التصنيف أسرع وأكثر كفاءة.
ستساعدك مراجعة وتحديث قواعد التصنيف بانتظام في الحفاظ على دقة تصنيفاتك واتساقها وتوافقها مع أهداف مشروعك.
أدوات الوسم#
تتيح لك أداة التعليق الجيدة وسم كل نوع تحتاجه مهمتك، وتفرض إرشادات متسقة، وتصدر التسميات بصيغة جاهزة للتدريب. توفر منصة Ultralytics Platform محرر تعليقات مدمجاً يغطي الاكتشاف، وتجزئة المثيلات، والوضعية، والمربعات الموجهة (OBB)، والتصنيف، مع تعليق ذكي مدعوم بـ SAM يحول نقرة واحدة إلى قناع لمهام الاكتشاف والتجزئة وOBB. ونظراً لأنه يتم حفظ كل تعليق بصيغة YOLO format، تنتقل مجموعة البيانات الموسومة مباشرة إلى التدريب دون الحاجة لأي خطوة تحويل.
جودة التصنيف: الدقة، والضبط، والقيم المتطرفة#
قبل التعليق على نطاق واسع، من المفيد فهم الدقة، والضبط، والقيم الشاذة، ومراقبة الجودة، حتى لا تقوم بالتعليق على بياناتك بطريقة تؤدي إلى نتائج عكسية.
فهم الدقة والإحكام#
من المهم فهم الفرق بين الدقة والضبط وكيفية ارتباطهما بالتعليق. تشير الدقة إلى مدى قرب البيانات المعلق عليها من القيم الحقيقية. وهي تساعدنا في قياس مدى عكس التسميات لسيناريوهات العالم الحقيقي. يشير الضضبط إلى اتساق التعليقات. وهو يتحقق مما إذا كنت تمنح نفس التسمية لنفس الكائن أو الميزة في جميع أنحاء مجموعة البيانات. تؤدي الدقة والضبط العاليان إلى نماذج مدربة بشكل أفضل عن طريق تقليل التشويش وتحسين قدرة النموذج على التعميم من بيانات التدريب.
تحديد القيم المتطرفة#
القيم المتطرفة هي نقاط بيانات تنحرف قليلاً عن الملاحظات الأخرى في مجموعة البيانات. فيما يتعلق بالتصنيفات، يمكن أن تكون القيمة المتطرفة صورة مصنفة بشكل غير صحيح أو تصنيفاً لا يتناسب مع بقية مجموعة البيانات. القيم المتطرفة مقلقة لأنها يمكن أن تشوه عملية تعلم النموذج، مما يؤدي إلى تنبؤات غير دقيقة وضعف في التعميم.
يمكنك استخدام طرق مختلفة لاكتشاف القيم المتطرفة وتصحيحها:
- التقنيات الإحصائية: لاكتشاف القيم الشاذة في الميزات الرقمية مثل قيم البكسل، أو إحداثيات مربع الإحاطة، أو أحجام الكائنات، يمكنك استخدام طرق مثل مخططات الصندوق، أو الرسوم البيانية التكرارية، أو درجات z.
- التقنيات البصرية: لاكتشاف الشذوذ في الميزات الفئوية مثل فئات الكائنات، أو الألوان، أو الأشكال، استخدم أساليب بصرية مثل رسم الصور، أو التسميات، أو الخرائط الحرارية.
- الطرائق الخوارزمية: استخدم أدوات مثل التجميع (مثل تجميع K-means، وDBSCAN) وخوارزميات اكتشاف الحالات الشاذة لتحديد القيم الشاذة بناءً على أنماط توزيع البيانات.
مراقبة جودة البيانات المصنفة#
تماماً مثل المشاريع التقنية الأخرى، تعد مراقبة الجودة ضرورية للبيانات المصنفة. من الممارسات الجيدة التحقق بانتظام من التصنيفات للتأكد من دقتها واتساقها. يمكن القيام بذلك بعدة طرق مختلفة:
- مراجعة عينات من البيانات المصنفة
- استخدام أدوات آلية لاكتشاف الأخطاء الشائعة
- جعل شخص آخر يقوم بإعادة التحقق من التصنيفات
إذا كنت تعمل مع عدة أشخاص، فإن الاتساق بين المصنفين المختلفين مهم. الاتفاق الجيد بين المصنفين يعني أن الإرشادات واضحة وأن الجميع يتبعها بنفس الطريقة. إنها تحافظ على توافق الجميع وتجعل التصنيفات متسقة.
أثناء المراجعة، إذا وجدت أخطاء، قم بتصحيحها وتحديث الإرشادات لتجنب الأخطاء المستقبلية. قدم ملاحظات للمصنفين وقدم تدريباً منتظماً للمساعدة في تقليل الأخطاء. إن وجود عملية قوية للتعامل مع الأخطاء يبقي مجموعة بياناتك دقيقة وموثوقة.
استراتيجيات فعالة لتصنيف البيانات#
لجعل عملية تصنيف البيانات أكثر سلاسة وفعالية، فكر في تنفيذ هذه الاستراتيجيات:
- إرشادات تصنيف واضحة: قدم تعليمات مفصلة مع أمثلة لضمان أن جميع المصنفين يفسرون المهام بشكل متسق. على سبيل المثال، عند تصنيف الطيور، حدد ما إذا كنت تريد تضمين الطائر بأكمله أو أجزاء معينة فقط.
- فحوصات الجودة المنتظمة: حدد معايير واستخدم مقاييس محددة لمراجعة العمل، مع الحفاظ على معايير عالية من خلال التغذية الراجعة المستمرة.
- استخدام أدوات التصنيف المسبق: توفر العديد من منصات التصنيف الحديثة ميزات التصنيف المسبق المدعومة بالذكاء الاصطناعي والتي يمكنها تسريع العملية بشكل كبير من خلال إنشاء تصنيفات أولية تلقائياً يمكن للبشر تحسينها لاحقاً.
- تنفيذ التعلم النشط: يعطي هذا النهج الأولوية لتصنيف العينات الأكثر إفادة أولاً، مما قد يقلل من العدد الإجمالي للتصنيفات المطلوبة مع الحفاظ على أداء النموذج.
- المعالجة المجمعة: قم بتجميع الصور المتشابهة معاً للتصنيف للحفاظ على الاتساق وتحسين الكفاءة.
يمكن أن تساعد هذه الاستراتيجيات في الحفاظ على تصنيفات عالية الجودة مع تقليل الوقت والموارد المطلوبة لعملية التصنيف.
شارك أفكارك مع المجتمع#
يمكن أن يساعد طرح أفكارك واستفساراتك على عشاق الرؤية الحاسوبية الآخرين في تسريع مشاريعك. إليك بعض الطرق الرائعة للتعلم واستكشاف الأخطاء وإصلاحها والتواصل:
أين تجد المساعدة والدعم#
- مشاكل GitHub: تفضل بزيارة مستودع YOLO26 على GitHub واستخدم علامة تبويب المشاكل (Issues) لطرح الأسئلة والإبلاغ عن الأخطاء واقتراح الميزات. يتواجد المجتمع والمطورون الأساسيون لمساعدتك في أي مشكلة تواجهها.
- خادم ديسكورد من Ultralytics: انضم إلى خادم ديسكورد من Ultralytics للتواصل مع المستخدمين والمطورين الآخرين، والحصول على الدعم، ومشاركة المعرفة، وتبادل الأفكار.
التوثيق الرسمي#
- توثيق YOLO26 من Ultralytics: ارجع إلى التوثيق الرسمي لـ YOLO26 للاطلاع على أدلة شاملة ورؤى قيمة حول العديد من مهام ومشاريع الرؤية الحاسوبية.
الخلاصة#
إن جمع بيانات متنوعة وغير متحيزة والتعليق عليها باستمرار باستخدام الأدوات المناسبة هو أساس نموذج رؤية حاسوبية موثوق. بعد جمع مجموعة البيانات ووسمها، تابع إلى دليل خطوات مشروع الرؤية الحاسوبية للانتقال إلى مرحلة التدريب والتقييم.
الأسئلة الشائعة#
للحد من التحيز، اجمع البيانات من مصادر متنوعة، وتأكد من وجود تمثيل متوازن عبر جميع المجموعات ذات الصلة (مثل الأعمار والأجناس والأعراق المختلفة)، وراجع مجموعة البيانات وحدثها بانتظام لاكتشاف التحيزات الناشئة، وطبق تقنيات التخفيف مثل الإفراط في أخذ عينات من الفئات غير الممثلة بشكل كافٍ، وزيادة البيانات، والخوارزميات الواعية بالعدالة. يؤدي تجنب التحيز بهذه الطريقة إلى الحفاظ على أداء نموذج الرؤية الحاسوبية بشكل جيد عبر سيناريوهات متنوعة في العالم الحقيقي ويحسن قدرته على التعميم.
ضع إرشادات تصنيف واضحة وموضوعية مع تعليمات مفصلة وأمثلة ورسوم توضيحية، ثم طبقها بشكل موحد عبر جميع أنواع البيانات بحيث تتبع كل عملية تصنيف نفس القواعد. درب المصنفين على البقاء محايدين لتقليل التحيز الشخصي، وراجع الإرشادات وحدثها بانتظام، واستخدم فحوصات الاتساق الآلية بالإضافة إلى ملاحظات المصنفين للحفاظ على دقة عالية ومتوافقة مع أهداف مشروعك.
يكفي بضع مئات من الكائنات المعلق عليها لكل فئة لبدء التجربة مع التعلم النقلي، ولكن للحصول على أداء موثوق في العالم الحقيقي، توصي Ultralytics بـ ما لا يقل عن 1,500 صورة و10,000 حالة موسومة لكل فئة. اجمع بين مجموعة بيانات كبيرة بما فيه الكفاية وجدول تدريب معقول — حيث يُعد حوالي 300 حقبة (epochs) نقطة بداية شائعة، يتم تقليلها إذا فرط النموذج في التكيف (overfit) مبكراً — وحافظ على صرامة تعليقاتك وتوافقها مع أهداف مشروعك المحددة. استكشف استراتيجيات التدريب التفصيلية في دليل تدريب YOLO26.
نعم. تتضمن منصة Ultralytics Platform محرر تعليقات مدمجاً يدعم مربعات الإحاطة، والمضلعات، والنقاط الرئيسية، والمربعات الموجهة، وتسميات التصنيف في مساحة عمل واحدة. يعمل التعليق الذكي المدعوم بـ SAM على تسريع الوسم لمهام الاكتشاف والتجزئة وOBB من خلال توليد أقنعة بنقرة واحدة، ويتم تخزين كل تعليق بصيغة YOLO format، ليكون جاهزاً لـالتدريب.
أنواع تصنيف البيانات الأكثر شيوعاً في الرؤية الحاسوبية هي مربعات الإحاطة، والمضلعات، والأقنعة، والنقاط الرئيسية، وكل منها مناسب لمهمة مختلفة:
- صناديق التحديد: تُستخدم بشكل أساسي لاكتشاف الكائنات، وهي مربعات مستطيلة حول الكائنات في الصورة.
- المضلعات: توفر مخططات كائنات أكثر دقة ومناسبة لمهام تقسيم المثيلات.
- الأقنعة: توفر تفاصيل على مستوى البكسل، وتُستخدم في التقسيم الدلالي لتمييز الكائنات عن الخلفية.
- النقاط الرئيسية: تحدد نقاط اهتمام محددة داخل الصورة، مفيدة لمهام مثل تقدير الوضع واكتشاف معالم الوجه.
يعتمد اختيار نوع التعليق المناسب على متطلبات مشروعك. تعرف على المزيد حول كيفية تنفيذ هذه التعليقات وصيغها في دليل التعليق على البيانات الخاص بنا.