استراتيجيات جمع البيانات وتصنيفها لرؤية الحاسوب#
يُعد جمع البيانات والتعليق عليها الخطوتان الأساسيتان في أي مشروع رؤية حاسوبية: حيث تقوم بجمع صور أو مقاطع فيديو مميزة، ثم تصنيفها ليتسنى للنموذج التعلم منها. وتحدد جودة هذه البيانات أداء النموذج بشكل مباشر، ولهذا السبب فإن تحديد الفئات، والمصادر غير المتحيزة، والتعليقات المتسقة أمور بالغة الأهمية قبل بدء أي عملية تدريب.
Watch: How to Build Effective Data Collection and Annotation Strategies for Computer Vision 🚀
يغطي هذا الدليل إعداد الفئات وجمع البيانات، وما هو التعليق على البيانات إلى جانب أنواع التعليقات والصيغ المتاحة للاختيار من بينها، واستراتيجيات الوسم الفعالة؛ حيث يتوافق كل قرار مع أهداف مشروعك.
إعداد الفئات وجمع البيانات#
يعتمد جمع الصور ومقاطع الفيديو لمشروع رؤية حاسوبية على ثلاثة قرارات: عدد الفئات المطلوب تعريفها، ومكان الحصول على البيانات، وكيفية الحفاظ على مجموعة البيانات خالية من التحيز.
اختيار الفئات المناسبة لمشروعك#
أحد الأسئلة الأولى عند بدء مشروع رؤية حاسوبية هو عدد الفئات التي يجب تضمينها. تحتاج إلى تحديد عضوية الفئة، والتي تشمل الفئات أو التسميات المختلفة التي تريد أن يتعرف عليها نموذجك ويميز بينها. يجب تحديد عدد الفئات من خلال الأهداف المحددة لمشروعك.
على سبيل المثال، إذا كنت تريد مراقبة حركة المرور، فقد تشمل فئاتك "سيارة"، "شاحنة"، "حافلة"، "دراجة نارية"، و"دراجة هوائية". من ناحية أخرى، لتتبع العناصر في متجر، يمكن أن تكون فئاتك "فواكه"، "خضروات"، "مشروبات"، و"وجبات خفيفة". يساعد تحديد الفئات بناءً على أهداف مشروعك في الحفاظ على صلة مجموعة بياناتك وتركيزها.
عند تحديد فئاتك، هناك تمييز مهم آخر يجب القيام به وهو الاختيار بين أعداد الفئات الإجمالية أو الدقيقة. يشير 'العدد' إلى عدد الفئات المميزة التي تهتم بها. يؤثر هذا القرار على دقة بياناتك وتعقيد نموذجك. إليك اعتبارات كل نهج:
- عدد الفئات الإجمالي (Coarse Class-Count): هذه فئات أوسع وأكثر شمولاً، مثل "مركبة" و"غير مركبة". وهي تبسط عملية التصنيف وتتطلب موارد حوسبة أقل ولكنها توفر معلومات أقل تفصيلاً، مما قد يحد من فعالية النموذج في السيناريوهات المعقدة.
- عدد الفئات الدقيق (Fine Class-Count): المزيد من الفئات مع تمييزات أدق، مثل "سيدان"، "سيارة دفع رباعي (SUV)"، "شاحنة صغيرة"، و"دراجة نارية". وهي تلتقط معلومات أكثر تفصيلاً، مما يحسن دقة النموذج وأدائه. ومع ذلك، فهي تستغرق وقتاً أطول وتتطلب جهداً أكبر في التصنيف وتستهلك موارد حوسبة أكثر.
يمكن أن يكون البدء بفئات أكثر تحديداً مفيداً جداً، خاصة في المشاريع المعقدة حيث تكون التفاصيل مهمة. تسمح لك الفئات الأكثر تحديداً بجمع بيانات أكثر تفصيلاً، واكتساب رؤى أعمق، وإنشاء تمييزات أوضح بين الفئات. لا يؤدي ذلك إلى تحسين دقة النموذج فحسب، بل يسهل أيضاً تعديل النموذج لاحقاً إذا لزم الأمر، مما يوفر الوقت والموارد.
مصادر البيانات#
يمكنك استخدام مجموعات البيانات العامة أو جمع بيانات مخصصة خاصة بك. توفر مجموعات البيانات العامة مثل تلك الموجودة على Kaggle وGoogle Dataset Search Engine بيانات موحدة ومصنفة بعناية، مما يجعلها نقاط بداية ممتازة لتدريب النماذج والتحقق من صحتها.
من ناحية أخرى، يسمح لك جمع البيانات المخصصة بتكييف مجموعة بياناتك مع احتياجاتك الخاصة. قد تلتقط صوراً ومقاطع فيديو باستخدام الكاميرات أو الطائرات بدون طيار، أو تقوم بجمع الصور من الويب، أو استخدام بيانات داخلية موجودة من مؤسستك. تمنحك البيانات المخصصة مزيداً من التحكم في جودتها ومدى ملاءمتها. يساعد الجمع بين مصادر البيانات العامة والمخصصة في إنشاء مجموعة بيانات متنوعة وشاملة.
تجنب التحيز في جمع البيانات#
يحدث التحيز عندما تكون بعض المجموعات أو السيناريوهات ممثلة بشكل ناقص أو مبالغ فيه في مجموعة البيانات الخاصة بك. يؤدي ذلك إلى نموذج أداؤه جيد مع بعض البيانات وضعيف مع بيانات أخرى. من الضروري تجنب التحيز في الذكاء الاصطناعي لكي تتمكن من جعل نموذج الرؤية الحاسوبية يعمل بشكل جيد في مجموعة متنوعة من السيناريوهات.
إليك كيفية تجنب التحيز أثناء جمع البيانات:
- مصادر متنوعة: اجمع البيانات من العديد من المصادر لالتقاط وجهات نظر وسيناريوهات مختلفة.
- تمثيل متوازن: قم بتضمين تمثيل متوازن من جميع المجموعات ذات الصلة. على سبيل المثال، ضع في اعتبارك مختلف الأعمار والأجناس والأعراق.
- مراقبة مستمرة: قم بمراجعة وتحديث مجموعة بياناتك بانتظام لتحديد ومعالجة أي تحيزات ناشئة.
- تقنيات تخفيف التحيز: استخدم طرقاً مثل زيادة أخذ العينات للفئات ذات التمثيل الناقص، وزيادة البيانات، والخوارزميات المراعية للإنصاف.
تساعد هذه الممارسات في إنشاء نموذج أكثر قوة وعدالة يمكنه التعميم بشكل جيد في تطبيقات العالم الحقيقي.
ما هو تصنيف البيانات (Data Annotation)؟#
التعليق على البيانات هو عملية تسمية البيانات لجعلها قابلة للاستخدام في تدريب نماذج التعلّم الآلي. في الرؤية الحاسوبية، يعني هذا تسمية الصور أو مقاطع الفيديو بالمعلومات التي يحتاج النموذج إلى التعلم منها. وبدون بيانات معلق عليها بشكل صحيح، لا تستطيع النماذج تعلم العلاقات بدقة بين المدخلات والمخرجات.
أنواع تصنيف البيانات#
اعتماداً على المتطلبات المحددة لـمهمة الرؤية الحاسوبية، توجد أنواع مختلفة من التعليقات على البيانات. إليك بعض الأمثلة:
- صناديق التحديد (Bounding Boxes): مربعات مستطيلة تُرسَم حول الكائنات في الصورة، تُستخدم بشكل أساسي لمهام اكتشاف الكائنات. يتم تعريف هذه المربعات بإحداثيات الزاوية العلوية اليسرى والسفلية اليمنى.
- المضلعات: مخططات تفصيلية للأشخاص أو الأشياء، تتيح تعليقاً أكثر دقة من مربعات الإحاطة. تُستخدم المضلعات في مهام مثل تجزئة المثيلات، حيث يكون شكل العنصر مهماً.
- الأقنعة: أقنعة ثنائية حيث يكون كل بكسل إما جزءاً من عنصر أو من الخلفية. تُستخدم الأقنعة في مهام التجزئة الدلالية لتوفير تفاصيل على مستوى البكسل.
- النقاط الرئيسية: نقاط محددة يتم تحديدها داخل الصورة لتحديد مواقع الاهتمام. تُستخدم النقاط الرئيسية في مهام مثل تقدير الوضعية واكتشاف ملامح الوجه.
- مربعات التحديد الموجهة: مستطيلات تحمل زاوية دوران، وتُستخدم في مهام OBB حيث تظهر الكائنات باتجاهات عشوائية، مثل الصور الجوية.
تنسيقات التصنيف الشائعة#
بعد اختيار نوع التصنيف، من المهم اختيار التنسيق المناسب لتخزين ومشاركة التصنيفات. التنسيقات الأكثر شيوعاً هي:
| التنسيق | هيكل الملف | يُستخدم عادةً لـ |
|---|---|---|
| COCO | ملف JSON واحد | اكتشاف الكائنات، تجزئة المثيلات، اكتشاف النقاط الرئيسية، العناصر والتجزئة الشاملة، التعليق على الصور |
| Pascal VOC | ملف XML واحد لكل صورة | اكتشاف الكائنات |
| YOLO | ملف .txt واحد لكل صورة | اكتشاف الكائنات، التجزئة، الوضع، والمربعات الموجهة |
يحفظ تنسيق YOLO صفاً واحداً لكل كائن مع مؤشرات فئات تبدأ من 0. بالنسبة لـ اكتشاف الكائنات، يكون الصف هو class x_center y_center width height مع إحداثيات مقياسية من 0 إلى 1. يستبدل صف التجزئة المربع بنقاط المضلع المقياسية للكائن، بينما يحتفظ صف الوضع بالمربع ويُلحق إحداثيات النقاط الرئيسية بعده، مع علامة رؤية لكل نقطة رئيسية عندما يعلن مجموعة البيانات عن kpt_shape: [n, 3]. يحفظ صف OBB التعبير class x1 y1 x2 y2 x3 y3 x4 y4 باستخدام إحداثيات الزوايا المقيسة.
إذا كانت أداة التعليقات التوضيحية الخاصة بك تصدر تنسيق COCO JSON، فيمكنك إما تحويله إلى تسميات YOLO .txt أو التدريب على تنسيق JSON مباشرة باستخدام فئة مجموعة بيانات مخصصة.
وضع إرشادات التصنيف#
بعد اختيار نوع التعليق والصيغة، تتمثل الخطوة التالية في وضع قواعد واضحة وموضوعية للوسم. تعمل هذه القواعد كخريطة طريق للاتساق والدقة طوال عملية التعليق. تتضمن الجوانب الرئيسية لهذه القواعد ما يلي:
- الوضوح والتفصيل: تأكد من أن تعليماتك واضحة. استخدم أمثلة وتوضيحات لإظهار ما هو متوقع.
- الاتساق: اجعل تصنيفاتك موحدة. ضع معايير قياسية لتصنيف أنواع مختلفة من البيانات، بحيث تتبع جميع التصنيفات نفس القواعد.
- تقليل التحيز: كن محايداً. درب نفسك على أن تكون موضوعياً وقلل التحيزات الشخصية لضمان تصنيفات عادلة.
- الكفاءة: اعمل بذكاء، وليس بجهد أكبر. استخدم الأدوات وسير العمل التي تعمل على أتمتة المهام المتكررة، مما يجعل عملية التصنيف أسرع وأكثر كفاءة.
ستساعدك مراجعة وتحديث قواعد التصنيف بانتظام في الحفاظ على دقة تصنيفاتك واتساقها وتوافقها مع أهداف مشروعك.
أدوات الوسم#
تتيح لك أداة التعليقات التوضيحية الجيدة تسمية كل نوع تحتاجه مهمتك، وتفرض إرشادات متسقة، وتصدر التسميات بتنسيق جاهز للتدريب. توفر منصة Ultralytics Platform محرر تعليقات توضيحية مدمجاً يغطي الاكتشاف، وتجزئة المثيلات، والتجزئة الدلالية، والتصنيف، والوضع، وOBB، مع تعليقات توضيحية ذكية مدعومة بـ SAM والتي تحول نقرة واحدة إلى قناع لمهام الاكتشاف، وتجزئة المثيلات، والتجزئة الدلالية، وOBB. نظراً لحفظ التعليقات التوضيحية بالتنسيق الذي تتوقعه كل مهمة — صفوف YOLO .txt للمهام المكانية ومجلدات الفئات للتصنيف — فإن مجموعة البيانات المعنونة الخاصة بك تنتقل مباشرة إلى التدريب دون أي خطوة تحويل.
جودة التصنيف: الدقة، والضبط، والقيم المتطرفة#
قبل التعليق على نطاق واسع، من المفيد فهم الدقة، والضبط، والقيم الشاذة، ومراقبة الجودة، حتى لا تقوم بالتعليق على بياناتك بطريقة تؤدي إلى نتائج عكسية.
فهم الدقة والإحكام#
من المهم فهم الفرق بين الدقة والضبط وكيفية ارتباطهما بالتعليق. تشير الدقة إلى مدى قرب البيانات المعلق عليها من القيم الحقيقية. وهي تساعدنا في قياس مدى عكس التسميات لسيناريوهات العالم الحقيقي. يشير الضضبط إلى اتساق التعليقات. وهو يتحقق مما إذا كنت تمنح نفس التسمية لنفس الكائن أو الميزة في جميع أنحاء مجموعة البيانات. تؤدي الدقة والضبط العاليان إلى نماذج مدربة بشكل أفضل عن طريق تقليل التشويش وتحسين قدرة النموذج على التعميم من بيانات التدريب.
تحديد القيم المتطرفة#
القيم المتطرفة هي نقاط بيانات تنحرف قليلاً عن الملاحظات الأخرى في مجموعة البيانات. فيما يتعلق بالتصنيفات، يمكن أن تكون القيمة المتطرفة صورة مصنفة بشكل غير صحيح أو تصنيفاً لا يتناسب مع بقية مجموعة البيانات. القيم المتطرفة مقلقة لأنها يمكن أن تشوه عملية تعلم النموذج، مما يؤدي إلى تنبؤات غير دقيقة وضعف في التعميم.
يمكنك استخدام طرق مختلفة لاكتشاف القيم المتطرفة وتصحيحها:
- التقنيات الإحصائية: لاكتشاف القيم الشاذة في الميزات الرقمية مثل قيم البكسل، أو إحداثيات مربع الإحاطة، أو أحجام الكائنات، يمكنك استخدام طرق مثل مخططات الصندوق، أو الرسوم البيانية التكرارية، أو درجات z.
- التقنيات البصرية: لاكتشاف الشذوذ في الميزات الفئوية مثل فئات الكائنات، أو الألوان، أو الأشكال، استخدم أساليب بصرية مثل رسم الصور، أو التسميات، أو الخرائط الحرارية.
- الطرائق الخوارزمية: استخدم أدوات مثل التجميع (مثل تجميع K-means، وDBSCAN) وخوارزميات اكتشاف الحالات الشاذة لتحديد القيم الشاذة بناءً على أنماط توزيع البيانات.
مراقبة جودة البيانات المصنفة#
تماماً مثل المشاريع التقنية الأخرى، تعد مراقبة الجودة ضرورية للبيانات المصنفة. من الممارسات الجيدة التحقق بانتظام من التصنيفات للتأكد من دقتها واتساقها. يمكن القيام بذلك بعدة طرق مختلفة:
- مراجعة عينات من البيانات المصنفة
- استخدام أدوات آلية لاكتشاف الأخطاء الشائعة
- جعل شخص آخر يقوم بإعادة التحقق من التصنيفات
إذا كنت تعمل مع عدة أشخاص، فإن الاتساق بين المصنفين المختلفين مهم. الاتفاق الجيد بين المصنفين يعني أن الإرشادات واضحة وأن الجميع يتبعها بنفس الطريقة. إنها تحافظ على توافق الجميع وتجعل التصنيفات متسقة.
أثناء المراجعة، إذا وجدت أخطاء، قم بتصحيحها وتحديث الإرشادات لتجنب الأخطاء المستقبلية. قدم ملاحظات للمصنفين وقدم تدريباً منتظماً للمساعدة في تقليل الأخطاء. إن وجود عملية قوية للتعامل مع الأخطاء يبقي مجموعة بياناتك دقيقة وموثوقة.
استراتيجيات فعالة لتصنيف البيانات#
لجعل عملية تصنيف البيانات أكثر سلاسة وفعالية، فكر في تنفيذ هذه الاستراتيجيات:
- إرشادات تصنيف واضحة: قدم تعليمات مفصلة مع أمثلة لضمان أن جميع المصنفين يفسرون المهام بشكل متسق. على سبيل المثال، عند تصنيف الطيور، حدد ما إذا كنت تريد تضمين الطائر بأكمله أو أجزاء معينة فقط.
- فحوصات الجودة المنتظمة: حدد معايير واستخدم مقاييس محددة لمراجعة العمل، مع الحفاظ على معايير عالية من خلال التغذية الراجعة المستمرة.
- استخدام أدوات التصنيف المسبق: توفر العديد من منصات التصنيف الحديثة ميزات التصنيف المسبق المدعومة بالذكاء الاصطناعي والتي يمكنها تسريع العملية بشكل كبير من خلال إنشاء تصنيفات أولية تلقائياً يمكن للبشر تحسينها لاحقاً.
- تنفيذ التعلم النشط: يعطي هذا النهج الأولوية لتصنيف العينات الأكثر إفادة أولاً، مما قد يقلل من العدد الإجمالي للتصنيفات المطلوبة مع الحفاظ على أداء النموذج.
- المعالجة المجمعة: قم بتجميع الصور المتشابهة معاً للتصنيف للحفاظ على الاتساق وتحسين الكفاءة.
يمكن أن تساعد هذه الاستراتيجيات في الحفاظ على تصنيفات عالية الجودة مع تقليل الوقت والموارد المطلوبة لعملية التصنيف.
الخلاصة#
يعد جمع بيانات متنوعة وغير متحيزة والتعليق عليها باستمرار باستخدام الأدوات المناسبة أساساً لنموذج رؤية حاسوبية موثوق. بعد جمع مجموعة البيانات الخاصة بك وتسميتها، تابع إلى دليل خطوات مشروع الرؤية الحاسوبية للانتقال إلى التدريب والتقييم. إذا ظهرت أسئلة على طول الطريق، فاسأل المجتمع على مستودع Ultralytics GitHub أو خادم Ultralytics Discord.
الأسئلة الشائعة#
للحد من التحيز، اجمع البيانات من مصادر متنوعة، وتأكد من وجود تمثيل متوازن عبر جميع المجموعات ذات الصلة (مثل الأعمار والأجناس والأعراق المختلفة)، وراجع مجموعة البيانات وحدثها بانتظام لاكتشاف التحيزات الناشئة، وطبق تقنيات التخفيف مثل الإفراط في أخذ عينات من الفئات غير الممثلة بشكل كافٍ، وزيادة البيانات، والخوارزميات الواعية بالعدالة. يؤدي تجنب التحيز بهذه الطريقة إلى الحفاظ على أداء نموذج الرؤية الحاسوبية بشكل جيد عبر سيناريوهات متنوعة في العالم الحقيقي ويحسن قدرته على التعميم.
ضع إرشادات تصنيف واضحة وموضوعية مع تعليمات مفصلة وأمثلة ورسوم توضيحية، ثم طبقها بشكل موحد عبر جميع أنواع البيانات بحيث تتبع كل عملية تصنيف نفس القواعد. درب المصنفين على البقاء محايدين لتقليل التحيز الشخصي، وراجع الإرشادات وحدثها بانتظام، واستخدم فحوصات الاتساق الآلية بالإضافة إلى ملاحظات المصنفين للحفاظ على دقة عالية ومتوافقة مع أهداف مشروعك.
يكفي بضع مئات من الكائنات المعلق عليها لكل فئة لبدء التجربة مع التعلم النقلي، ولكن للحصول على أداء موثوق في العالم الحقيقي، توصي Ultralytics بـ ما لا يقل عن 1,500 صورة و10,000 حالة موسومة لكل فئة. اجمع بين مجموعة بيانات كبيرة بما فيه الكفاية وجدول تدريب معقول — حيث يُعد حوالي 300 حقبة (epochs) نقطة بداية شائعة، يتم تقليلها إذا فرط النموذج في التكيف (overfit) مبكراً — وحافظ على صرامة تعليقاتك وتوافقها مع أهداف مشروعك المحددة. استكشف استراتيجيات التدريب التفصيلية في دليل تدريب YOLO26.
نعم. تتضمن منصة Ultralytics Platform محرر تعليقات توضيحية مدمجاً يدعم مربعات التحديد، والمضلعات، والنقاط الرئيسية، والمربعات الموجهة، وتسميات التصنيف في مساحة عمل واحدة. تعمل التعليقات التوضيحية الذكية المدعومة بـ SAM على تسريع التسمية لمهام الاكتشاف، وتجزئة المثيلات، والتجزئة الدلالية، وOBB عن طريق إنشاء أقنعة من نقرة واحدة، بينما يتم التعليق التوضيحي على الوضع والتصنيف يدوياً. يتم تخزين التعليقات التوضيحية في التنسيق الذي تتوقعه كل مهمة — صفوف YOLO
.txtللمهام المكانية، ومجلدات الفئات للتصنيف — وهي جاهزة لـ التدريب.قم بم مطابقة نوع التعليق التوضيحي مع المهمة التي تنوي التدريب عليها. تعتبر مربعات التحديد الأسرع في الرسم وهي كل ما يحتاجه اكتشاف الكائنات. تكلف المضلعات والأقنعة وقتاً أكثر بشكل ملحوظ لكل كائن ولكنها مطلوبة لـ تجزئة المثيلات عندما يكون الشكل الدقيق للكائن مهمًا. تناسب النقاط الرئيسية تقدير الوضع واكتشاف المعالم، وتناسب المربعات الموجهة مهام OBB مثل الصور الجوية، حيث يحيط المستطيل المحاذي للمحور بمساحة خلفية أكبر من اللازم. إن التعليق التوضيحي لأضيق مهمة تحتاجها بالفعل يحافظ على جهد التسمية متناسباً مع النتيجة.