Link to this sectionمجموعة بيانات العمق ImageNet (المصنفة زائفاً)#
تُعيد مجموعة بيانات ImageNet (عمق مصنف زائفاً) استخدام 1,281,167 صورة تدريب من ImageNet-1K، والتي لا تحتوي على عمق حقيقي (ground-truth)، وتقوم بإقران كل صورة بخريطة عمق زائفة يتم إنتاجها بواسطة نموذج معلم Depth Anything V3 (أحادي العين ومتري). تُستخدم هذه المجموعة فقط من أجل التقطير المعرفي ولتنوع المشاهد والكائنات الذي توفره ImageNet. وباعتبارها أكبر مصدر فردي في مزيج التدريب المسبق لنموذج YOLO26-Depth الذي يضم حوالي 2.19 مليون صورة (حوالي 58%)، كان إضافتها أمراً حاسماً للتعميم عبر النطاقات الداخلية.
Link to this sectionالميزات الرئيسية#
- 1,281,167 صورة تدريب من ImageNet-1K تغطي مجموعة واسعة جداً من الكائنات والمشاهد والسياقات.
- لا يوجد عمق حقيقي (ground-truth): كل هدف عمق هو تسمية زائفة يتم إنتاجها بواسطة معلم Depth Anything V3 (أحادي العين، متري).
- تُستخدم فقط للتقطير المعرفي وتنوع المشاهد/الكائنات، وليس كمعيار قياسي.
- أكبر مصدر فردي في مزيج التدريب المسبق الذي يضم حوالي 2.19 مليون صورة (~58%)، وكان حاسماً للتعميم عبر النطاقات الداخلية.
- لا يوجد تقسيم للتحقق (validation split) — يتم إجراء التحقق فقط على مجموعات بيانات العمق الحقيقية (ground-truth).
Link to this sectionهيكل مجموعة البيانات#
يتكون مصدر ImageNet المصنف زائفاً من صور تدريب ImageNet-1K مع خريطة عمق واحدة يتم إنشاؤها آلياً لكل صورة:
- صور التدريب: 1,281,167 صورة تدريب من ImageNet-1K، وهي أكبر مكون فردي (~58%) من مزيج التدريب المسبق لـ YOLO26-Depth الذي يضم حوالي 2.19 مليون صورة.
- التحقق: لا يوجد. هذا المصدر لا يحتوي على تقسيم للتحقق؛ يستخدم التحقق في YOLO26-Depth مجموعات البيانات ذات العمق الحقيقي (ground-truth) فقط مثل NYU Depth V2 و KITTI Eigen.
Link to this sectionكيفية إنشاء التسميات الزائفة#
نظراً لأن ImageNet لا تأتي مع تعليقات توضيحية للعمق، يتم إنتاج أهداف العمق دون اتصال (offline) بدلاً من قياسها:
- يتم تمرير كل صورة تدريب من ImageNet عبر نموذج معلم Depth Anything V3 مدرب مسبقاً للتنبؤ بخريطة عمق مترية لكل بكسل.
- The teacher prediction is saved as a
.npyfloat32 array in meters, following the Ultralytics depth dataset format, and paired with its source image by file stem. - تتم بعد ذلك إضافة الأزواج المصنفة زائفاً كمكون من مزيج تدريب أكبر، حيث يتعلم نموذج الطالب YOLO26-Depth مطابقة المعلم مع التدريب أيضاً على مصادر العمق الحقيقية (ground-truth).
هذا المصدر المصنف زائفاً هو مكون من تكوين التدريب المختلط الداخلي المستخدم للتدريب المسبق لأوزان YOLO26-Depth المُصدرة ولا يتم توزيعه كتنزيل مستقل.
Link to this sectionدورها في YOLO26-Depth#
يساهم هذا المصدر بالجزء الأكبر من بيانات التدريب المسبق لـ YOLO26-Depth وبأوسع تنوع من المشاهد والكائنات. من خلال تقطير معرفة معلم قوي مثل Depth Anything V3 عبر أكثر من مليون صورة، فإنه ينقل خصائص المشهد الواسعة إلى النموذج الطالب. عملياً، كانت إضافة هذا المصدر حاسمة للتعميم عبر النطاقات الداخلية، مما ساعد النموذج على الأداء الجيد في المشاهد الداخلية خارج توزيعات التدريب ذات العمق الحقيقي (ground-truth).
Link to this sectionالاستخدام#
لا يتم التدريب على بيانات ImageNet المصنفة زائفاً بشكل منفصل؛ بل يتم استهلاكها كمكون من مزيج عمق مدمج، يتم تعريفه بواسطة ملف YAML داخلي/تجريبي بدلاً من تنزيل مجموعة بيانات عامة. من الناحية المفاهيمية، يبدو التدريب على مثل هذا المزيج كما يلي:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this sectionالنماذج المدربة مسبقاً#
يتم تنزيل نماذج YOLO26-Depth المدربة مسبقاً تلقائياً من إصدار أصول v8.4.0 الخاص بـ Ultralytics عند الإشارة إليها بالاسم لأول مرة:
Link to this sectionالاقتباسات والشكر#
إذا كنت تستخدم مجموعة بيانات ImageNet في عملك البحثي أو التطويري، فيرجى الاستشهاد بالورقة البحثية التالية:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}نود أن نشكر فريق ImageNet على إنشاء وصيانة مجموعة البيانات، ومؤلفي Depth Anything على نموذج المعلم المستخدم لتوليد تسميات العمق الزائفة.