مجموعة بيانات العمق ImageNet (ذات التسميات الزائفة)#
تعيد مجموعة بيانات ImageNet (العمق ذي التسميات الزائفة) استخدام صور التدريب البالغ عددها 1,281,167 صورة من ImageNet-1K، التي لا تحتوي على عمق حقيقي مرجعي، وتقرن كل صورة بخريطة عمق زائفة أنشأها معلّم Depth Anything 3، من خلال الجمع بين نقاط التحقق الأحادية والمتريّة الخاصة به. وتُستخدم حصراً لتقطير المعرفة وللاستفادة من تنوع المشاهد والكائنات الذي توفره ImageNet. وباعتبارها أكبر مصدر منفرد في مزيج التدريب المسبق YOLO26-Depth الذي يضم نحو 2.19 مليون صورة (حوالي 58%)، كان إدراجها حاسماً للتعميم الداخلي عبر المجالات.
الميزات الرئيسية#
- 1,281,167 صورة تدريب من ImageNet-1K تغطي نطاقاً واسعاً جداً من الكائنات والمشاهد والسياقات.
- لا يوجد عمق حقيقي مرجعي: كل هدف عمق هو تسمية زائفة أنشأها معلّم Depth Anything 3 بالاقتران (
DA3MONO-LARGEلبنية المشهد، وDA3METRIC-LARGEللمقياس المتري). - تُستخدم حصراً لتقطير المعرفة ولتنوع المشاهد والكائنات، وليس كمعيار قياس.
- أكبر مصدر منفرد في مزيج التدريب المسبق الذي يضم ~2.19 مليون صورة (~58%)، وكان حاسماً للتعميم الداخلي عبر المجالات.
- لا يوجد تقسيم للتحقق — يُجرى التحقق فقط على مجموعات بيانات حقيقية ذات عمق مرجعي.
بنية مجموعة البيانات#
يتكون مصدر ImageNet ذي التسميات الزائفة من صور التدريب في ImageNet-1K، مع خريطة عمق واحدة مولّدة آلياً لكل صورة:
- صور التدريب: 1,281,167 صورة تدريب من ImageNet-1K، وهي أكبر مكوّن منفرد (~58%) في مزيج التدريب المسبق YOLO26-Depth الذي يضم ~2.19 مليون صورة.
- التحقق: لا يوجد. لا يحتوي هذا المصدر على تقسيم للتحقق؛ إذ يستخدم تحقق YOLO26-Depth فقط مجموعات بيانات حقيقية ذات عمق مرجعي، مثل NYU Depth V2 وKITTI Eigen.
كيفية إنشاء التسميات الزائفة#
نظراً إلى أن ImageNet تُوزَّع من دون شروح للعمق، تُنتَج أهداف العمق دون اتصال بدلاً من قياسها. ويُجمع بين نقطتي تحقق من Depth Anything 3، إحداهما لبنية المشهد والأخرى للمقياس المطلق:
- تُمرَّر كل صورة تدريب من ImageNet عبر
depth-anything/DA3MONO-LARGE، الذي يتنبأ بخريطة عمق عالية التفاصيل لا تُحدَّد إلا حتى مقياس وإزاحة غير معروفين لكل صورة، وعبرdepth-anything/DA3METRIC-LARGE، الذي يكون ناتجه أقل دقة لكنه بوحدات حقيقية. - تُحوِّل مواءمة أفينية متينة لكل صورة التنبؤ الأحادي إلى التنبؤ المتري،
label = a * mono + b. ولذلك تأتي كل التفاصيل لكل بكسل من نقطة التحقق الأحادية، بينما تضبط نقطة التحقق المترية فقط العددين اللذين يضعان الخريطة على محور المتر. ولا تُستخدم المعلمات الداخلية للكاميرا، لذا يمكن وضع تسميات للصور التي لا تتوفر لها معايرة. - تُحفَظ النتيجة بصيغة PNG ذات 16 بت وبوحدة المليمتر، وفق تنسيق مجموعة بيانات العمق في Ultralytics، وتُقرن بصورة المصدر باستخدام جذر اسم الملف.
- تُضاف الأزواج ذات التسميات الزائفة بعد ذلك كمكوّن واحد من مزيج تدريب أكبر، حيث يتعلم نموذج YOLO26-Depth الطالب مطابقة المعلّم، مع التدريب أيضاً على مصادر حقيقية ذات عمق مرجعي.
نظراً إلى أن المقياس يأتي من تنبؤ وليس من قياس، قد تحمل كل خريطة خطأً في المقياس العام. ويتدرب YOLO26-Depth باستخدام خسارة اللوغاريتم غير المتغيرة للمقياس (SILog)، بالإضافة إلى مطابقة التدرج، ويُتحقق منه باستخدام المواءمة بالوسيط؛ ولذلك يُمتص إلى حد كبير انحراف المقياس لكل صورة في التسميات الزائفة.
يمثل هذا المصدر ذي التسميات الزائفة مكوّناً من تكوين التدريب المختلط الداخلي المستخدم للتدريب المسبق لأوزان YOLO26-Depth المُصدرة، ولا يُوزَّع كتنزيل مستقل.
دور ARKitScenes في YOLO26-Depth#
يسهم هذا المصدر بالجزء الأكبر من بيانات التدريب المسبق لـ YOLO26-Depth، كما يوفر أوسع تنوع من المشاهد والكائنات. ومن خلال تقطير معلّم قوي من Depth Anything 3 عبر أكثر من مليون صورة، ينقل هذا المصدر معارف عامة عن المشاهد إلى النموذج الطالب. وعملياً، كان إدراجه حاسماً للتعميم الداخلي عبر المجالات، إذ ساعد النموذج على تحقيق أداء جيد في المشاهد الداخلية التي تتجاوز توزيعات التدريب الحقيقية ذات العمق المرجعي.
الاستخدام#
لا تُدرَّب بيانات ImageNet ذات التسميات الزائفة بمعزل عن غيرها؛ بل تُستخدم كمكوّن واحد من مزيج عمق موحّد، يحدده ملف YAML داخلي/تجريبي بدلاً من تنزيل مجموعة بيانات عامة. ومن الناحية المفاهيمية، يبدو التدريب على مثل هذا المزيج كما يلي:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)النماذج المدرّبة مسبقًا#
تُنزَّل نماذج YOLO26-Depth المدرَّبة مسبقاً تلقائياً من إصدار أصول Ultralytics v8.4.0 عند الإشارة إليها بالاسم لأول مرة:
الاقتباسات والشكر والتقدير#
إذا استخدمت مجموعة بيانات ImageNet في أعمالك البحثية أو التطويرية، يُرجى الاستشهاد بالورقة التالية:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}نود توجيه الشكر إلى فريق ImageNet على إنشاء مجموعة البيانات وصيانتها، وإلى مؤلفي Depth Anything 3 على نماذج المعلّم المستخدمة لإنشاء تسميات العمق الزائفة.
الأسئلة الشائعة#
وهي تعيد استخدام صور التدريب البالغ عددها 1,281,167 لصورة في ImageNet-1K، والتي لا توجد لها قياسات عمق فعلية، وتقرن كل صورة بخريطة عمق تتوقعها شبكة معلم Depth Anything 3. وتُعد هذه المجموعة أكبر مصدر منفرد في مزيج التدريب المسبق لـ YOLO26-Depth البالغ حجمه نحو 2.19 مليون صورة (بنسبة تقارب 58%)، وتُستخدم حصرياً لأغراض تقطير المعرفة وتوفير تنوع في المشاهد.
يتم تمرير كل صورة عبر
DA3MONO-LARGEلاستخراج البنية النسبية التفصيلية وعبرDA3METRIC-LARGEلتحديد النطاق المتري. ويتم تطبيق مطابقة تآفية قوية لكل صورة على حدة لربط التنبؤ أحادي العين بالتنبؤ المتري، ويتم حفظ النتيجة كملف PNG بصيغة 16 بت بالمليمتر ضمن تنسيق عمق Ultralytics. راجع قسم كيفية إنشاء التسميات الزائفة لمعرفة التفاصيل.لا. يُعد هذا المصدر جزءاً من تكوين التدريب المختلط الداخلي الكامن وراء أوزان YOLO26-Depth المُصدرة، ولا يتم توزيعه كملف تنزيل مستقل. ولإنشاء مجموعة مشابهة، قم بتوليد تسميات زائفة لصورك الخاصة باستخدام شبكة معلم للعمق، ثم احفظها في تخطيط العمق القياسي.