Link to this sectionمجموعة بيانات العمق NYU Depth V2#
تعد NYU Depth V2 المعيار القياسي للأماكن المغلقة لـ تقدير العمق أحادي العين. وهي تتكون من تسلسلات فيديو RGB-D لمجموعة واسعة من المشاهد الداخلية المسجلة بواسطة مستشعر Microsoft Kinect v1. وهي المعيار الأساسي المستخدم للإبلاغ عن دقة YOLO26-Depth.
Link to this sectionالميزات الرئيسية#
- تم التقاطها باستخدام مستشعر Microsoft Kinect v1 RGB-D.
- تغطي مجموعة واسعة من المشاهد الداخلية الحقيقية (المنازل، المكاتب، الفصول الدراسية، والمساحات المماثلة).
- نطاق عمق يصل إلى حوالي 10 أمتار، وهو أمر نموذجي لالتقاط RGB-D الداخلي للمستهلك.
- يتم إجراء التقييم على تقسيم الاختبار القياسي Eigen المكون من 654 صورة.
- المعيار الأساسي للإبلاغ عن دقة تقدير العمق أحادي العين.
Link to this sectionدورها في YOLO26-Depth#
تعد NYU Depth V2 معيار التقييم الأساسي للتعلم الصفري (zero-shot) لعائلة YOLO26-Depth، ويتم الإبلاغ عن المقاييس الرئيسية في صفحة مهام العمق بناءً عليها. نماذج YOLO26-Depth المنشورة لم يتم تدريبها على NYU؛ وعلى الرغم من أن مجموعة البيانات تتضمن تقسيمًا للتدريب، إلا أنه لم يتم استخدامه ويتم الإبلاغ فقط عن نتائج الاختبار المحجوزة.
يستخدم التقييم خاصية تعزيز بيانات وقت الاختبار (TTA) متعددة المقاييس وبالقلب الأفقي، متبوعة بمحاذاة المقياس بمربعات الصغرى اللوغاريتمية بين خرائط العمق المتوقعة وخرائط العمق الأرضية قبل حساب المقاييس.
Link to this sectionالنتائج#
يوضح الجدول أدناه دقة delta1 (نسبة البكسلات ضمن عتبة 1.25×، حيث تكون القيمة الأعلى أفضل) على تقسيم اختبار Eigen الخاص بـ NYU Depth V2 حسب حجم النموذج.
| النموذج | delta1 |
|---|---|
| YOLO26n-depth | 0.882 |
| YOLO26s-depth | 0.855 |
| YOLO26m-depth | 0.919 |
| YOLO26l-depth | 0.927 |
| YOLO26x-depth | 0.923 |
Link to this sectionYAML مجموعة البيانات#
يتم استخدام ملف YAML (Yet Another Markup Language) لتحديد تكوين مجموعة البيانات. وهو يحتوي على معلومات حول مسارات مجموعة البيانات، والفئات، ومعلومات أخرى ذات صلة.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
# └── nyu-depth ← downloads here (≈1.5 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images
# Depth maps are paired .npy files (float32, meters) under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.
# Classes
nc: 1
names:
0: depth
channels: 3
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth.zipLink to this sectionالاستخدام#
لتقييم نموذج YOLO26-Depth على معيار NYU Depth V2، يمكنك استخدام مقتطفات الكود التالية. للحصول على قائمة شاملة بالوسيطات المتاحة، راجع صفحة التحقق الخاصة بالنموذج.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Evaluate on the NYU Depth V2 benchmark
results = model.val(data="nyu-depth.yaml")Link to this sectionالنماذج المدربة مسبقاً#
يتم تقييم عائلة YOLO26-Depth باستخدام التقييم الصفري (zero-shot) على معيار NYU Depth V2. يتم تنزيل هذه النماذج تلقائيًا من أحدث إصدار Ultralytics، على سبيل المثال YOLO26x-depth من الإصدار v8.4.0، وتغطي مجموعة من الأحجام (yolo26n/s/m/l/x-depth) لمتطلبات الدقة والموارد المختلفة.
Link to this sectionالاقتباسات والشكر#
إذا كنت تستخدم مجموعة بيانات NYU Depth V2 في عملك البحثي أو التطويري، يرجى الاستشهاد بالورقة البحثية التالية:
@inproceedings{silberman2012indoor,
title={Indoor Segmentation and Support Inference from RGBD Images},
author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
year={2012}
}نود أن نشكر المؤلفين على إنشاء والحفاظ على هذا المورد القيم لمجتمع الرؤية الحاسوبية.