YOLO Vision 2026:

NYU Depth V2 Derinlik Veri Kümesi#

NYU Depth V2, monoküler derinlik tahmini için standart iç mekan kıyaslama testidir. Bir Microsoft Kinect v1 ile kaydedilmiş çok çeşitli iç mekan sahnelerine ait RGB-D video dizilerinden oluşur. YOLO26-Depth doğruluğunu raporlamak için kullanılan birincil kıyaslama testidir.

Temel Özellikler#

  • Microsoft Kinect v1 RGB-D sensörü ile çekilmiştir.
  • Çok çeşitli gerçek iç mekan sahnelerini (evler, ofisler, sınıflar ve benzeri alanlar) kapsar.
  • Tüketici tipi iç mekan RGB-D çekimleri için tipik olan, yaklaşık 10 metreye kadar derinlik aralığı.
  • Değerlendirme, 654 görüntülük standart Eigen test ayrımı üzerinde gerçekleştirilir.
  • Monoküler derinlik tahmini doğruluğunu raporlamak için birincil kıyaslama ölçütüdür.

YOLO26-Depth'teki Rolü#

NYU Depth V2, YOLO26-Depth ailesi için birincil sıfır vuruşlu (zero-shot) değerlendirme kıyaslama ölçütüdür ve derinlik görevi sayfasındaki manşet metrikleri bunun üzerinde raporlanır. Yayınlanan YOLO26-Depth modelleri NYU üzerinde eğitilmemiştir; veri kümesi bir eğitim ayrımı içerse de, bu kullanılmamış ve sadece tutulan test sonuçları raporlanmıştır.

Değerlendirme, çok ölçekli ve yatay çevirmeli test zamanı artırma (TTA) kullanır ve ardından metrikler hesaplanmadan önce tahmin edilen ile doğruluk payı derinlik haritaları arasında log-en küçük kareler ölçek hizalaması yapılır.

Sonuçlar#

Aşağıdaki tablo, NYU Depth V2 Eigen test bölümünde model boyutuna göre delta1 doğruluğunu (1,25× eşik içindeki piksel yüzdesi, ne kadar yüksek o kadar iyi) raporlar.

Modeldelta1
YOLO26n-depth0.882
YOLO26s-depth0.855
YOLO26m-depth0.919
YOLO26l-depth0.927
YOLO26x-depth0.923

Veri Kümesi YAML#

Veri kümesi yapılandırmasını tanımlamak için bir YAML (Yet Another Markup Language) dosyası kullanılır. Veri kümesinin yolları, sınıfları ve diğer ilgili bilgiler hakkında veriler içerir.

ultralytics/cfg/datasets/nyu-depth.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
#     └── nyu-depth  ← downloads here (≈1.5 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images

# Depth maps are paired .npy files (float32, meters) under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.

# Classes
nc: 1
names:
  0: depth

channels: 3

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth.zip

Kullanım#

NYU Depth V2 kıyaslama testinde bir YOLO26-Depth modelini değerlendirmek için aşağıdaki kod parçacıklarını kullanabilirsin. Mevcut argümanların kapsamlı bir listesi için model Doğrulama sayfasına bakın.

Doğrulama Örneği
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Evaluate on the NYU Depth V2 benchmark
results = model.val(data="nyu-depth.yaml")

Önceden Eğitilmiş Modeller#

YOLO26 derinlik ailesi, NYU Depth V2 kıyaslama testinde sıfır atışlı (zero-shot) olarak değerlendirilir. Bu modeller, en son Ultralytics sürümünden, örneğin v8.4.0'dan YOLO26x-depth otomatik olarak indirilir ve farklı doğruluk ve kaynak gereksinimleri için çeşitli boyutları (yolo26n/s/m/l/x-depth) kapsar.

Alıntılar ve Teşekkür#

Araştırma veya geliştirme çalışmalarında NYU Depth V2 veri kümesini kullanırsan, lütfen şu makaleyi kaynak göster:

Alıntı
@inproceedings{silberman2012indoor,
      title={Indoor Segmentation and Support Inference from RGBD Images},
      author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
      booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
      year={2012}
}

Bilgisayarlı görü topluluğu için bu değerli kaynağı yarattıkları ve korudukları için yazarlara teşekkür ederiz.

Katkıda Bulunanlar

Yorumlar