Ultralytics YOLO27:

NYU Depth V2深度データセット#

NYU Depth V2は、単眼深度推定向けの標準的な屋内ベンチマークです。Microsoft Kinect v1で撮影した、さまざまな屋内シーンのRGB-D動画シーケンスで構成されています。YOLO26-Depthの精度を報告する際に使用する主要なベンチマークです。

Ultralytics Platform上のNYU Depth V2でRGB深度ペアをプレビューし、データセットの統計を確認して、トレーニング用にクローンできます。

主な機能#

  • Microsoft Kinect v1のRGB-Dセンサーで撮影されています。
  • さまざまな実世界の屋内シーン(住宅、オフィス、教室など)を対象としています。
  • 深度範囲は約10 mまでで、一般的な家庭用屋内RGB-D撮影に相当します。
  • 標準のEigenテスト分割に含まれる654枚の画像を使用して評価します。
  • 単眼深度推定の精度を報告する際に使用する主要なベンチマークです。

YOLO26-Depthにおける役割#

NYU Depth V2はYOLO26-Depthファミリーの主要なゼロショット評価ベンチマークであり、深度タスクのページに掲載される主要メトリクスもこのデータセットで測定されています。公開済みのYOLO26-DepthモデルはNYUでトレーニングされていません。データセットにはトレーニング分割もありますが使用せず、ホールドアウトしたテスト結果のみを報告しています。

評価では、マルチスケールと水平反転のテスト時拡張(TTA)を使用します。その後、メトリクスの計算前に、予測深度マップとグラウンドトゥルース深度マップの間で対数最小二乗によるスケール調整を行います。

結果#

以下の表は、モデルサイズ別にNYU Depth V2のEigenテスト分割でのdelta1精度(閾値1.25×以内に収まるピクセルの割合、値が大きいほど良好です)を示しています。

モデルdelta1
YOLO26n-depth0.882
YOLO26s-depth0.896
YOLO26m-depth0.921
YOLO26l-depth0.930
YOLO26x-depth0.933

データセットYAML#

データセット設定の定義にはYAMLファイルを使用します。このファイルには、データセットのパス、クラス、その他の関連情報が含まれます。

ultralytics/cfg/datasets/nyu-depth.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
#     └── nyu-depth-png  ← downloads here (≈1.5 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images

# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.

# Classes
nc: 1
names:
  0: depth

channels: 3
depth_scale: 1000

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zip

使用方法#

NYU Depth V2ベンチマークでYOLO26-Depthモデルを評価するには、以下のコードスニペットを使用できます。使用可能な引数の一覧については、モデルの検証ページをご覧ください。

検証の例
from ultralytics import YOLO

# モデルを読み込む
model = YOLO("yolo26x-depth.pt")  # 事前学習済み深度モデルを読み込みます

# NYU Depth V2ベンチマークで評価します
results = model.val(data="nyu-depth.yaml")

事前学習済みモデル#

YOLO26深度ファミリーはNYU Depth V2ベンチマークでゼロショット評価されます。これらのモデルは、初回使用時にUltralyticsのv8.4.0アセットリリースから自動ダウンロードされます。たとえばYOLO26x-depthなどがあり、精度とリソース要件に応じてさまざまなサイズ(yolo26n/s/m/l/x-depth)が用意されています。

引用と謝辞#

研究または開発でNYU Depth V2データセットを使用する場合は、以下の論文を引用してください。

引用
@inproceedings{silberman2012indoor,
      title={Indoor Segmentation and Support Inference from RGBD Images},
      author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
      booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
      year={2012}
}

コンピュータビジョンコミュニティにとって価値あるこのリソースを作成し、維持している著者の皆様に感謝いたします。

よくある質問#

  • NYU Depth V2は、住宅、オフィス、教室をKinect v1のRGB-Dで約10 mまで撮影したデータからなる標準的な屋内単眼深度ベンチマークで、広く使用されている654枚のEigenテスト分割を備えています。YOLO26-Depthの主要メトリクスは、深度推定タスクのページでこのデータセットを使用して報告されています。

  • いいえ。公開済みモデルはゼロショットで評価されるため、NYUのトレーニング分割は使用せず、ホールドアウトしたテスト結果のみを報告しています。公開済みの数値では、マルチスケールと反転によるテスト時データ拡張を適用した後、対数最小二乗スケールアライメントを行っています。

  • yolo depth val data=nyu-depth.yaml model=yolo26x-depth.ptを実行するか、UsageセクションのPythonサンプルを使用してください。組み込みのバリデーターは中央値アライメントを用いたシングルスケール推論を使用するため、スコアはResultsに記載されているTTAの数値より低くなります。再現可能な値については、task pageをご覧ください。

  • Ultralytics Platform上のNYU Depth V2でRGBと深度のペアをプレビューし、データセットの統計を確認して、クラウドトレーニング用にデータセットをクローンできます。

コントリビューター

コメント