YOLO Vision 2026:

Make3D深度データセット#

Make3D は、monocular depth estimation のための古典的な屋外用ベンチマークです。カスタムの3Dレーザースキャナーで取得した深度のグラウンドトゥルースとペアになったキャンパスシーンの画像が含まれており、分布外の汎化性能を検証するため広く使用されています。

主な特徴#

  • カスタム3Dレーザースキャナーで取得した深度のグランドトゥルース。
  • 実際の屋外キャンパス風景をカバーしています。
  • 最大約70mまでの深度範囲。
  • 評価は134枚の標準テストセットを使用して実行されます。
  • 古典的な分布外汎化ベンチマーク。

YOLO26-Depthにおける役割#

Make3D は YOLO26-Depth ファミリーのためのゼロショット評価ベンチマークであり、公開されているモデルはこのデータセットで学習されていません。分布外の屋外用セットとして、すべてのモデルにとって最も困難なベンチマークであり、絶対的な delta1 の値は全体的に低くなっていますが、このデータセットでは想定内の動作です。

評価にはマルチスケールおよび水平反転のテスト時オーグメンテーション (TTA) を使用し、メトリクス計算の前に予測デプスマップと正解デプスマップの間で対数最小二乗法によるスケール合わせを行います。

結果#

以下の表は、Make3D テストセットにおけるモデルサイズ別の delta1 精度(1.25× のしきい値内にあるピクセルの割合、高いほど良い)を示しています。

モデルdelta1
YOLO26n-depth0.307
YOLO26s-depth0.311
YOLO26m-depth0.293
YOLO26l-depth0.297
YOLO26x-depth0.299

評価#

Make3Dには、同梱のデータセットYAMLは含まれていません。Make3D画像とレーザースキャナーの深度グランドトゥルースを読み込み、標準的なTTAと対数最小二乗法によるスケール調整を適用して深度メトリクスを報告する、専用の評価スクリプトを通じて評価されます。

使用方法#

Make3D は外部ベンチマークであるため、モデルはその画像に対して通常 predict で実行されます。利用可能な引数の詳細なリストについては、モデルの Prediction ページを参照してください。

予測の例
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")

事前学習済みモデル#

YOLO26 depth ファミリーは、Make3D ベンチマークでゼロショット評価されます。これらのモデルは最新の Ultralytics リリースから自動ダウンロードされ(例: v8.4.0 の YOLO26x-depth)、さまざまな精度とリソースの要件に合わせて、さまざまなサイズ(yolo26n/s/m/l/x-depth)が用意されています。

引用と謝辞#

研究や開発作業でMake3Dデータセットを使用する場合は、以下の論文を引用してください。

引用
@article{saxena2009make3d,
      title={Make3D: Learning 3D Scene Structure from a Single Still Image},
      author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
      journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
      year={2009}
}

コンピュータビジョンコミュニティにとって貴重なこのリソースを作成・維持してくださった著者の皆様に感謝いたします。

コントリビューター

コメント