ImageNet(疑似ラベル付き)深度データセット#
ImageNet(疑似ラベル付き深度)データセットでは、深度グラウンドトゥルースのないImageNet-1Kの学習画像1,281,167枚を再利用し、Depth Anything 3の教師モデルが単眼チェックポイントとメトリックチェックポイントを組み合わせて生成した疑似深度マップを各画像に対応付けます。このデータセットは、知識の蒸留と、ImageNetが提供するシーンやオブジェクトの多様性のためだけに使用されます。約2.19M枚の画像からなるYOLO26-Depthの事前学習データの中で最大の単一ソースであり(約58%)、追加は屋内でのドメイン横断汎化に決定的な役割を果たしました。
主な機能#
- ImageNet-1Kの学習画像1,281,167枚で、非常に幅広いオブジェクト、シーン、コンテキストを網羅しています。
- 深度グラウンドトゥルースはありません。各深度ターゲットは、Depth Anything 3の教師モデルの組み合わせ(シーン構造用の
DA3MONO-LARGE、メトリック尺度用のDA3METRIC-LARGE)で生成された疑似ラベルです。 - ベンチマークとしてではなく、知識蒸留とシーン/オブジェクトの多様性のためだけに使用されます。
- 約2.19M枚の画像からなる事前学習データの中で最大の単一ソース(約58%)であり、屋内でのドメイン横断汎化に決定的な役割を果たします。
- 検証用の分割はありません。検証には実際のグラウンドトゥルースデータセットのみを使用します。
データセットの構成#
疑似ラベル付きImageNetソースは、画像ごとに機械生成の深度マップが1つ付与されたImageNet-1Kの学習画像で構成されます。
- 学習画像: ImageNet-1Kの学習画像1,281,167枚で、約2.19M枚の画像からなるYOLO26-Depthの事前学習データの最大の単一構成要素(約58%)です。
- 検証: なし。このソースには検証用の分割がありません。YOLO26-Depthの検証では、NYU Depth V2やKITTI Eigenなどの実際のグラウンドトゥルースデータセットのみを使用します。
疑似ラベルの生成方法#
ImageNetには深度アノテーションがないため、深度ターゲットは測定値ではなく、オフラインで生成します。シーン構造用と絶対尺度用の2つのDepth Anything 3チェックポイントを組み合わせます。
- 各ImageNet学習画像を
depth-anything/DA3MONO-LARGEに入力すると、画像ごとに未知の尺度とシフトまでしか定まらない高詳細な深度マップが予測されます。また、出力はより粗いものの実際の単位で表されるdepth-anything/DA3METRIC-LARGEにも入力します。 - 画像ごとのロバストなアフィンフィットにより、単眼予測をメトリック予測である
label = a * mono + bに合わせます。したがって、ピクセル単位の詳細はすべて単眼チェックポイントから得られ、メトリックチェックポイントはマップをメートル軸に配置する2つのスカラーのみを設定します。カメラの内部パラメーターは使用しないため、キャリブレーションされていない画像にもラベルを付けられます。 - 結果は、Ultralytics深度データセット形式に従って16ビットのミリメートル単位PNGとして保存され、ファイル名の拡張子を除いた部分をキーに元画像と対応付けられます。
- 疑似ラベル付きのペアは、より大きな学習データの混合に1つの構成要素として追加されます。そこでYOLO26-Depthの学生モデルは、実際のグラウンドトゥルースソースでも学習しながら、教師モデルの出力を再現するように学習します。
尺度は測定値ではなく予測値に基づくため、各マップには全体的な尺度誤差が含まれる可能性があります。YOLO26-Depthでは、尺度不変対数(SILog)損失と勾配マッチングを使って学習し、中央値アライメントを使って検証するため、疑似ラベルに含まれる画像ごとの尺度オフセットの大部分は吸収されます。
この疑似ラベル付きソースは、公開されているYOLO26-Depthの重みの事前学習に使用する内部の混合学習設定の構成要素であり、単独のダウンロードとしては配布されていません。
YOLO26-Depthにおける役割#
このソースはYOLO26-Depthの事前学習データの大部分と、最も幅広いシーンおよびオブジェクトの多様性を提供します。100万枚を超える画像に強力なDepth Anything 3教師モデルを適用して知識を蒸留することで、幅広いシーンの事前知識を学生モデルに移転します。実際に、このデータの追加は屋内でのドメイン横断汎化に決定的な役割を果たし、実際のグラウンドトゥルースによる学習データの分布を超えた屋内シーンでもモデルが良好に動作するのに役立ちました。
使用方法#
疑似ラベル付きImageNetデータだけを使って学習するわけではありません。このデータは、公開データセットのダウンロードではなく、内部/実験用YAMLで定義された深度データの混合の構成要素として使用されます。概念的には、このような混合データを使った学習は次のようになります。
from ultralytics import YOLO
# 事前学習済みの深度モデルを読み込む
model = YOLO("yolo26n-depth.pt")
# 複数のソースを組み合わせた深度データで学習します(独自のマルチソースデータセットYAMLを使用)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)事前学習済みモデル#
事前学習済みYOLO26-Depthモデルは、名前で初めて参照されたときに、Ultralyticsのv8.4.0 assets releaseから自動ダウンロードされます。
引用と謝辞#
研究または開発でImageNetデータセットを使用する場合は、以下の論文を引用してください。
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}データセットを作成・維持しているImageNetチームと、疑似深度ラベルの生成に使用した教師モデルを提供したDepth Anything 3の著者に感謝いたします。
よくある質問#
深度の実測値がないImageNet-1Kのトレーニング画像1,281,167枚を再利用し、それぞれにDepth Anything 3の教師モデルが予測した深度マップを組み合わせています。YOLO26-Depthの約219万枚の画像からなる事前学習データ構成のうち、最大の単一データソースであり(約58%)、知識蒸留とシーンの多様性確保のみに使用されます。
各画像を、詳細な相対構造を取得するために
DA3MONO-LARGEに、メートル単位のスケールを取得するためにDA3METRIC-LARGEに入力します。画像ごとのロバストなアフィンフィッティングで単眼予測をメートル単位の予測に対応付け、その結果を16ビットのミリメートル単位PNGとして保存します。Ultralyticsの深度形式の詳細は、疑似ラベルの生成方法をご覧ください。いいえ。このデータソースは、公開済みのYOLO26-Depth重みに使われた内部の混合トレーニング設定の一部であり、単独のダウンロードデータとしては配布されていません。同様のデータセットを作成するには、深度教師モデルを使って独自の画像に疑似ラベルを生成し、標準的な深度データ形式で保存してください。