ImageNet(疑似ラベル付き)深度データセット#
ImageNet(疑似ラベル付き深度)データセットは、正解深度データを持たない1,281,167枚のImageNet-1Kトレーニング画像を再利用し、各画像にDepth Anything 3の教師モデルが単眼チェックポイントとメトリックチェックポイントを組み合わせて生成した疑似深度マップを対応付けたものです。これは、知識蒸留と、ImageNetが提供するシーンおよび物体の多様性のためだけに使用されます。約219万枚の画像から成るYOLO26-Depthの事前学習ミックスの中で最大の単一ソース(約58%)であり、追加したことが屋内のクロスドメイン汎化に決定的な効果をもたらしました。
主な特徴#
- 非常に幅広い物体、シーン、コンテキストをカバーする1,281,167枚のImageNet-1Kトレーニング画像です。
- 正解深度データなし:すべての深度ターゲットは、Depth Anything 3の教師モデルによる推論で生成された疑似ラベルです(シーン構造には
DA3MONO-LARGE、メトリックスケールにはDA3METRIC-LARGEを使用します)。 - ベンチマークではなく、知識蒸留とシーンおよび物体の多様性のためだけに使用されます。
- 約219万枚の画像から成る事前学習ミックスの中で最大の単一ソース(約58%)であり、屋内のクロスドメイン汎化に決定的な役割を果たします。
- 検証用分割なし — 検証は実際の正解データセットでのみ実施されます。
データセットの構成#
疑似ラベル付きImageNetソースは、画像ごとに機械生成された深度マップを1つ持つImageNet-1Kトレーニング画像で構成されます:
- トレーニング画像:1,281,167枚のImageNet-1Kトレーニング画像で、約219万枚の画像から成るYOLO26-Depth事前学習ミックスの最大の単一構成要素(約58%)です。
- 検証:なし。このソースには検証用分割がありません。YOLO26-Depthの検証では、NYU Depth V2やKITTI Eigenなど、実際の正解データセットのみを使用します。
疑似ラベルの生成方法#
ImageNetには深度アノテーションが付属していないため、深度ターゲットは計測ではなくオフラインで生成されます。2つのDepth Anything 3チェックポイントを組み合わせ、一方はシーン構造用、もう一方は絶対スケール用として使用します:
- 各ImageNetトレーニング画像を
depth-anything/DA3MONO-LARGEに入力すると、非常に詳細な深度マップが予測されますが、これは画像ごとに未知のスケールとシフトまでしか定義されません。また、出力はより粗いものの実単位で表されるdepth-anything/DA3METRIC-LARGEにも入力します。 - 画像ごとのロバストなアフィンフィッティングにより、単眼予測をメトリック予測である
label = a * mono + bにマッピングします。したがって、ピクセルごとの詳細はすべて単眼チェックポイントから得られ、メトリックチェックポイントはマップをメートル軸上に配置する2つのスカラーのみを設定します。カメラ内部パラメーターは関与しないため、キャリブレーションのない画像にもラベルを付けられます。 - 結果は、Ultralyticsの深度データセット形式に従った16ビットのミリメートル単位PNGとして保存され、ファイルステムによって元画像と対応付けられます。
- その後、疑似ラベル付きのペアは、より大きなトレーニングミックスの1つの構成要素として追加されます。このミックスでは、学生YOLO26-Depthモデルが教師モデルへの適合を学習すると同時に、実際の正解データソースでもトレーニングされます。
スケールは計測値ではなく予測値から得られるため、各マップにはグローバルなスケール誤差が含まれる可能性があります。YOLO26-Depthはスケール不変対数損失(SILog)に加えて勾配マッチングを用いてトレーニングされ、中央値アライメントで検証されるため、疑似ラベル内の画像ごとのスケールオフセットは大部分が吸収されます。
この疑似ラベル付きソースは、公開されているYOLO26-Depthの重みを事前学習するために使用される内部の混合トレーニング設定の構成要素であり、単独のダウンロードとしては配布されません。
YOLO26-Depthにおける役割#
このソースは、YOLO26-Depthの事前学習データの大部分と、最も幅広いシーンおよび物体の多様性を提供します。100万枚を超える画像で強力なDepth Anything 3教師モデルから蒸留することで、幅広いシーン事前知識を学生モデルに転移します。実際には、これを追加したことが屋内のクロスドメイン汎化に決定的な効果をもたらし、実際の正解データによるトレーニング分布を超えた屋内シーンでもモデルが良好に機能するようになりました。
使用方法#
疑似ラベル付きImageNetデータは単独でトレーニングされるのではなく、公開データセットのダウンロードではなく内部/実験用YAMLで定義された、統合された深度ミックスの1つの構成要素として使用されます。このようなミックスでのトレーニングは、概念的には次のようになります:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)事前トレーニング済みモデル#
事前学習済みのYOLO26-Depthモデルは、名前を初めて参照すると、Ultralyticsのv8.4.0 assets releaseから自動的にダウンロードされます。
引用と謝辞#
研究または開発作業でImageNetデータセットを使用する場合は、次の論文を引用してください:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}データセットを作成・維持しているImageNetチームと、疑似深度ラベルの生成に使用した教師モデルを開発したDepth Anything 3の著者に謝意を表します。
FAQ#
これは、測定された深度を持たない1,281,167枚のImageNet-1Kトレーニング画像を再利用し、それぞれの画像にDepth Anything 3のティーチャーモデルによって予測された深度マップをペアリングしたものです。これは、約219万枚の画像からなるYOLO26-Depth事前学習ミックス(約58%)における単一最大のソースであり、知識蒸留とシーンの多様性のために純粋に使用されます。
各画像は、詳細な相対的構造のために
DA3MONO-LARGEを通して処理され、メトリックのスケールのためにDA3METRIC-LARGEを通して処理されます。画像ごとのロバストなアフィンフィッティングによって単眼予測がメトリック予測にマッピングされ、その結果は16ビットのミリメートル単位のPNGとして Ultralytics depth format で保存されます。詳細は How the pseudo-labels are generated を参照してください。いいえ。このソースは、公開されたYOLO26-Depthの重みの背後にある内部混合トレーニング構成の一部であり、単体のダウンロードとしては配信されません。同様のセットを構築するには、深度ティーチャーモデルを使用して独自の画像の疑似ラベルを生成し、標準の深度レイアウトに保存してください。