ImageNet(擬似ラベル付き)深度データセット#
ImageNet(擬似ラベル付き深度)データセットは、グランドトゥルースの深度を持たない1,281,167枚の ImageNet-1K 学習画像を再利用し、モノキュラーとメトリックのチェックポイントを組み合わせた Depth Anything 3 教師モデルによって生成された擬似深度マップと各画像をペアにします。これは純粋に知識蒸留と、ImageNet が提供するシーンおよびオブジェクトの多様性のために使用されます。約219万枚の YOLO26-Depth 事前学習ミックス(約58%)における単一最大のソースとして、その追加は屋内クロスドメイン汎化において決定的な役割を果たしました。
主な特徴#
- 非常に幅広いオブジェクト、シーン、コンテキストをカバーする1,281,167枚のImageNet-1Kトレーニング画像。
- グランドトゥルースの深度がない:すべての深度ターゲットは、Depth Anything 3 の教師モデルのペアリングによって生成された擬似ラベルです(シーン構造用の
DA3MONO-LARGE、メトリックスケール用のDA3METRIC-LARGE)。 - ベンチマークとしてではなく、純粋に知識蒸留とシーン/オブジェクトの多様性のために使用されます。
- 約219万枚の画像からなる事前学習ミックスの中で最大のソース(約58%)であり、屋内でのドメイン横断的な汎化性能にとって決定的です。
- 検証用分割(バリデーションセット)なし。検証は実際のグランドトゥルースデータセットに対してのみ実行されます。
データセットの構造#
擬似ラベル付きImageNetソースは、画像1枚につき1つの機械生成深度マップを持つImageNet-1Kトレーニング画像で構成されています。
- トレーニング画像: 1,281,167枚のImageNet-1Kトレーニング画像。約219万枚の画像からなるYOLO26-Depth事前学習ミックスの最大の構成要素(約58%)です。
- 検証: なし。このソースには検証用分割がなく、YOLO26-Depthの検証にはNYU Depth V2やKITTI Eigenなどの実際のグランドトゥルースデータセットのみが使用されます。
擬似ラベルの生成方法#
ImageNet には深度アノテーションが含まれていないため、深度ターゲットは実測ではなくオフラインで生成されます。シーン構造用と絶対スケール用の2つの Depth Anything 3 チェックポイントが組み合わされます:
- 各 ImageNet 学習画像は
depth-anything/DA3MONO-LARGEを通過し、未知の画像ごとのスケールとシフトを除いてのみ定義される非常に詳細な深度マップを予測し、さらに実単位でより粗い出力を持つdepth-anything/DA3METRIC-LARGEを通過します。 - 画像ごとのロバストなアフィンフィッティングにより、モノキュラー予測がメトリック予測
label = a * mono + bにマッピングされます。したがって、すべてのピクセル単位の詳細情報はモノキュラーチェックポイントから得られ、メトリックチェックポイントはマップをメートル軸上に配置する2つのスカラーを設定するだけです。カメラの内部パラメータは関与しないため、キャリブレーションのない画像にもラベル付けが可能です。 - Ultralytics depth dataset formatに準拠し、結果は16ビットミリメートルのPNGとして保存され、ファイル名(拡張子除く)によって元画像とペアになります。
- 擬似ラベル付きペアは、より大きなトレーニングミックスの一要素として追加され、生徒モデルであるYOLO26-Depthが実際のグランドトゥルースソースで学習しながらティーチャーモデルを模倣することを学習します。
スケールは測定値ではなく予測値に由来するため、各マップにはグローバルなスケール誤差が含まれる可能性があります。YOLO26-Depth は、スケール不変対数(SILog)損失と勾配マッチングを使用して学習し、中央値アライメントで検証を行うため、擬似ラベル内の画像ごとのスケールオフセットは大部分が吸収されます。
この擬似ラベル付きソースは、公開されているYOLO26-Depthウェイトの事前学習に使用された内部的な混合学習構成のコンポーネントであり、単体でのダウンロード配布は行われていません。
YOLO26-Depthにおける役割#
このソースは YOLO26-Depth 事外学習データの大部分と、シーンおよびオブジェクトの最も幅広い多様性を提供します。100万枚を超える画像全体で強力な Depth Anything 3 教師モデルを蒸留することにより、幅広いシーンの事前分布がスチューデントモデルに転送されます。実際には、その追加は屋内クロスドメイン汎化において決定的であり、実際のグランドトゥルース学習分布を超えた屋内シーンでもモデルが優れた性能を発揮するのに役立ちました。
使用方法#
擬似ラベル付きImageNetデータは単独で学習されるのではなく、公開データセットのダウンロード形式ではなく、内部の実験用YAMLによって定義された複合的な深度ミックスの一要素として使用されます。概念的には、このようなミックスでの学習は以下のようになります。
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)事前学習済みモデル#
事前学習済みのYOLO26-Depthモデルは、名前で最初に参照されたときにUltralyticsのv8.4.0 assets releaseから自動ダウンロードされます:
引用と謝辞#
研究や開発活動でImageNetデータセットを使用する場合は、以下の論文を引用してください。
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}データセットを作成および維持してくださっている ImageNet チーム、および擬似深度ラベルの生成に使用された教師モデルを提供してくださった Depth Anything 3 の著者に感謝いたします。