Link to this sectionImageNet(擬似ラベル付き)深度データセット#
ImageNet(擬似ラベル付き深度)データセットは、グランドトゥルース深度を持たない1,281,167枚のImageNet-1Kトレーニング画像を再利用し、各画像にDepth Anything V3ティーチャーモデル(単眼およびメトリック)によって生成された擬似深度マップを組み合わせたものです。これは純粋に知識蒸留のため、およびImageNetが提供するシーンとオブジェクトの多様性のために使用されます。約219万枚の画像からなるYOLO26-Depth事前学習ミックスの中で最大のソース(約58%)であり、その追加は屋内でのドメイン横断的な汎化性能にとって決定的な要因となりました。
Link to this section主な特徴#
- 非常に幅広いオブジェクト、シーン、コンテキストをカバーする1,281,167枚のImageNet-1Kトレーニング画像。
- グランドトゥルース深度なし:すべての深度ターゲットは、Depth Anything V3ティーチャー(単眼、メトリック)によって生成された擬似ラベルです。
- ベンチマークとしてではなく、純粋に知識蒸留とシーン/オブジェクトの多様性のために使用されます。
- 約219万枚の画像からなる事前学習ミックスの中で最大のソース(約58%)であり、屋内でのドメイン横断的な汎化性能にとって決定的です。
- 検証用分割(バリデーションセット)なし。検証は実際のグランドトゥルースデータセットに対してのみ実行されます。
Link to this sectionデータセットの構造#
擬似ラベル付きImageNetソースは、画像1枚につき1つの機械生成深度マップを持つImageNet-1Kトレーニング画像で構成されています。
- トレーニング画像: 1,281,167枚のImageNet-1Kトレーニング画像。約219万枚の画像からなるYOLO26-Depth事前学習ミックスの最大の構成要素(約58%)です。
- 検証: なし。このソースには検証用分割がなく、YOLO26-Depthの検証にはNYU Depth V2やKITTI Eigenなどの実際のグランドトゥルースデータセットのみが使用されます。
Link to this section擬似ラベルの生成方法#
ImageNetには深度アノテーションが含まれていないため、深度ターゲットは測定ではなくオフラインで生成されます。
- 各ImageNetトレーニング画像は、事前学習済みのDepth Anything V3ティーチャーモデルに入力され、ピクセルごとのメトリック深度マップを予測します。
- The teacher prediction is saved as a
.npyfloat32 array in meters, following the Ultralytics depth dataset format, and paired with its source image by file stem. - 擬似ラベル付きペアは、より大きなトレーニングミックスの一要素として追加され、生徒モデルであるYOLO26-Depthが実際のグランドトゥルースソースで学習しながらティーチャーモデルを模倣することを学習します。
この擬似ラベル付きソースは、公開されているYOLO26-Depthウェイトの事前学習に使用された内部的な混合学習構成のコンポーネントであり、単体でのダウンロード配布は行われていません。
Link to this sectionYOLO26-Depthにおける役割#
このソースは、YOLO26-Depth事前学習データの大半を占め、最も幅広いシーンとオブジェクトの多様性を提供します。100万枚以上の画像に対して強力なDepth Anything V3ティーチャーを蒸留することで、広範なシーンの事前知識を生徒モデルに転移させます。実際、これの追加は屋内でのドメイン横断的な汎化性能において決定的な役割を果たし、モデルが実際のグランドトゥルースのトレーニング分布を超えた屋内シーンで良好なパフォーマンスを発揮するのを助けました。
Link to this section使用方法#
擬似ラベル付きImageNetデータは単独で学習されるのではなく、公開データセットのダウンロード形式ではなく、内部の実験用YAMLによって定義された複合的な深度ミックスの一要素として使用されます。概念的には、このようなミックスでの学習は以下のようになります。
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this section事前学習済みモデル#
事前学習済みのYOLO26-Depthモデルは、名前で初めて参照される際にUltralytics v8.4.0アセットリリースから自動的にダウンロードされます。
Link to this section引用と謝辞#
研究や開発活動でImageNetデータセットを使用する場合は、以下の論文を引用してください。
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}データセットを作成・維持しているImageNetチームと、擬似深度ラベルの生成に使用されたティーチャーモデルであるDepth Anythingの作成者に感謝いたします。