Link to this sectionImageNet (Pseudo-Labeled) Tiefendatensatz#
Der ImageNet-Datensatz (pseudo-label-tiefe) verwendet die 1.281.167 Trainingsbilder von ImageNet-1K wieder, die keine Ground-Truth-Tiefe besitzen, und paart jedes Bild mit einer Pseudo-Tiefenkarte, die von einem Depth Anything V3-Teachermodell (monokular und metrisch) erstellt wurde. Er wird rein für die Wissens-Destillation und für die Szenen- und Objektvielfalt genutzt, die ImageNet bietet. Als größte Einzelquelle im etwa 2,19 Mio. Bilder umfassenden YOLO26-Depth-Pretraining-Mix (etwa 58 %) war seine Hinzufügung entscheidend für die domänenübergreifende Generalisierung in Innenräumen.
Link to this sectionHauptfunktionen#
- 1.281.167 ImageNet-1K-Trainingsbilder, die ein sehr breites Spektrum an Objekten, Szenen und Kontexten abdecken.
- Keine Ground-Truth-Tiefe: Jedes Tiefenziel ist ein Pseudo-Label, das von einem Depth Anything V3-Teacher (monokular, metrisch) generiert wurde.
- Wird rein für Wissensdestillation und Szenen-/Objektvielfalt verwendet, nicht als Benchmark.
- Die größte Einzelquelle im ~2,19 Mio. Bilder umfassenden Pretraining-Mix (~58 %), entscheidend für die domänenübergreifende Generalisierung in Innenräumen.
- Kein Validierungs-Split — die Validierung wird nur auf echten Ground-Truth-Datensätzen durchgeführt.
Link to this sectionDatensatzstruktur#
Die pseudo-label-basierte ImageNet-Quelle besteht aus den ImageNet-1K-Trainingsbildern mit einer maschinell generierten Tiefenkarte pro Bild:
- Trainingsbilder: 1.281.167 ImageNet-1K-Trainingsbilder, die größte Einzelkomponente (~58 %) des ~2,19 Mio. Bilder umfassenden YOLO26-Depth-Pretraining-Mix.
- Validierung: keine. Diese Quelle hat keinen Validierungs-Split; die YOLO26-Depth-Validierung verwendet nur echte Ground-Truth-Datensätze wie NYU Depth V2 und KITTI Eigen.
Link to this sectionWie die Pseudo-Labels generiert werden#
Da ImageNet ohne Tiefenannotationen ausgeliefert wird, werden Tiefenziele offline erzeugt, anstatt sie zu messen:
- Jedes ImageNet-Trainingsbild wird durch ein vortrainiertes Depth Anything V3-Teachermodell geleitet, um eine metrische Tiefenkarte pro Pixel vorherzusagen.
- Die Teacher-Vorhersage wird als
.npyfloat32-Array in Metern gespeichert, gemäß dem Ultralytics depth dataset format, und per Dateistamm mit dem Quellbild gepaart. - Die pseudo-label-basierten Paare werden dann als Komponente eines größeren Trainings-Mixes hinzugefügt, wobei ein Schüler-YOLO26-Depth-Modell lernt, den Lehrer zu imitieren, während es gleichzeitig an echten Ground-Truth-Quellen trainiert.
Diese pseudo-label-basierte Quelle ist ein Bestandteil der internen Mixed-Training-Konfiguration, die zum Vortrainieren der veröffentlichten YOLO26-Depth-Gewichte verwendet wird, und wird nicht als eigenständiger Download bereitgestellt.
Link to this sectionRolle in YOLO26-Depth#
Diese Quelle liefert den Großteil der YOLO26-Depth-Pretraining-Daten und die größte Vielfalt an Szenen und Objekten. Durch die Destillation eines starken Depth Anything V3-Lehrers über mehr als eine Million Bilder hinweg, überträgt sie breite Szenen-Priors auf den Schüler. In der Praxis war die Hinzufügung entscheidend für die domänenübergreifende Generalisierung in Innenräumen und hilft dem Modell, bei Innenszenen gut abzuschneiden, die über die echten Ground-Truth-Trainingsverteilungen hinausgehen.
Link to this sectionVerwendung#
Die pseudo-label-basierten ImageNet-Daten werden nicht isoliert trainiert; sie werden als eine Komponente eines kombinierten Tiefen-Mixes konsumiert, der durch ein internes/Experiment-YAML definiert ist, nicht durch einen öffentlichen Datensatz-Download. Konzeptionell sieht das Training an einem solchen Mix wie folgt aus:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this sectionVortrainierte Modelle#
Vortrainierte YOLO26-Depth-Modelle werden automatisch von den Ultralytics v8.4.0 assets release heruntergeladen, wenn sie zum ersten Mal beim Namen genannt werden:
Link to this sectionZitate und Danksagungen#
Wenn du den ImageNet-Datensatz in deiner Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte das folgende Papier:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}Wir möchten dem ImageNet-Team für die Erstellung und Pflege des Datensatzes danken sowie den Autoren von Depth Anything für das Teachermodell, das zur Generierung der Pseudo-Tiefen-Labels verwendet wurde.