ImageNet-Tiefendatensatz (mit Pseudolabels)#
Der ImageNet-Datensatz (Tiefe mit Pseudolabels) verwendet die 1.281.167 Trainingsbilder von ImageNet, für die keine Tiefen-Ground-Truth-Daten vorliegen, erneut und ordnet jedem Bild eine Pseudotiefenkarte zu, die von einem Depth-Anything-3-Teacher unter Kombination seiner monokularen und metrischen Checkpoints erzeugt wurde. Er wird ausschließlich für die Wissens-Destillation und die Vielfalt an Szenen und Objekten verwendet, die ImageNet bietet. Als größte einzelne Quelle in der YOLO26-Depth-Vortrainingsmischung mit etwa 2,19 Mio. Bildern (rund 58 %) war ihre Aufnahme entscheidend für die domänenübergreifende Generalisierung in Innenräumen.
Wichtige Funktionen#
- 1.281.167 ImageNet-1K-Trainingsbilder mit einer sehr großen Vielfalt an Objekten, Szenen und Kontexten.
- Keine Tiefen-Ground-Truth-Daten: Jedes Tiefenziel ist ein maschinell erzeugtes Pseudolabel aus der Kombination von Depth Anything 3 (
DA3MONO-LARGEfür die Szenenstruktur,DA3METRIC-LARGEfür den metrischen Maßstab). - Wird ausschließlich für Wissensdestillation und die Vielfalt an Szenen und Objekten verwendet, nicht als Benchmark.
- Die größte einzelne Quelle in der Vortrainingsmischung mit ~2,19 Mio. Bildern (~58 %), entscheidend für die domänenübergreifende Generalisierung in Innenräumen.
- Keine Validierungsaufteilung – die Validierung erfolgt ausschließlich anhand realer Datensätze mit Ground-Truth-Daten.
Datensatzstruktur#
Die ImageNet-Quelle mit Pseudolabels umfasst die ImageNet-1K-Trainingsbilder mit jeweils einer maschinell erzeugten Tiefenkarte pro Bild:
- Trainingsbilder: 1.281.167 ImageNet-1K-Trainingsbilder, der größte Einzelbestandteil (~58 %) der YOLO26-Depth-Vortrainingsmischung mit ~2,19 Mio. Bildern.
- Validierung: keine. Diese Quelle hat keine Validierungsaufteilung; für die Validierung von YOLO26-Depth werden nur echte Datensätze mit Ground-Truth-Daten wie NYU Depth V2 und KITTI Eigen verwendet.
So werden die Pseudolabels erzeugt#
Da ImageNet ohne Tiefenannotationen bereitgestellt wird, werden Tiefenziele offline erzeugt und nicht gemessen. Dazu werden zwei Depth-Anything-3-Checkpoints kombiniert: einer für die Szenenstruktur und einer für den absoluten Maßstab:
- Jedes ImageNet-Trainingsbild wird mit
depth-anything/DA3MONO-LARGEverarbeitet, das eine detailreiche Tiefenkarte vorhersagt, deren Maßstab und Verschiebung für jedes Bild unbekannt sind, sowie mitdepth-anything/DA3METRIC-LARGE, dessen Ausgabe gröber ist, aber in realen Einheiten vorliegt. - Eine robuste affine Anpassung pro Bild bildet die monokulare Vorhersage auf die metrische Vorhersage
label = a * mono + bab. Jedes Detail auf Pixelebene stammt somit vom monokularen Checkpoint, während der metrische Checkpoint nur die beiden Skalare festlegt, die die Karte auf der Meterachse positionieren. Kameraintrinsiken werden nicht benötigt, sodass auch Bilder ohne Kalibrierung beschriftet werden können. - Das Ergebnis wird als 16-Bit-PNG-Datei in Millimetern gespeichert, entsprechend dem Ultralytics-Format für Tiefendatensätze, und anhand des Dateinamensstamms mit dem Quellbild verknüpft.
- Die Paare mit Pseudolabels werden anschließend als Bestandteil einer größeren Trainingsmischung hinzugefügt. Dabei lernt ein YOLO26-Depth-Schülermodell, die Vorhersagen des Teachers nachzubilden, und wird zugleich mit Quellen mit echten Ground-Truth-Daten trainiert.
Da der Maßstab auf einer Vorhersage und nicht auf einer Messung beruht, kann jede Karte einen globalen Maßstabsfehler aufweisen. YOLO26-Depth wird mit einem skaleninvarianten Logarithmusverlust (SILog) und zusätzlichem Gradientenabgleich trainiert und mit Mediananpassung validiert. Dadurch wird ein Maßstabsversatz pro Bild in den Pseudolabels weitgehend ausgeglichen.
Diese Quelle mit Pseudolabels ist Bestandteil der internen Konfiguration für das Training mit gemischten Daten, die zum Vortrainieren der veröffentlichten YOLO26-Depth-Gewichte verwendet wird, und wird nicht als eigenständiger Download angeboten.
Rolle in YOLO26-Depth#
Diese Quelle liefert den Großteil der YOLO26-Depth-Vortrainingsdaten und die größte Vielfalt an Szenen und Objekten. Durch die Destillation eines leistungsstarken Depth-Anything-3-Teachers anhand von mehr als einer Million Bildern werden umfassende Szenenprioren auf das Schülermodell übertragen. In der Praxis war die Aufnahme dieser Quelle entscheidend für die domänenübergreifende Generalisierung in Innenräumen und hilft dem Modell, auch bei Innenraumszenen außerhalb der Verteilungen der Trainingsdaten mit echten Ground-Truth-Daten gute Ergebnisse zu erzielen.
Verwendung#
Die ImageNet-Daten mit Pseudolabels werden nicht isoliert trainiert, sondern als Bestandteil einer kombinierten Tiefenmischung verwendet, die durch eine interne oder experimentelle YAML-Datei und nicht durch einen öffentlichen Datensatz-Download definiert wird. Konzeptionell sieht das Training mit einer solchen Mischung folgendermaßen aus:
from ultralytics import YOLO
# Vortrainiertes Tiefenmodell laden
model = YOLO("yolo26n-depth.pt")
# Mit einer kombinierten Tiefenmischung trainieren (eigene YAML-Datei für einen Datensatz aus mehreren Quellen)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Vortrainierte Modelle#
Vortrainierte YOLO26-Depth-Modelle werden beim ersten Aufruf ihres Namens automatisch aus der Ultralytics-Asset-Version v8.4.0 heruntergeladen:
Zitate und Danksagungen#
Wenn du den ImageNet-Datensatz in deiner Forschung oder Entwicklungsarbeit verwendest, zitiere bitte die folgende Arbeit:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Wir möchten dem ImageNet-Team für die Erstellung und Pflege des Datensatzes sowie den Autorinnen und Autoren von Depth Anything 3 für die Lehrermodelle danken, mit denen die Pseudo-Tiefenlabels erzeugt wurden.
Häufig gestellte Fragen#
Er verwendet erneut die 1.281.167 Trainingsbilder von ImageNet-1K, für die keine gemessenen Tiefenwerte vorliegen, und ordnet jedem Bild eine von einem Depth Anything 3-Lehrermodell vorhergesagte Tiefenkarte zu. Er ist die mit Abstand größte Quelle im YOLO26-Depth-Vortrainingsmix mit rund 2,19 Millionen Bildern (etwa 58 %) und wird ausschließlich für die Wissensdestillation und Szenenvielfalt verwendet.
Jedes Bild wird für detaillierte relative Strukturen durch
DA3MONO-LARGEund für den metrischen Maßstab durchDA3METRIC-LARGEverarbeitet. Eine robuste affine Anpassung pro Bild überträgt die monokulare Vorhersage auf die metrische Vorhersage. Das Ergebnis wird als 16-Bit-PNG in Millimetern im Ultralytics-Tiefenformat gespeichert. Einzelheiten findest du unter So werden die Pseudolabels erzeugt.Nein. Diese Quelle ist Teil der internen Konfiguration für das gemischte Training, auf der die veröffentlichten YOLO26-Depth-Gewichte basieren, und wird nicht als eigenständiger Download angeboten. Um einen ähnlichen Datensatz zu erstellen, kannst du mit einem Tiefen-Lehrermodell Pseudolabels für deine eigenen Bilder erzeugen und sie im standardmäßigen Tiefenlayout speichern.