ETH3D Tiefendatensatz#
ETH3D ist ein hochauflösendes Multi-View-Stereo-Benchmark, das für monokulare Tiefenschätzung verwendet wird. Es bietet Laser-Scanner-Ground-Truth auf Vermessungsniveau für Innen- und Außenszenen.
Hauptfunktionen#
- Vermessungstechnische Ground-Truth-Tiefendaten, aufgenommen mit einem hochpräzisen Laserscanner.
- Hochauflösende Bilder für Innen- und Außenaufnahmen.
- Tiefenbereich von bis zu ca. 60 m.
- Die Evaluierung erfolgt anhand von 423 Bildern.
- Ein hochwertiger Multi-View-Stereo-Benchmark mit präziser, dichter Ground Truth.
Rolle bei YOLO26-Depth#
ETH3D ist ein Zero-Shot-Evaluierungs-Benchmark für die YOLO26-Depth-Familie; die veröffentlichten Modelle wurden nicht darauf trainiert. Die Mischung aus Innen- und Außenaufnahmen mit präzisen Laserscanner-Ground-Truth-Daten macht ihn zu einem aussagekräftigen Test für die domänenübergreifende Generalisierung.
Die Evaluierung nutzt Multi-Scale- und Horizontal-Flip-Test-Time-Augmentation (TTA), gefolgt von einer Log-Least-Squares-Skalenanpassung zwischen den vorhergesagten und den tatsächlichen Ground-Truth-Tiefenkarten, bevor die Metriken berechnet werden.
Ergebnisse#
Die folgende Tabelle zeigt die delta1-Genauigkeit (Prozentsatz der Pixel innerhalb eines 1,25-fachen Schwellenwerts, höher ist besser) auf den ETH3D-Auswertungsbildern nach Modellgröße.
| Modell | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Evaluierung#
ETH3D wird nicht mit einem mitgelieferten Datensatz-YAML ausgeliefert. Er wird über ein spezielles Evaluierungsskript ausgewertet, das die ETH3D-Bilder sowie die Laserscanner-Tiefen-Ground-Truth lädt, die standardmäßige TTA und Log-Least-Squares-Skalenanpassung anwendet und die Tiefenmetriken ausgibt.
Verwendung#
ETH3D ist ein externes Benchmark, daher werden Modelle typischerweise mit predict auf seinen Bildern ausgeführt. Eine umfassende Liste der verfügbaren Argumente findest du auf der Modellseite Prediction.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")Vortrainierte Modelle#
Die YOLO26-Tiefenfamilie wird Zero-Shot auf dem ETH3D-Benchmark evaluiert. Diese Modelle laden sich automatisch aus dem neuesten Ultralytics-Release herunter, zum Beispiel YOLO26x-depth ab v8.4.0, und decken eine Reihe von Größen (yolo26n/s/m/l/x-depth) für unterschiedliche Genauigkeits- und Ressourcenanforderungen ab.
Zitate und Danksagungen#
Wenn du den ETH3D-Datensatz in deiner Forschung oder Entwicklungsarbeit verwendest, zitiere bitte das folgende Paper:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Wir möchten den Autoren für die Erstellung und Pflege dieser wertvollen Ressource für die Computer-Vision-Community danken.