ETH3D-Tiefendatensatz#
ETH3D ist ein hochauflösender Benchmark für Mehrbild-Stereo und wird für die monokulare Tiefenschätzung verwendet. Er bietet Referenzdaten in Vermessungsqualität, die mit Laserscannern in Innen- und Außenszenen erfasst wurden.
Wichtige Funktionen#
- Tiefenreferenzdaten in Vermessungsqualität, aufgenommen mit einem hochpräzisen Laserscanner.
- Hochauflösende Bilder aus Innen- und Außenszenen.
- Tiefenbereich bis etwa 60 m.
- Die Bewertung erfolgt anhand von 423 Bildern.
- Ein hochwertiger Benchmark für Mehrbild-Stereo mit genauen, dichten Referenzdaten.
Rolle in YOLO26-Depth#
ETH3D ist ein Zero-Shot-Evaluierungsbenchmark für die YOLO26-Depth-Modellfamilie; die veröffentlichten Modelle werden nicht damit trainiert. Die Kombination aus Innen- und Außenszenen und genauen, mit Laserscannern erfassten Referenzdaten macht ETH3D zu einem anspruchsvollen Test für die Verallgemeinerung auf andere Bereiche.
Die Auswertung nutzt Test-Time-Augmentation (TTA) mit mehreren Maßstäben und horizontaler Spiegelung. Vor der Berechnung der Metriken werden die vorhergesagten Tiefenkarten dann durch eine Log-Least-Squares-Skalenausrichtung an die Tiefenreferenzkarten angepasst.
Ergebnisse#
Die folgende Tabelle zeigt die delta1-Genauigkeit (Anteil der Pixel innerhalb eines Schwellenwerts von 1,25×; höhere Werte sind besser) auf den ETH3D-Auswertungsbildern, aufgeschlüsselt nach Modellgröße.
| Modell | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Auswertung#
ETH3D wird nicht mit einer mitgelieferten Dataset-YAML-Datei bereitgestellt. Die Auswertung erfolgt über ein spezielles Skript, das die ETH3D-Bilder und Tiefenreferenzdaten des Laserscanners lädt, die standardmäßige TTA und die Log-Least-Squares-Skalenausrichtung anwendet und die Tiefenmetriken ausgibt.
Verwendung#
ETH3D ist ein externer Benchmark. Daher werden Modelle üblicherweise mit predict auf den Bildern ausgeführt. Eine vollständige Liste der verfügbaren Argumente findest du auf der Seite zur Vorhersage des Modells.
from ultralytics import YOLO
# Ein Modell laden
model = YOLO("yolo26x-depth.pt") # Ein vortrainiertes Tiefenmodell laden
# Tiefe in ETH3D-Bildern vorhersagen
results = model.predict("path/to/eth3d/images")Vortrainierte Modelle#
Die YOLO26-Tiefenfamilie wird ohne zusätzliches Training auf dem ETH3D-Benchmark evaluiert. Diese Modelle werden bei der ersten Verwendung automatisch aus der Ultralytics-Asset-Version v8.4.0 heruntergeladen, zum Beispiel YOLO26x-depth, und sind in verschiedenen Größen verfügbar (yolo26n/s/m/l/x-depth), um unterschiedlichen Anforderungen an Genauigkeit und Ressourcen gerecht zu werden.
Zitate und Danksagungen#
Wenn du den ETH3D-Datensatz in deiner Forschung oder Entwicklungsarbeit verwendest, zitiere bitte die folgende Veröffentlichung:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Wir möchten den Autorinnen und Autoren dafür danken, dass sie diese wertvolle Ressource für die Bildverarbeitungsgemeinschaft erstellt haben und pflegen.
Häufig gestellte Fragen#
ETH3D ist ein Benchmark zur Evaluierung ohne zusätzliches Training. Die veröffentlichten YOLO26-Depth-Modelle werden nicht darauf trainiert. Daher messen die 423 Innen- und Außenaufnahmen mit Tiefendaten aus Laserscannern in Vermessungsqualität die domänenübergreifende Generalisierung bis zu einer Entfernung von etwa 60 m. Das größte Modell, YOLO26x-depth, erreicht auf diesem Benchmark einen delta1-Wert von 0,953.
Nein. ETH3D wird mit einem eigens dafür vorgesehenen Skript evaluiert, das eine Testzeit-Augmentierung mit mehreren Skalierungen und Spiegelungen anwendet und anschließend eine Maßstabsanpassung nach der Methode der kleinsten logarithmischen Quadrate durchführt. Um selbst ein Modell auf ETH3D-Bildern auszuführen, verwende den Vorhersagemodus wie im Abschnitt Verwendung gezeigt.
Die YOLO26-Depth-Familie wird außerdem ohne zusätzliches Training auf NYU Depth V2, Make3D und iBims-1 sowie auf der KITTI-Eigen-Aufteilung evaluiert, deren Trainingsfahrten Teil der Vortrainingsmischung sind. Die Aufgabenseite zur Tiefenschätzung fasst die Ergebnisse aller fünf Benchmarks zusammen.