YOLO Vision 2026:

ETH3D Tiefendatensatz#

ETH3D ist ein hochauflösendes Multi-View-Stereo-Benchmark, das für monokulare Tiefenschätzung verwendet wird. Es bietet Laser-Scanner-Ground-Truth auf Vermessungsniveau für Innen- und Außenszenen.

Hauptfunktionen#

  • Vermessungstechnische Ground-Truth-Tiefendaten, aufgenommen mit einem hochpräzisen Laserscanner.
  • Hochauflösende Bilder für Innen- und Außenaufnahmen.
  • Tiefenbereich von bis zu ca. 60 m.
  • Die Evaluierung erfolgt anhand von 423 Bildern.
  • Ein hochwertiger Multi-View-Stereo-Benchmark mit präziser, dichter Ground Truth.

Rolle bei YOLO26-Depth#

ETH3D ist ein Zero-Shot-Evaluierungs-Benchmark für die YOLO26-Depth-Familie; die veröffentlichten Modelle wurden nicht darauf trainiert. Die Mischung aus Innen- und Außenaufnahmen mit präzisen Laserscanner-Ground-Truth-Daten macht ihn zu einem aussagekräftigen Test für die domänenübergreifende Generalisierung.

Die Evaluierung nutzt Multi-Scale- und Horizontal-Flip-Test-Time-Augmentation (TTA), gefolgt von einer Log-Least-Squares-Skalenanpassung zwischen den vorhergesagten und den tatsächlichen Ground-Truth-Tiefenkarten, bevor die Metriken berechnet werden.

Ergebnisse#

Die folgende Tabelle zeigt die delta1-Genauigkeit (Prozentsatz der Pixel innerhalb eines 1,25-fachen Schwellenwerts, höher ist besser) auf den ETH3D-Auswertungsbildern nach Modellgröße.

Modelldelta1
YOLO26n-depth0.905
YOLO26s-depth0.876
YOLO26m-depth0.943
YOLO26l-depth0.945
YOLO26x-depth0.953

Evaluierung#

ETH3D wird nicht mit einem mitgelieferten Datensatz-YAML ausgeliefert. Er wird über ein spezielles Evaluierungsskript ausgewertet, das die ETH3D-Bilder sowie die Laserscanner-Tiefen-Ground-Truth lädt, die standardmäßige TTA und Log-Least-Squares-Skalenanpassung anwendet und die Tiefenmetriken ausgibt.

Verwendung#

ETH3D ist ein externes Benchmark, daher werden Modelle typischerweise mit predict auf seinen Bildern ausgeführt. Eine umfassende Liste der verfügbaren Argumente findest du auf der Modellseite Prediction.

Vorhersage-Beispiel
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")

Vortrainierte Modelle#

Die YOLO26-Tiefenfamilie wird Zero-Shot auf dem ETH3D-Benchmark evaluiert. Diese Modelle laden sich automatisch aus dem neuesten Ultralytics-Release herunter, zum Beispiel YOLO26x-depth ab v8.4.0, und decken eine Reihe von Größen (yolo26n/s/m/l/x-depth) für unterschiedliche Genauigkeits- und Ressourcenanforderungen ab.

Zitate und Danksagungen#

Wenn du den ETH3D-Datensatz in deiner Forschung oder Entwicklungsarbeit verwendest, zitiere bitte das folgende Paper:

Zitat
@inproceedings{schops2017eth3d,
      title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
      author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2017}
}

Wir möchten den Autoren für die Erstellung und Pflege dieser wertvollen Ressource für die Computer-Vision-Community danken.

Kommentare