Ultralytics YOLO27:

ETH3D-Tiefendatensatz#

ETH3D ist ein hochauflösender Benchmark für Stereoaufnahmen aus mehreren Ansichten, der für die monokulare Tiefenschätzung verwendet wird. Er stellt Referenzdaten in Vermessungsqualität bereit, die mit Laserscannern für Innen- und Außenszenen erfasst wurden.

Wichtige Funktionen#

  • Tiefenreferenzdaten in Vermessungsqualität, erfasst mit einem hochpräzisen Laserscanner.
  • Hochauflösende Bilder aus Innen- und Außenszenen.
  • Tiefenbereich bis ungefähr 60 m.
  • Die Auswertung erfolgt anhand von 423 Bildern.
  • Ein hochwertiger Benchmark für Stereoaufnahmen aus mehreren Ansichten mit präzisen, dichten Referenzdaten.

Rolle in YOLO26-Depth#

ETH3D ist ein Zero-Shot-Evaluierungsbenchmark für die YOLO26-Depth-Familie; die veröffentlichten Modelle wurden nicht damit trainiert. Die Kombination aus Innen- und Außenszenen sowie präzisen Referenzdaten eines Laserscanners macht den Benchmark zu einem aussagekräftigen Test für die domänenübergreifende Generalisierung.

Für die Auswertung werden Testzeit-Augmentierung (TTA) mit mehreren Maßstäben und horizontalem Spiegeln verwendet. Anschließend erfolgt eine Skalenausrichtung zwischen den vorhergesagten Tiefenkarten und den Tiefenkarten der Referenzdaten mithilfe der logarithmischen Methode der kleinsten Quadrate, bevor die Metriken berechnet werden.

Ergebnisse#

Die folgende Tabelle zeigt die Genauigkeit von delta1 (Prozentsatz der Pixel innerhalb eines Schwellenwerts von 1,25×; höhere Werte sind besser) auf den ETH3D-Auswertungsbildern, aufgeschlüsselt nach Modellgröße.

Modelldelta1
YOLO26n-depth0.905
YOLO26s-depth0.876
YOLO26m-depth0.943
YOLO26l-depth0.945
YOLO26x-depth0.953

Auswertung#

ETH3D wird nicht mit einer gebündelten Dataset-YAML-Datei ausgeliefert. Die Auswertung erfolgt über ein spezielles Auswertungsskript, das die ETH3D-Bilder und die Tiefenreferenzdaten des Laserscanners lädt, die standardmäßige TTA und die Skalenausrichtung mittels logarithmischer Methode der kleinsten Quadrate anwendet und die Tiefenmetriken ausgibt.

Verwendung#

ETH3D ist ein externer Benchmark, daher werden Modelle typischerweise mit predict auf den zugehörigen Bildern ausgeführt. Eine umfassende Liste der verfügbaren Argumente findest du auf der Seite Prediction des Modells.

Beispiel für Vorhersagen
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")

Vortrainierte Modelle#

Die YOLO26-Depth-Familie wird ohne zusätzliches Training auf dem ETH3D-Benchmark ausgewertet. Diese Modelle werden automatisch aus der neuesten Ultralytics-Version heruntergeladen, beispielsweise YOLO26x-depth aus v8.4.0, und decken verschiedene Größen (yolo26n/s/m/l/x-depth) für unterschiedliche Anforderungen an Genauigkeit und Ressourcen ab.

Zitate und Danksagungen#

Wenn du den ETH3D-Datensatz für deine Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte die folgende Publikation:

Zitat
@inproceedings{schops2017eth3d,
      title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
      author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2017}
}

Wir möchten den Autoren für die Erstellung und Pflege dieser wertvollen Ressource für die Computer-Vision-Community danken.

FAQ#

  • ETH3D ist ein Zero-Shot-Evaluierungs-Benchmark. Die veröffentlichten YOLO26-Modelle für die Tiefenschätzung werden nicht darauf trainiert, sodass seine 423 Innen- und Außenbilder mit Laserscanner-Tiefenmessungen in Vermessungsqualität die domänenübergreifende Generalisierung bis auf etwa 60 m messen. Das größte Modell, YOLO26x-depth, erreicht auf diesem Benchmark einen delta1-Wert von 0,953.

  • Nein. ETH3D wird mit einem eigenen Skript ausgewertet, das Multi-Scale- und Flip-Test-Time-Augmentation gefolgt von einer Log-Least-Squares-Skalenanpassung anwendet. Um ein Modell selbst auf ETH3D-Bildern auszuführen, verwende den predict mode, wie im Abschnitt Usage gezeigt wird.

  • Die YOLO26-Depth-Familie wird ebenfalls im Zero-Shot-Verfahren auf NYU Depth V2, Make3D und iBims-1 sowie auf dem KITTI Eigen-Split evaluiert, dessen Trainingsfahrten Teil des Vortrainings-Mix sind. Die Depth Estimation task page fasst die Ergebnisse für alle fünf zusammen.

Kommentare