YOLO Vision 2026 :

Jeu de données de profondeur ETH3D#

ETH3D est un benchmark stéréo multi-vue haute résolution utilisé pour l'estimation de profondeur monoculaire. Il fournit une vérité terrain par scanner laser de qualité géodésique pour des scènes intérieures et extérieures.

Fonctionnalités clés#

  • Vérité terrain de profondeur de qualité topographique capturée avec un scanner laser de haute précision.
  • Images haute résolution couvrant des scènes intérieures et extérieures.
  • Plage de profondeur allant jusqu'à environ 60 m.
  • L'évaluation est effectuée sur 423 images.
  • Un benchmark multi-vues de haute qualité avec une vérité terrain dense et précise.

Rôle dans YOLO26-Depth#

ETH3D est un benchmark d'évaluation zéro-shot pour la famille YOLO26-Depth ; les modèles publiés n'ont pas été entraînés dessus. Son mélange de scènes intérieures et extérieures avec une vérité terrain précise obtenue par scanner laser en fait un test solide de généralisation inter-domaine.

L'évaluation utilise une augmentation de données lors du test (TTA) multi-échelle et par retournement horizontal, suivie d'un alignement d'échelle par moindres carrés logarithmiques entre les cartes de profondeur prédites et la vérité terrain avant le calcul des métriques.

Résultats#

Le tableau ci-dessous indique la précision delta1 (pourcentage de pixels dans un seuil de 1,25×, plus c'est élevé, mieux c'est) sur les images d'évaluation ETH3D par taille de modèle.

Modèledelta1
YOLO26n-depth0.905
YOLO26s-depth0.876
YOLO26m-depth0.943
YOLO26l-depth0.945
YOLO26x-depth0.953

Évaluation#

ETH3D n'est pas fourni avec un fichier YAML de jeu de données groupé. Il est évalué via un script d'évaluation dédié qui charge les images ETH3D et la vérité terrain de profondeur par scanner laser, applique le TTA standard et l'alignement d'échelle par moindres carrés logarithmiques, puis rapporte les métriques de profondeur.

Utilisation#

ETH3D étant un benchmark externe, les modèles sont généralement exécutés avec predict sur ses images. Pour une liste complète des arguments disponibles, consulte la page Prédiction du modèle.

Exemple de prédiction
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")

Modèles pré-entraînés#

La famille de profondeur YOLO26 est évaluée en zero-shot sur le benchmark ETH3D. Ces modèles se téléchargent automatiquement à partir de la dernière version d'Ultralytics, par exemple YOLO26x-depth à partir de v8.4.0, et couvrent une gamme de tailles (yolo26n/s/m/l/x-depth) pour répondre à différents besoins de précision et de ressources.

Citations et remerciements#

Si tu utilises le jeu de données ETH3D dans tes travaux de recherche ou de développement, merci de citer l'article suivant :

Citation
@inproceedings{schops2017eth3d,
      title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
      author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2017}
}

Nous tenons à remercier les auteurs pour la création et la maintenance de cette ressource précieuse pour la communauté de la vision par ordinateur.

Commentaires