Jeu de données de profondeur ETH3D#
ETH3D est un benchmark de stéréo multi-vues haute résolution utilisé pour l’estimation de profondeur monoculaire. Il fournit une vérité terrain de précision topographique obtenue par scanner laser, pour des scènes d’intérieur et d’extérieur.
Fonctionnalités clés#
- Vérité terrain de profondeur de précision topographique, capturée avec un scanner laser de haute précision.
- Images haute résolution couvrant des scènes d’intérieur et d’extérieur.
- Portée de profondeur jusqu’à environ 60 m.
- L’évaluation porte sur 423 images.
- Benchmark de stéréo multi-vues de haute qualité avec une vérité terrain dense et précise.
Rôle dans YOLO26-Depth#
ETH3D est un benchmark d’évaluation zéro-shot pour la famille YOLO26-Depth ; les modèles publiés ne sont pas entraînés sur ce jeu de données. Son mélange de scènes d’intérieur et d’extérieur, assorti d’une vérité terrain précise obtenue par scanner laser, constitue un test exigeant de la généralisation inter-domaines.
L’évaluation utilise une augmentation au moment du test (TTA) multi-échelle et par retournement horizontal, suivie d’un alignement d’échelle par moindres carrés en espace logarithmique entre les cartes de profondeur prédites et de vérité terrain avant le calcul des métriques.
Résultats#
Le tableau ci-dessous présente la précision delta1 (fraction de pixels sous un seuil de 1.25×, une valeur plus élevée étant préférable) sur les images d’évaluation ETH3D, selon la taille du modèle.
| Modèle | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Évaluation#
ETH3D n’est pas fourni avec un fichier YAML de jeu de données intégré. L’évaluation s’effectue à l’aide d’un script dédié qui charge les images ETH3D et la vérité terrain de profondeur obtenue par scanner laser, applique la TTA standard et l’alignement d’échelle par moindres carrés en espace logarithmique, puis rapporte les métriques de profondeur.
Utilisation#
ETH3D est un benchmark externe ; les modèles sont donc généralement exécutés avec predict sur ses images. Pour consulter la liste complète des arguments disponibles, reporte-toi à la page Prédiction du modèle.
from ultralytics import YOLO
# Charger un modèle
model = YOLO("yolo26x-depth.pt") # charger un modèle de profondeur préentraîné
# Prédire la profondeur sur des images ETH3D
results = model.predict("path/to/eth3d/images")Modèles préentraînés#
La famille de modèles de profondeur YOLO26 est évaluée en zero-shot sur le benchmark ETH3D. Ces modèles se téléchargent automatiquement lors de leur première utilisation depuis la publication des ressources v8.4.0 d’Ultralytics, par exemple YOLO26x-depth, et couvrent plusieurs tailles (yolo26n/s/m/l/x-depth) pour répondre à différents besoins en précision et en ressources.
Citations et remerciements#
Si tu utilises le jeu de données ETH3D dans tes travaux de recherche ou de développement, cite l’article suivant :
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Nous tenons à remercier les auteurs d’avoir créé et maintenu cette précieuse ressource pour la communauté de la vision par ordinateur.
FAQ#
ETH3D est un benchmark d’évaluation zero-shot. Les modèles YOLO26-Depth publiés n’ont pas été entraînés sur ce jeu de données ; ses 423 images d’intérieur et d’extérieur, accompagnées de données de profondeur mesurées au scanner laser avec une précision topographique, évaluent donc la généralisation à d’autres domaines jusqu’à environ 60 m. Le plus grand modèle, YOLO26x-depth, atteint un delta1 de 0.953 sur ce benchmark.
Non. ETH3D est évalué à l’aide d’un script dédié qui applique une augmentation de test à plusieurs échelles et par retournement, puis un alignement d’échelle par moindres carrés logarithmiques. Pour exécuter toi-même un modèle sur des images ETH3D, utilise le mode prédiction comme indiqué dans la section Utilisation.
La famille YOLO26-Depth est également évaluée en zero-shot sur NYU Depth V2, Make3D et iBims-1, ainsi que sur le sous-ensemble KITTI Eigen, dont les séquences d’entraînement font partie du mélange de préentraînement. La page de la tâche d’estimation de profondeur récapitule les résultats sur les cinq benchmarks.