Jeu de données de profondeur ImageNet (pseudo-étiqueté)#
Le jeu de données ImageNet (profondeur pseudo-étiquetée) réutilise les 1 281 167 images d'entraînement de ImageNet-1K, qui ne disposent d'aucune vérité terrain de profondeur, et associe chaque image à une pseudo-carte de profondeur produite par un modèle enseignant Depth Anything 3, en combinant ses points de contrôle monoculaires et métriques. Il est utilisé exclusivement pour la distillation de connaissances ainsi que pour la diversité des scènes et des objets qu'offre ImageNet. Étant la plus grande source unique du mélange de pré-entraînement YOLO26-Depth d'environ 2,19 millions d'images (environ 58 %), son ajout a été décisif pour la généralisation inter-domaines en intérieur.
Fonctionnalités clés#
- 1 281 167 images d'entraînement ImageNet-1K couvrant une très large gamme d'objets, de scènes et de contextes.
- Pas de vérité terrain de profondeur : chaque cible de profondeur est un pseudo-étiquetage généré par un enseignant Depth Anything 3 associant (
DA3MONO-LARGEpour la structure de la scène,DA3METRIC-LARGEpour l'échelle métrique). - Utilisé purement pour la distillation de connaissances et la diversité des scènes/objets, pas comme un benchmark.
- La source unique la plus importante dans le mélange de pré-entraînement d'environ 2,19 M d'images (~58 %), décisive pour la généralisation inter-domaine en intérieur.
- Pas de split de validation — la validation est effectuée uniquement sur des jeux de données réels avec vérité terrain.
Structure du jeu de données#
La source ImageNet pseudo-étiquetée consiste en les images d'entraînement ImageNet-1K avec une carte de profondeur générée par machine par image :
- Images d'entraînement : 1 281 167 images d'entraînement ImageNet-1K, le plus grand composant unique (~58 %) du mélange de pré-entraînement YOLO26-Depth d'environ 2,19 M d'images.
- Validation : aucune. Cette source n'a pas de split de validation ; la validation YOLO26-Depth utilise uniquement des jeux de données réels avec vérité terrain tels que NYU Depth V2 et KITTI Eigen.
Comment les pseudo-étiquettes sont générées#
Puisque ImageNet est fourni sans annotations de profondeur, les cibles de profondeur sont produites hors ligne plutôt que mesurées. Deux points de contrôle Depth Anything 3 sont combinés, l'un pour la structure de la scène et l'autre pour l'échelle absolue :
- Chaque image d'entraînement ImageNet est traitée par
depth-anything/DA3MONO-LARGE, qui prédit une carte de profondeur hautement détaillée définie uniquement à une échelle et un décalage par image près, ainsi que pardepth-anything/DA3METRIC-LARGE, dont la sortie est plus grossière mais exprimée en unités réelles. - Un ajustement affine robuste par image mappe la prédiction monoculaire sur la métrique,
label = a * mono + b. Chaque détail par pixel provient donc du point de contrôle monoculaire, tandis que le point de contrôle métrique définit uniquement les deux scalaires qui positionnent la carte sur l'axe des mètres. Aucun paramètre intrinsèque de caméra n'est impliqué, ce qui permet d'étiqueter des images sans calibration. - Le résultat est enregistré sous forme de PNG millimétrique 16 bits, selon le format de jeu de données de profondeur Ultralytics, et associé à son image source par le nom de fichier de base.
- Les paires pseudo-étiquetées sont ensuite ajoutées comme un composant d'un mélange d'entraînement plus large, où un modèle étudiant YOLO26-Depth apprend à imiter l'enseignant tout en s'entraînant également sur des sources réelles avec vérité terrain.
Puisque l'échelle provient d'une prédiction plutôt que d'une mesure, chaque carte peut comporter une erreur d'échelle globale. YOLO26-Depth s'entraîne avec une perte logarithmique invariante à l'échelle (SILog) associée à une mise en correspondance des gradients, et se valide avec un alignement médian, de sorte qu'un décalage d'échelle par image dans les pseudo-étiquettes est largement absorbé.
Cette source pseudo-étiquetée est un composant de la configuration d'entraînement mixte interne utilisée pour pré-entraîner les poids YOLO26-Depth publiés et n'est pas distribuée en tant que téléchargement autonome.
Rôle dans YOLO26-Depth#
Cette source constitue la majeure partie des données de pré-entraînement de YOLO26-Depth ainsi que la plus grande diversité de scènes et d'objets. En distillant un puissant enseignant Depth Anything 3 sur plus d'un million d'images, elle transfère de larges a priori de scène vers le modèle élève. En pratique, son ajout a été décisif pour la généralisation inter-domaines en intérieur, aidant le modèle à bien performer sur des scènes intérieures allant au-delà des distributions d'entraînement de la véritable vérité terrain.
Utilisation#
Les données ImageNet pseudo-étiquetées ne sont pas entraînées de manière isolée ; elles sont consommées comme un composant d'un mélange de profondeur combiné, défini par un YAML interne/d'expérimentation plutôt que par un téléchargement de jeu de données public. Conceptuellement, l'entraînement sur un tel mélange ressemble à ce qui suit :
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Modèles pré-entraînés#
Les modèles YOLO26-Depth pré-entraînés se téléchargent automatiquement depuis la v8.4.0 assets release d'Ultralytics lors de leur première référence par leur nom :
Citations et remerciements#
Si tu utilises le jeu de données ImageNet dans tes travaux de recherche ou de développement, merci de citer l'article suivant :
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Nous tenons à remercier l'équipe ImageNet pour la création et la maintenance du jeu de données, ainsi que les auteurs de Depth Anything 3 pour les modèles enseignants utilisés pour générer les pseudo-étiquettes de profondeur.