Sécurité prête pour l'entreprise : Conforme ISO 27001 + SOC 2 Type I.

Link to this sectionJeu de données de profondeur ImageNet (pseudo-étiqueté)#

Le jeu de données ImageNet (profondeur pseudo-étiquetée) réutilise les 1 281 167 images d'entraînement ImageNet-1K, qui ne possèdent pas de profondeur de vérité terrain, et associe chaque image à une carte de profondeur pseudo générée par un modèle enseignant Depth Anything V3 (monoculaire et métrique). Il est utilisé purement pour la distillation de connaissances et pour la diversité des scènes et des objets qu'offre ImageNet. En tant que source unique la plus importante dans le mélange de pré-entraînement YOLO26-Depth d'environ 2,19 millions d'images (environ 58 %), son ajout a été décisif pour la généralisation inter-domaine en intérieur.

Link to this sectionFonctionnalités clés#

  • 1 281 167 images d'entraînement ImageNet-1K couvrant une très large gamme d'objets, de scènes et de contextes.
  • Pas de profondeur de vérité terrain : chaque cible de profondeur est une pseudo-étiquette générée par un enseignant Depth Anything V3 (monoculaire, métrique).
  • Utilisé purement pour la distillation de connaissances et la diversité des scènes/objets, pas comme un benchmark.
  • La source unique la plus importante dans le mélange de pré-entraînement d'environ 2,19 M d'images (~58 %), décisive pour la généralisation inter-domaine en intérieur.
  • Pas de split de validation — la validation est effectuée uniquement sur des jeux de données réels avec vérité terrain.

Link to this sectionStructure du jeu de données#

La source ImageNet pseudo-étiquetée consiste en les images d'entraînement ImageNet-1K avec une carte de profondeur générée par machine par image :

  1. Images d'entraînement : 1 281 167 images d'entraînement ImageNet-1K, le plus grand composant unique (~58 %) du mélange de pré-entraînement YOLO26-Depth d'environ 2,19 M d'images.
  2. Validation : aucune. Cette source n'a pas de split de validation ; la validation YOLO26-Depth utilise uniquement des jeux de données réels avec vérité terrain tels que NYU Depth V2 et KITTI Eigen.

Link to this sectionComment les pseudo-étiquettes sont générées#

Parce qu'ImageNet est distribué sans annotations de profondeur, les cibles de profondeur sont produites hors ligne plutôt que mesurées :

  1. Chaque image d'entraînement ImageNet est passée dans un modèle enseignant pré-entraîné Depth Anything V3 pour prédire une carte de profondeur métrique par pixel.
  2. La prédiction de l'enseignant est enregistrée sous forme de tableau float32 .npy en mètres, en suivant le format de jeu de données de profondeur Ultralytics, et associée à son image source par le nom de fichier.
  3. Les paires pseudo-étiquetées sont ensuite ajoutées comme un composant d'un mélange d'entraînement plus large, où un modèle étudiant YOLO26-Depth apprend à imiter l'enseignant tout en s'entraînant également sur des sources réelles avec vérité terrain.

Cette source pseudo-étiquetée est un composant de la configuration d'entraînement mixte interne utilisée pour pré-entraîner les poids YOLO26-Depth publiés et n'est pas distribuée en tant que téléchargement autonome.

Link to this sectionRôle dans YOLO26-Depth#

Cette source contribue à la majeure partie des données de pré-entraînement YOLO26-Depth et à la plus grande diversité de scènes et d'objets. En distillant un enseignant solide Depth Anything V3 sur plus d'un million d'images, elle transfère de larges a priori de scène vers l'étudiant. En pratique, son ajout a été décisif pour la généralisation inter-domaine en intérieur, aidant le modèle à bien performer sur des scènes d'intérieur au-delà des distributions d'entraînement réelles avec vérité terrain.

Link to this sectionUtilisation#

Les données ImageNet pseudo-étiquetées ne sont pas entraînées de manière isolée ; elles sont consommées comme un composant d'un mélange de profondeur combiné, défini par un YAML interne/d'expérimentation plutôt que par un téléchargement de jeu de données public. Conceptuellement, l'entraînement sur un tel mélange ressemble à ce qui suit :

Exemple d'entraînement
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Link to this sectionModèles pré-entraînés#

Les modèles YOLO26-Depth pré-entraînés se téléchargent automatiquement depuis la release d'assets v8.4.0 d'Ultralytics lorsqu'ils sont référencés pour la première fois par leur nom :

Link to this sectionCitations et remerciements#

Si tu utilises le jeu de données ImageNet dans tes travaux de recherche ou de développement, merci de citer l'article suivant :

Citation
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@inproceedings{yang2024depthanything,
      title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
      author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
      booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2024}
}

Nous souhaitons remercier l'équipe ImageNet pour la création et la maintenance du jeu de données, ainsi que les auteurs de Depth Anything pour le modèle enseignant utilisé pour générer les pseudo-étiquettes de profondeur.

Contributeurs

Commentaires