Ultralytics YOLO27 :

Jeu de données de profondeur ImageNet (à pseudo-étiquettes)#

Le jeu de données ImageNet (profondeur à pseudo-étiquettes) réutilise les 1,281,167 images d’entraînement ImageNet-1K, qui ne disposent d’aucune profondeur de vérité terrain, et associe chaque image à une carte de profondeur pseudo-générée par un modèle enseignant Depth Anything 3, combinant ses checkpoints monoculaire et métrique. Il est utilisé uniquement pour la distillation des connaissances et pour la diversité des scènes et des objets fournie par ImageNet. En tant que plus grande source unique du mélange de pré-entraînement YOLO26-Depth d’environ 2,19 M d’images (environ 58 %), son ajout a été décisif pour la généralisation inter-domaines en intérieur.

Fonctionnalités clés#

  • 1,281,167 images d’entraînement ImageNet-1K couvrant une très vaste gamme d’objets, de scènes et de contextes.
  • Aucune profondeur de vérité terrain : chaque cible de profondeur est une pseudo-étiquette générée par un modèle enseignant Depth Anything 3 associant (DA3MONO-LARGE pour la structure de la scène, DA3METRIC-LARGE pour l’échelle métrique).
  • Utilisé uniquement pour la distillation des connaissances et la diversité des scènes et des objets, et non comme benchmark.
  • La plus grande source unique du mélange de pré-entraînement de ~2,19 M d’images (~58 %), décisive pour la généralisation inter-domaines en intérieur.
  • Aucun ensemble de validation — la validation est effectuée uniquement sur des jeux de données réels avec vérité terrain.

Structure du jeu de données#

La source ImageNet à pseudo-étiquettes se compose des images d’entraînement ImageNet-1K, avec une carte de profondeur générée automatiquement par image :

  1. Images d’entraînement : 1,281,167 images d’entraînement ImageNet-1K, le plus grand composant unique (~58 %) du mélange de pré-entraînement YOLO26-Depth de ~2,19 M d’images.
  2. Validation : aucune. Cette source ne possède aucun ensemble de validation ; la validation de YOLO26-Depth utilise uniquement des jeux de données réels avec vérité terrain, comme NYU Depth V2 et KITTI Eigen.

Génération des pseudo-étiquettes#

Comme ImageNet est fourni sans annotations de profondeur, les cibles de profondeur sont produites hors ligne plutôt que mesurées. Deux checkpoints Depth Anything 3 sont combinés : l’un pour la structure de la scène et l’autre pour l’échelle absolue :

  1. Chaque image d’entraînement ImageNet est traitée par depth-anything/DA3MONO-LARGE, qui prédit une carte de profondeur très détaillée, définie uniquement à un facteur d’échelle et à un décalage inconnus près pour chaque image, ainsi que par depth-anything/DA3METRIC-LARGE, dont la sortie est plus grossière, mais exprimée en unités réelles.
  2. Un ajustement affine robuste propre à chaque image projette la prédiction monoculaire sur la prédiction métrique, label = a * mono + b. Chaque détail par pixel provient donc du checkpoint monoculaire, tandis que le checkpoint métrique ne définit que les deux scalaires qui positionnent la carte sur l’axe métrique. Aucun paramètre intrinsèque de caméra n’est utilisé ; les images sans calibration peuvent donc être annotées.
  3. Le résultat est enregistré au format PNG 16 bits en millimètres, conformément au format des jeux de données de profondeur Ultralytics, et associé à son image source par nom de base de fichier.
  4. Les paires à pseudo-étiquettes sont ensuite ajoutées comme un composant d’un mélange d’entraînement plus vaste, dans lequel un modèle étudiant YOLO26-Depth apprend à reproduire le modèle enseignant tout en s’entraînant également sur des sources réelles avec vérité terrain.

Comme l’échelle provient d’une prédiction plutôt que d’une mesure, chaque carte peut présenter une erreur d’échelle globale. YOLO26-Depth s’entraîne avec une perte logarithmique invariante à l’échelle (SILog), complétée par une mise en correspondance des gradients, et effectue la validation avec un alignement médian ; un décalage d’échelle propre à chaque image dans les pseudo-étiquettes est donc largement absorbé.

Cette source à pseudo-étiquettes est un composant de la configuration interne d’entraînement mixte utilisée pour pré-entraîner les poids YOLO26-Depth distribués, et n’est pas proposée au téléchargement séparément.

Rôle dans YOLO26-Depth#

Cette source fournit la majeure partie des données de pré-entraînement de YOLO26-Depth ainsi que la plus grande diversité de scènes et d’objets. En distillant un modèle enseignant Depth Anything 3 performant sur plus d’un million d’images, elle transfère de larges a priori de scène au modèle étudiant. En pratique, son ajout a été décisif pour la généralisation inter-domaines en intérieur, en aidant le modèle à bien fonctionner sur des scènes intérieures au-delà des distributions réelles de données d’entraînement avec vérité terrain.

Utilisation#

Les données ImageNet à pseudo-étiquettes ne sont pas utilisées pour l’entraînement de manière isolée ; elles sont exploitées comme un composant d’un mélange de profondeur combiné, défini par un fichier YAML interne ou expérimental plutôt que par un téléchargement public du jeu de données. Conceptuellement, l’entraînement sur un tel mélange ressemble à ceci :

Exemple d’entraînement
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Modèles préentraînés#

Les modèles YOLO26-Depth pré-entraînés sont téléchargés automatiquement depuis la version des assets v8.4.0 d’Ultralytics lorsqu’ils sont référencés pour la première fois par leur nom :

Citations et remerciements#

Si tu utilises le jeu de données ImageNet dans le cadre de tes travaux de recherche ou de développement, merci de citer l’article suivant :

Citation
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Nous remercions l’équipe ImageNet pour avoir créé et assuré la maintenance du jeu de données, ainsi que les auteurs de Depth Anything 3 pour les modèles enseignants utilisés afin de générer les étiquettes de profondeur pseudo-générées.

FAQ#

  • Il réutilise les 1 281 167 images d'entraînement d'ImageNet-1K, qui n'ont aucune profondeur mesurée, et associe chacune d'elles à une carte de profondeur prédite par un professeur Depth Anything 3. C'est la source unique la plus importante dans le mélange de pré-entraînement d'environ 2,19 millions d'images de YOLO26-Depth (environ 58 %) et elle est utilisée exclusivement pour la distillation de connaissances et la diversité des scènes.

  • Chaque image passe par DA3MONO-LARGE pour une structure relative détaillée et DA3METRIC-LARGE pour l'échelle métrique. Un ajustement affine robuste par image mappe la prédiction monoculaire sur la prédiction métrique, et le résultat est enregistré sous forme de PNG en millimètres 16 bits au Ultralytics depth format. Consulte How the pseudo-labels are generated pour les détails.

  • Non. Cette source fait partie de la configuration d'entraînement mixte interne derrière les poids YOLO26-Depth publiés et n'est pas distribuée en tant que téléchargement autonome. Pour créer un ensemble similaire, génère des étiquettes pseudo pour tes propres images avec un professeur de profondeur et stocke-les dans la disposition de profondeur standard.

Commentaires