Ultralytics YOLO27 :

Jeu de données de profondeur ImageNet (avec pseudo-étiquettes)#

Le jeu de données ImageNet (profondeur avec pseudo-étiquettes) réutilise les 1,281,167 images d’entraînement d’ImageNet-1K, qui ne disposent pas de vérité terrain de profondeur, et associe à chaque image une carte de profondeur pseudo-étiquetée générée par un modèle enseignant Depth Anything 3, en combinant ses checkpoints monoculaire et métrique. Il sert exclusivement à la distillation des connaissances et à exploiter la diversité des scènes et des objets qu’offre ImageNet. En tant que source unique la plus importante du mélange de préentraînement YOLO26-Depth d’environ 2.19M images (environ 58 %), son ajout a été décisif pour la généralisation à des domaines intérieurs différents.

Fonctionnalités clés#

  • 1,281,167 images d’entraînement ImageNet-1K couvrant une très grande variété d’objets, de scènes et de contextes.
  • Aucune vérité terrain de profondeur : chaque cible de profondeur est une pseudo-étiquette générée par un modèle enseignant Depth Anything 3 combiné (DA3MONO-LARGE pour la structure de la scène, DA3METRIC-LARGE pour l’échelle métrique).
  • Utilisé exclusivement pour la distillation des connaissances et la diversité des scènes et des objets, pas comme benchmark.
  • La source unique la plus importante du mélange de préentraînement de ~2.19M images (~58 %), décisive pour la généralisation à des domaines intérieurs différents.
  • Aucun sous-ensemble de validation : la validation est effectuée uniquement sur des jeux de données réels avec vérité terrain.

Structure du jeu de données#

La source ImageNet avec pseudo-étiquettes comprend les images d’entraînement d’ImageNet-1K, chacune associée à une carte de profondeur générée par machine :

  1. Images d’entraînement : 1,281,167 images d’entraînement ImageNet-1K, soit la plus grande composante individuelle (~58 %) du mélange de préentraînement YOLO26-Depth de ~2.19M images.
  2. Validation : aucune. Cette source n’a pas de sous-ensemble de validation ; la validation de YOLO26-Depth utilise uniquement des jeux de données réels avec vérité terrain, comme NYU Depth V2 et KITTI Eigen.

Génération des pseudo-étiquettes#

ImageNet étant fourni sans annotations de profondeur, les cibles de profondeur sont générées hors ligne plutôt que mesurées. Deux checkpoints Depth Anything 3 sont combinés, l’un pour la structure de la scène et l’autre pour l’échelle absolue :

  1. Chaque image d’entraînement ImageNet est traitée par depth-anything/DA3MONO-LARGE, qui prédit une carte de profondeur très détaillée, définie uniquement à une échelle et avec un décalage inconnus propres à chaque image, et par depth-anything/DA3METRIC-LARGE, dont la sortie est plus grossière, mais exprimée en unités réelles.
  2. Un ajustement affine robuste par image projette la prédiction monoculaire sur la prédiction métrique, label = a * mono + b. Chaque détail par pixel provient donc du checkpoint monoculaire, tandis que le checkpoint métrique ne définit que les deux scalaires qui positionnent la carte sur l’axe des mètres. Aucune intrinsèque de caméra n’est nécessaire ; les images non calibrées peuvent donc être étiquetées.
  3. Le résultat est enregistré au format PNG 16 bits en millimètres, conformément au format de jeu de données de profondeur Ultralytics, puis associé à son image source par son nom de fichier sans extension.
  4. Les paires avec pseudo-étiquettes sont ensuite ajoutées comme composante d’un mélange d’entraînement plus vaste, où un modèle YOLO26-Depth étudiant apprend à reproduire le modèle enseignant tout en s’entraînant également sur des sources réelles avec vérité terrain.

Comme l’échelle provient d’une prédiction et non d’une mesure, chaque carte peut comporter une erreur d’échelle globale. YOLO26-Depth s’entraîne avec une fonction de perte logarithmique invariante à l’échelle (SILog), complétée par une correspondance des gradients, et est validé avec un alignement médian ; le décalage d’échelle par image des pseudo-étiquettes est donc en grande partie absorbé.

Cette source avec pseudo-étiquettes est intégrée à la configuration interne d’entraînement mixte utilisée pour préentraîner les poids YOLO26-Depth publiés et n’est pas distribuée en téléchargement autonome.

Rôle dans YOLO26-Depth#

Cette source fournit la majeure partie des données de préentraînement YOLO26-Depth ainsi que la plus grande diversité de scènes et d’objets. En distillant un modèle enseignant Depth Anything 3 performant sur plus d’un million d’images, elle transmet au modèle étudiant des connaissances générales sur les scènes. En pratique, son ajout a été décisif pour la généralisation à des domaines intérieurs différents, aidant le modèle à bien fonctionner sur des scènes d’intérieur qui dépassent les distributions des données réelles d’entraînement avec vérité terrain.

Utilisation#

Les données ImageNet avec pseudo-étiquettes ne sont pas utilisées seules pour l’entraînement ; elles constituent une composante d’un mélange de profondeur combiné, défini par un fichier YAML interne ou expérimental plutôt que par un téléchargement public du jeu de données. En pratique, l’entraînement sur un tel mélange ressemble à ce qui suit :

Exemple d’entraînement
from ultralytics import YOLO

# Charger un modèle de profondeur préentraîné
model = YOLO("yolo26n-depth.pt")

# Entraîner sur un mélange de profondeur combiné (ton propre fichier YAML pour plusieurs sources)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Modèles préentraînés#

Les modèles YOLO26-Depth préentraînés se téléchargent automatiquement depuis la publication des ressources v8.4.0 d’Ultralytics lorsqu’on les référence pour la première fois par leur nom :

Citations et remerciements#

Si tu utilises le jeu de données ImageNet dans tes travaux de recherche ou de développement, cite l’article suivant :

Citation
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Nous souhaitons remercier l’équipe ImageNet pour la création et la maintenance du jeu de données, ainsi que les auteurs de Depth Anything 3 pour les modèles enseignants utilisés pour générer les étiquettes de profondeur pseudo-étiquetées.

FAQ#

  • Il réutilise les 1 281 167 images d’entraînement d’ImageNet-1K, qui ne disposent pas de mesures de profondeur, et associe chacune à une carte de profondeur prédite par un modèle enseignant Depth Anything 3. Il s’agit de la principale source du mélange de préentraînement YOLO26-Depth, qui compte environ 2,19 millions d’images (environ 58 %), et elle est utilisée uniquement pour la distillation des connaissances et la diversité des scènes.

  • Chaque image est traitée par DA3MONO-LARGE pour obtenir une structure relative détaillée et par DA3METRIC-LARGE pour obtenir l’échelle métrique. Un ajustement affine robuste propre à chaque image projette la prédiction monoculaire sur celle métrique, puis le résultat est enregistré dans un fichier PNG de 16 bits, en millimètres, au format de profondeur Ultralytics. Consulte Comment les pseudo-étiquettes sont générées pour en savoir plus.

  • Non. Cette source fait partie de la configuration interne d’entraînement mixte utilisée pour les poids YOLO26-Depth publiés et n’est pas distribuée séparément. Pour créer un jeu similaire, génère des pseudo-étiquettes pour tes propres images à l’aide d’un modèle enseignant de profondeur et stocke-les dans la structure de profondeur standard.

Commentaires