Jeu de données ImageNet#
Le jeu de données Ultralytics ImageNet (data="imagenet") est le sous-ensemble ImageNet-1k / ILSVRC-2012 utilisé pour entraîner et évaluer les modèles de classification d’images. Il contient 1 000 classes d’objets, avec 1 281 167 images d’entraînement et 50 000 images de validation au format 224x224, et son téléchargement représente environ 144 Go de données. La base ImageNet dans son ensemble est bien plus vaste — plus de 14 millions d’images haute résolution annotées avec des synsets WordNet dans plus de 20 000 catégories — mais Ultralytics entraîne ses modèles sur le sous-ensemble ILSVRC standardisé de 1 000 classes, devenu le benchmark de facto de l’apprentissage profond en vision par ordinateur.
Modèles préentraînés sur ImageNet#
| Modèle | taille (pixels) | acc top1 | acc top5 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) à 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
Fonctionnalités clés#
- Le jeu de données Ultralytics
imagenetfournit 1 000 classes, avec 1 281 167 images d’entraînement et 50 000 images de validation (ILSVRC-2012), le benchmark standard de préentraînement pour la classification d’images. - Les classes sont organisées selon la hiérarchie WordNet, chaque classe correspondant à un synset (un ensemble de termes synonymes).
- Les images sont entraînées au format 224x224, et le jeu de données complet représente un téléchargement volumineux d’environ ~144 Go.
- L’ImageNet Large Scale Visual Recognition Challenge (ILSVRC), organisé chaque année, a joué un rôle déterminant dans l’avancement de la recherche en vision par ordinateur.
Structure du jeu de données#
Le jeu de données Ultralytics ImageNet utilise la partition ILSVRC-2012 :
| Sous-ensemble | Images | Classes |
|---|---|---|
| Entraîner | 1,281,167 | 1,000 |
| Validation | 50,000 | 1,000 |
Les images sont stockées dans des dossiers correspondant à chaque classe, nommés selon l’identifiant du synset WordNet (par exemple, n01440764), conformément à la structure attendue par l’entraînement de classification Ultralytics. Chacune des 1 000 classes correspond à un synset WordNet, et il n’existe pas de partition de test distincte : le jeu de validation de 50 000 images sert donc à mesurer l’exactitude.
ImageNet-1k représente un téléchargement d’environ ~144 Go ; vérifie donc que tu disposes de suffisamment d’espace disque avant l’entraînement. Pour des expérimentations rapides, les sous-ensembles plus petits ImageNette et ImageNet10 utilisent le même format de dossiers et s’entraînent en une fraction du temps.
ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#
L’ImageNet Large Scale Visual Recognition Challenge (ILSVRC), organisé chaque année, permettait aux chercheurs d’évaluer leurs algorithmes sur un jeu de données standardisé à grande échelle, avec des métriques d’évaluation cohérentes. Il a entraîné des avancées majeures de l’apprentissage profond pour la classification d’images, la détection d’objets et d’autres tâches de vision — notamment la victoire d’AlexNet en 2012, qui a contribué au lancement de l’ère moderne de l’apprentissage profond.
Applications#
Le jeu de données ImageNet est largement utilisé pour entraîner et évaluer des modèles d’apprentissage profond pour la classification d’images, la détection d’objets et la localisation d’objets. Des architectures emblématiques telles qu’AlexNet, VGG et ResNet ont toutes été développées et évaluées sur ImageNet, et les poids préentraînés sur ImageNet restent un point de départ courant pour l’apprentissage par transfert dans les différentes tâches de vision.
Utilisation#
Pour entraîner un modèle de classification YOLO sur ImageNet pendant 100 époques avec une taille d’image de 224x224, utilise les extraits de code ci-dessous. Pour consulter la liste complète des arguments disponibles, reporte-toi à la page Entraînement du modèle.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)Tu peux également gérer les jeux de données de classification et lancer l’entraînement dans le cloud avec Ultralytics Platform.
Exemples d’images et d’annotations#
Le jeu de données ImageNet couvre les 1 000 classes ILSVRC-2012 et constitue une ressource vaste et diversifiée pour entraîner et évaluer des modèles de vision par ordinateur. Voici quelques exemples d’images du jeu de données :

Citations et remerciements#
Si tu utilises le jeu de données ImageNet dans le cadre de tes travaux de recherche ou de développement, merci de citer l’article suivant :
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Nous souhaitons remercier l’équipe ImageNet, dirigée par Olga Russakovsky, Jia Deng et Li Fei-Fei, pour avoir créé et maintenu le jeu de données ImageNet en tant que ressource précieuse pour la communauté de recherche en apprentissage automatique et en vision par ordinateur. Pour en savoir plus sur le jeu de données ImageNet et ses créateurs, consulte le site web d’ImageNet.
FAQ#
Le jeu de données ImageNet est une base d’images à grande échelle dont la collection générale contient plus de 14 millions d’images haute résolution annotées avec des synsets WordNet. Dans Ultralytics,
data="imagenet"s’entraîne sur le sous-ensemble ILSVRC-2012 standardisé de 1 000 classes, qui constitue le benchmark de facto pour le préentraînement en classification d’images. Des modèles emblématiques tels qu’AlexNet, VGG et ResNet ont été entraînés et évalués sur ImageNet, ce qui souligne son rôle dans les avancées de la vision par ordinateur.Le jeu de données Ultralytics
imagenetutilise le sous-ensemble ILSVRC-2012, qui comprend 1 000 classes, 1 281 167 images d’entraînement et 50 000 images de validation au format 224x224, pour un téléchargement total d’environ 144 Go. La base ImageNet complète est bien plus vaste (plus de 14 millions d’images réparties sur plus de 20 000 synsets WordNet), mais le sous-ensemble de 1 000 classes est celui utilisé pour l’entraînement et l’évaluation de la classification.Les modèles YOLO26 préentraînés d’Ultralytics offrent des performances de pointe en matière de vitesse et d’exactitude pour diverses tâches de vision par ordinateur. Par exemple, le modèle YOLO26n-cls, avec une exactitude top-1 de 71,4 % et une exactitude top-5 de 90,1 %, est optimisé pour les applications en temps réel. Les modèles préentraînés réduisent les ressources informatiques nécessaires à l’entraînement à partir de zéro et accélèrent les cycles de développement. Pour en savoir plus sur les métriques de performance des modèles YOLO26, consulte la section Modèles préentraînés sur ImageNet.
L’ImageNet Large Scale Visual Recognition Challenge (ILSVRC), organisé chaque année, a favorisé les avancées en vision par ordinateur en fournissant une plateforme compétitive pour évaluer les algorithmes sur un jeu de données standardisé à grande échelle. Ses métriques d’évaluation cohérentes ont stimulé l’innovation en classification d’images, en détection d’objets et en segmentation d’images, repoussant continuellement les limites de l’apprentissage profond et de la vision par ordinateur.
Pour entraîner un modèle Ultralytics YOLO sur ImageNet, charge un modèle de classification préentraîné et indique
datacomme chemin versimagenet:Pour des instructions d’entraînement plus détaillées, reporte-toi à notre page Entraînement.