Jeu de données ImageNet#
Le jeu de données ImageNet d’Ultralytics (data="imagenet") est le sous-ensemble ImageNet-1k / ILSVRC-2012 utilisé pour entraîner et comparer des modèles de classification d’images. Il comprend 1 000 classes d’objets, avec 1 281 167 images d’entraînement et 50 000 images de validation. L’entraînement se fait généralement avec une taille d’image de 224x224, et le téléchargement représente environ 144 Go de données. La base ImageNet complète est bien plus vaste — plus de 14 millions d’images haute résolution annotées avec des synsets WordNet, réparties dans plus de 20 000 catégories —, mais Ultralytics entraîne ses modèles sur le sous-ensemble normalisé ILSVRC de 1 000 classes, devenu le benchmark de facto pour l’apprentissage profond en vision par ordinateur.
Modèles préentraînés sur ImageNet#
| Modèle | taille (pixels) | acc top1 | acc top5 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) à 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
Fonctionnalités clés#
- Le jeu de données Ultralytics
imagenetcomprend 1 000 classes, 1 281 167 images d’entraînement et 50 000 images de validation (ILSVRC-2012) ; il constitue le benchmark standard de préentraînement pour la classification d’images. - Les classes sont organisées selon la hiérarchie WordNet, chaque classe correspondant à un synset (un ensemble de termes synonymes).
- Les images sont utilisées pour l’entraînement à une résolution de 224x224, et le téléchargement complet du jeu de données représente environ ~144 Go.
- Le défi annuel ImageNet Large Scale Visual Recognition Challenge (ILSVRC) a joué un rôle déterminant dans les avancées de la recherche en vision par ordinateur.
Structure du jeu de données#
Le jeu de données ImageNet d’Ultralytics utilise la partition ILSVRC-2012 :
| Partition | Images | Classes |
|---|---|---|
| Entraînement | 1,281,167 | 1,000 |
| Validation | 50,000 | 1,000 |
Les images sont stockées dans des dossiers par classe nommés selon l’identifiant du synset WordNet (par exemple, n01440764), conformément à la structure attendue pour l’entraînement à la classification avec Ultralytics. Chacune des 1 000 classes correspond à un synset WordNet, et comme il n’existe pas de partition de test distincte, l’ensemble de validation de 50 000 images sert à mesurer l’exactitude.
ImageNet-1k représente un téléchargement d’environ ~144 Go. Vérifie donc que tu as suffisamment d’espace disque avant l’entraînement. Pour des essais rapides, les sous-ensembles plus petits ImageNette et ImageNet10 utilisent le même format de dossiers et s’entraînent en une fraction du temps.
Défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC)#
Le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC), organisé chaque année, permettait aux chercheurs de comparer des algorithmes sur un jeu de données de grande échelle normalisé, avec des métriques d’évaluation cohérentes. Il a entraîné des avancées majeures de l’apprentissage profond pour la classification d’images, la détection d’objets et d’autres tâches de vision — notamment la victoire d’AlexNet en 2012, qui a contribué à lancer l’ère moderne de l’apprentissage profond.
Applications#
Le jeu de données ImageNet est largement utilisé pour entraîner et évaluer des modèles d’apprentissage profond en classification d’images, détection d’objets et localisation d’objets. Des architectures marquantes comme AlexNet, VGG et ResNet ont toutes été développées et évaluées sur ImageNet, et les poids préentraînés sur ImageNet restent un point de départ courant pour l’apprentissage par transfert dans différentes tâches de vision.
Utilisation#
Pour entraîner un modèle YOLO de classification sur ImageNet pendant 100 époques, avec une taille d’image de 224x224, utilise les extraits de code ci-dessous. Pour consulter la liste complète des arguments disponibles, consulte la page Entraînement du modèle.
from ultralytics import YOLO
# Charger un modèle
model = YOLO("yolo26n-cls.pt") # charger un modèle préentraîné (recommandé pour l’entraînement)
# Entraîner le modèle
results = model.train(data="imagenet", epochs=100, imgsz=224)Tu peux aussi gérer des jeux de données de classification et lancer des entraînements dans le cloud avec Ultralytics Platform.
Exemples d’images et annotations#
Le jeu de données ImageNet couvre les 1 000 classes ILSVRC-2012 et constitue une ressource vaste et diversifiée pour entraîner et évaluer des modèles de vision par ordinateur. Voici quelques exemples d’images du jeu de données :

Citations et remerciements#
Si tu utilises le jeu de données ImageNet dans tes travaux de recherche ou de développement, cite l’article suivant :
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Nous tenons à remercier l’équipe ImageNet, dirigée par Olga Russakovsky, Jia Deng et Li Fei-Fei, d’avoir créé et maintenu le jeu de données ImageNet, une ressource précieuse pour la communauté de recherche en apprentissage automatique et en vision par ordinateur. Pour en savoir plus sur le jeu de données ImageNet et ses créateurs, consulte le site Web d’ImageNet.
FAQ#
Le jeu de données ImageNet est une base d’images de grande échelle dont la collection complète contient plus de 14 millions d’images haute résolution annotées avec des synsets WordNet. Dans Ultralytics,
data="imagenet"s’entraîne sur le sous-ensemble normalisé ILSVRC-2012 de 1 000 classes, qui constitue le benchmark de facto pour le préentraînement en classification d’images. Des modèles marquants comme AlexNet, VGG et ResNet ont été entraînés et évalués sur ImageNet, ce qui témoigne de son rôle dans les avancées de la vision par ordinateur.Le jeu de données Ultralytics
imagenetutilise le sous-ensemble ILSVRC-2012, qui comprend 1 000 classes, 1 281 167 images d’entraînement et 50 000 images de validation. L’entraînement se fait généralement avec une taille d’image de 224x224, et le téléchargement représente environ 144 Go. La base ImageNet complète est bien plus vaste (plus de 14 millions d’images réparties dans plus de 20 000 synsets WordNet), mais c’est le sous-ensemble de 1 000 classes qui est utilisé pour entraîner et comparer les modèles de classification.Pour entraîner un modèle Ultralytics YOLO sur ImageNet, charge un modèle de classification préentraîné et indique à
datale cheminimagenet:Exemple d’entraînementfrom ultralytics import YOLO # Charger un modèle model = YOLO("yolo26n-cls.pt") # charger un modèle préentraîné (recommandé pour l’entraînement) # Entraîner le modèle results = model.train(data="imagenet", epochs=100, imgsz=224)Pour des instructions d’entraînement plus détaillées, consulte notre page Entraînement.
Les modèles Ultralytics YOLO26 préentraînés offrent des performances de pointe en termes de vitesse et d’exactitude pour diverses tâches de vision par ordinateur. Par exemple, le modèle YOLO26n-cls, avec une exactitude top-1 de 71,4 % et une exactitude top-5 de 90,1 %, est optimisé pour les applications en temps réel. Les modèles préentraînés réduisent les ressources de calcul nécessaires à un entraînement depuis zéro et accélèrent les cycles de développement. Pour en savoir plus sur les métriques de performance des modèles YOLO26, consulte la section Modèles préentraînés sur ImageNet.
Le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC), organisé chaque année, a fait progresser la vision par ordinateur en fournissant une plateforme de compétition pour évaluer des algorithmes sur un jeu de données de grande échelle normalisé. Ses métriques d’évaluation cohérentes ont favorisé l’innovation en classification d’images, en détection d’objets et en segmentation d’images, repoussant sans cesse les limites de l’apprentissage profond et de la vision par ordinateur.