Conjunto de datos ImageNet#
El conjunto de datos Ultralytics ImageNet (data="imagenet") es el subconjunto de ImageNet-1k / ILSVRC-2012 que se utiliza para entrenar y evaluar modelos de clasificación de imágenes. Contiene 1000 clases de objetos con 1 281 167 imágenes de entrenamiento y 50 000 imágenes de validación a un tamaño de imagen de 224x224, y se descarga en aproximadamente 144 GB de datos. La base de datos ImageNet en general es mucho más grande —más de 14 millones de imágenes de alta resolución anotadas con conjuntos de sinónimos de WordNet en más de 20 000 categorías—, pero Ultralytics entrena con el subconjunto estandarizado de 1000 clases de ILSVRC que se convirtió en el punto de referencia predeterminado para el deep learning en computer vision.
Modelos preentrenados de ImageNet#
| Modelo | tamaño (píxeles) | acc top1 | acc top5 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | params (M) | FLOPs (B) at 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.5 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.6 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.9 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.2 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.6 |
Características clave#
- El conjunto de datos Ultralytics
imagenetofrece 1000 clases con 1 281 167 imágenes de entrenamiento y 50 000 de validación (ILSVRC-2012), el punto de referencia de entrenamiento previo estándar para la clasificación de imágenes. - Las clases están organizadas según la jerarquía de WordNet, donde cada clase corresponde a un synset (un conjunto de términos sinónimos).
- Las imágenes se entrenan a 224x224, y el conjunto de datos completo es una descarga grande de ~144 GB.
- El reto anual ImageNet Large Scale Visual Recognition Challenge (ILSVRC) ha sido fundamental para hacer avanzar la investigación en computer vision.
Estructura del dataset#
El conjunto de datos Ultralytics ImageNet utiliza la partición ILSVRC-2012:
| Split | Imágenes | Clases |
|---|---|---|
| Entrenar | 1,281,167 | 1,000 |
| Validación | 50,000 | 1,000 |
Las imágenes se almacenan en carpetas por clase nombradas según el ID de conjunto de sinónimos de WordNet (por ejemplo, n01440764), el diseño que espera el entrenamiento de clasificación de Ultralytics. Cada una de las 1000 clases se asigna a un conjunto de sinónimos de WordNet y no hay ninguna división de prueba separada, por lo que el conjunto de validación de 50 000 imágenes se utiliza para medir la precisión.
ImageNet-1k es una descarga de ~144 GB, así que asegúrate de tener suficiente espacio en disco antes de entrenar. Para experimentos rápidos, los subconjuntos más pequeños ImageNette y ImageNet10 utilizan el mismo formato de carpeta y se entrenan en una fracción del tiempo.
ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#
El ImageNet Large Scale Visual Recognition Challenge (ILSVRC) anual permitió a los investigadores evaluar algoritmos en un conjunto de datos estandarizado a gran escala con métricas de evaluación coherentes. Impulsó avances importantes en el deep learning para la clasificación de imágenes, la detección de objetos y otras tareas de visión, sobre todo con la victoria de AlexNet en 2012, que ayudó a iniciar la era moderna del deep learning.
Aplicaciones#
El conjunto de datos ImageNet se utiliza ampliamente para entrenar y evaluar modelos de deep learning para la clasificación de imágenes, la detección de objetos y la localización de objetos. Arquitecturas emblemáticas como AlexNet, VGG y ResNet se desarrollaron y evaluaron en ImageNet, y los pesos preentrenados en ImageNet siguen siendo un punto de partida común para el aprendizaje por transferencia en todas las tareas de visión.
Uso#
Para entrenar un modelo de clasificación YOLO en ImageNet durante 100 épocas con un tamaño de imagen de 224x224, utiliza los fragmentos de código siguientes. Para obtener una lista completa de los argumentos disponibles, consulta la página de entrenamiento del modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)También puedes gestionar conjuntos de datos de clasificación y ejecutar entrenamientos en la nube con Ultralytics Platform.
Muestras de imágenes y anotaciones#
El conjunto de datos ImageNet abarca las 1.000 clases de ILSVRC-2012, proporcionando un recurso diverso y extenso para entrenar y evaluar modelos de visión artificial. Aquí tienes algunas imágenes de ejemplo del conjunto de datos:

Citas y agradecimientos#
Si utilizas el conjunto de datos ImageNet en tu trabajo de investigación o desarrollo, por favor cita el siguiente artículo:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Queremos agradecer al equipo de ImageNet, dirigido por Olga Russakovsky, Jia Deng y Li Fei-Fei, por crear y mantener el conjunto de datos ImageNet como un recurso valioso para la comunidad de investigación de machine learning y computer vision. Para obtener más información sobre el conjunto de datos ImageNet y sus creadores, visita el sitio web de ImageNet.
FAQ#
El conjunto de datos ImageNet es una base de datos de imágenes a gran escala cuya colección más amplia contiene más de 14 millones de imágenes de alta resolución anotadas con conjuntos de sinónimos de WordNet. En Ultralytics,
data="imagenet"se entrena en el subconjunto estandarizado de 1000 clases de ILSVRC-2012, que es el punto de referencia predeterminado para el entrenamiento previo de clasificación de imágenes. Modelos emblemáticos como AlexNet, VGG y ResNet se entrenaron y evaluaron en ImageNet, lo que subraya su papel en el avance de la computer vision.El conjunto de datos Ultralytics
imagenetutiliza el subconjunto ILSVRC-2012 con 1000 clases, 1 281 167 imágenes de entrenamiento y 50 000 imágenes de validación a un tamaño de imagen de 224x224, para una descarga total de aproximadamente 144 GB. La base de datos completa de ImageNet es mucho más grande (más de 14 millones de imágenes en más de 20 000 conjuntos de sinónimos de WordNet), pero el subconjunto de 1000 clases es el que se utiliza para el entrenamiento y la evaluación comparativa de la clasificación.Para entrenar un modelo Ultralytics YOLO en ImageNet, carga un modelo de clasificación preentrenado y apunta
dataaimagenet:Ejemplo de entrenamientofrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)Para obtener instrucciones de entrenamiento más detalladas, consulta nuestra página de entrenamiento.
Los modelos preentrenados Ultralytics YOLO26 ofrecen un rendimiento de vanguardia en términos de velocidad y precisión para varias tareas de computer vision. Por ejemplo, el modelo YOLO26n-cls, con una precisión top-1 del 71,4 % y una precisión top-5 del 90,1 %, está optimizado para aplicaciones en tiempo real. Los modelos preentrenados reducen los recursos informáticos necesarios para entrenar desde cero y aceleran los ciclos de desarrollo. Obtén más información sobre las métricas de rendimiento de los modelos YOLO26 en la sección de modelos preentrenados de ImageNet.
El ImageNet Large Scale Visual Recognition Challenge (ILSVRC) anual impulsó los avances en computer vision al proporcionar una plataforma competitiva para evaluar algoritmos en un conjunto de datos estandarizado a gran escala. Sus métricas de evaluación coherentes fomentaron la innovación en la clasificación de imágenes, la detección de objetos y la segmentación de imágenes, superando continuamente los límites del deep learning y la computer vision.