Ultralytics YOLO27:

Conjunto de datos ImageNet#

El conjunto de datos Ultralytics ImageNet (data="imagenet") es el subconjunto ImageNet-1k / ILSVRC-2012 que se utiliza para entrenar y comparar modelos de clasificación de imágenes. Contiene 1 000 clases de objetos, con 1 281 167 imágenes de entrenamiento y 50 000 imágenes de validación; normalmente se entrena con un tamaño de imagen de 224x224 y su descarga ocupa aproximadamente 144 GB. La base de datos ImageNet completa es mucho mayor: contiene más de 14 millones de imágenes de alta resolución anotadas con synsets de WordNet en más de 20 000 categorías. Sin embargo, Ultralytics entrena con el subconjunto ILSVRC estandarizado de 1 000 clases, que se convirtió en el banco de pruebas de referencia para el aprendizaje profundo en visión artificial.

Modelos preentrenados de ImageNet#

Modelotamaño
(píxeles)
acc
top1
acc
top5
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B) a 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.4
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.5
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.8
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.0
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.5

Características principales#

  • El conjunto de datos imagenet de Ultralytics ofrece 1 000 clases, con 1 281 167 imágenes de entrenamiento y 50 000 de validación (ILSVRC-2012), el banco de pruebas estándar para el preentrenamiento de modelos de clasificación de imágenes.
  • Las clases se organizan según la jerarquía de WordNet, donde cada clase corresponde a un synset (un conjunto de términos sinónimos).
  • Las imágenes se entrenan con un tamaño de 224x224, y la descarga del conjunto de datos completo ocupa ~144 GB.
  • El Desafío de reconocimiento visual a gran escala de ImageNet (ILSVRC), celebrado anualmente, ha sido fundamental para impulsar la investigación en visión artificial.

Estructura del conjunto de datos#

El conjunto de datos ImageNet de Ultralytics utiliza la división ILSVRC-2012:

DivisiónImágenesClases
Entrenar1,281,1671,000
Validación50,0001,000

Las imágenes se almacenan en carpetas independientes por clase, con el nombre del ID del synset de WordNet (por ejemplo, n01440764), que es la estructura que espera el entrenamiento de clasificación de Ultralytics. Cada una de las 1 000 clases corresponde a un synset de WordNet y no hay una división de prueba independiente, por lo que el conjunto de validación de 50 000 imágenes se utiliza para medir la precisión.

Tamaño de descarga

La descarga de ImageNet-1k ocupa ~144 GB, así que asegúrate de tener suficiente espacio en disco antes de entrenar. Para hacer experimentos rápidos, los subconjuntos más pequeños ImageNette e ImageNet10 utilizan el mismo formato de carpetas y se entrenan en mucho menos tiempo.

Desafío de reconocimiento visual a gran escala de ImageNet (ILSVRC)#

El Desafío de reconocimiento visual a gran escala de ImageNet (ILSVRC), celebrado anualmente, permitía a los investigadores comparar algoritmos con un conjunto de datos estandarizado a gran escala y con métricas de evaluación coherentes. Impulsó grandes avances en el aprendizaje profundo para la clasificación de imágenes, la detección de objetos y otras tareas de visión. Destaca especialmente la victoria de AlexNet en 2012, que contribuyó a inaugurar la era moderna del aprendizaje profundo.

Aplicaciones#

El conjunto de datos ImageNet se utiliza ampliamente para entrenar y evaluar modelos de aprendizaje profundo destinados a la clasificación de imágenes, la detección de objetos y la localización de objetos. Arquitecturas emblemáticas como AlexNet, VGG y ResNet se desarrollaron y compararon con ImageNet, y los pesos preentrenados con ImageNet siguen siendo un punto de partida habitual para el aprendizaje por transferencia en distintas tareas de visión.

Uso#

Para entrenar un modelo YOLO de clasificación con ImageNet durante 100 épocas y con un tamaño de imagen de 224x224, utiliza los fragmentos de código siguientes. Consulta la página de entrenamiento del modelo para ver una lista completa de los argumentos disponibles.

Ejemplo de entrenamiento
from ultralytics import YOLO

# Cargar un modelo
model = YOLO("yolo26n-cls.pt")  # Carga un modelo preentrenado (recomendado para el entrenamiento)

# Entrenar el modelo
results = model.train(data="imagenet", epochs=100, imgsz=224)

También puedes gestionar conjuntos de datos de clasificación y ejecutar entrenamientos en la nube con Ultralytics Platform.

Imágenes de muestra y anotaciones#

El conjunto de datos ImageNet abarca las 1 000 clases de ILSVRC-2012 y ofrece un recurso diverso y extenso para entrenar y evaluar modelos de visión artificial. Aquí tienes algunas imágenes de ejemplo del conjunto de datos:

Imágenes de muestra del conjunto de datos de clasificación ImageNet

Citas y agradecimientos#

Si utilizas el conjunto de datos ImageNet en tu investigación o trabajo de desarrollo, cita el siguiente artículo:

Cita
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

Queremos reconocer al equipo de ImageNet, liderado por Olga Russakovsky, Jia Deng y Li Fei-Fei, por crear y mantener el conjunto de datos ImageNet como recurso valioso para la comunidad investigadora de aprendizaje automático y visión artificial. Para obtener más información sobre el conjunto de datos ImageNet y sus creadores, visita el sitio web de ImageNet.

Preguntas frecuentes#

  • El conjunto de datos ImageNet es una base de datos de imágenes a gran escala cuya colección completa contiene más de 14 millones de imágenes de alta resolución anotadas con synsets de WordNet. En Ultralytics, data="imagenet" entrena con el subconjunto estandarizado ILSVRC-2012 de 1 000 clases, el banco de pruebas de referencia para el preentrenamiento de modelos de clasificación de imágenes. Modelos emblemáticos como AlexNet, VGG y ResNet se entrenaron y compararon con ImageNet, lo que destaca su papel en el avance de la visión artificial.

  • El conjunto de datos imagenet de Ultralytics utiliza el subconjunto ILSVRC-2012, con 1 000 clases, 1 281 167 imágenes de entrenamiento y 50 000 imágenes de validación. Normalmente se entrena con un tamaño de imagen de 224x224 y su descarga ocupa aproximadamente 144 GB. La base de datos ImageNet completa es mucho mayor (más de 14 millones de imágenes distribuidas en más de 20 000 synsets de WordNet), pero el subconjunto de 1 000 clases es el que se utiliza para entrenar y comparar modelos de clasificación.

  • Para entrenar un modelo Ultralytics YOLO con ImageNet, carga un modelo de clasificación preentrenado e indica a data que utilice imagenet:

    Ejemplo de entrenamiento
    from ultralytics import YOLO
    
    # Cargar un modelo
    model = YOLO("yolo26n-cls.pt")  # Carga un modelo preentrenado (recomendado para el entrenamiento)
    
    # Entrenar el modelo
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    Consulta nuestra página de entrenamiento para obtener instrucciones de entrenamiento más detalladas.

  • Los modelos preentrenados Ultralytics YOLO26 ofrecen un rendimiento de vanguardia en velocidad y precisión para distintas tareas de visión artificial. Por ejemplo, el modelo YOLO26n-cls, con una precisión top-1 del 71,4 % y una precisión top-5 del 90,1 %, está optimizado para aplicaciones en tiempo real. Los modelos preentrenados reducen los recursos computacionales necesarios para entrenar desde cero y aceleran los ciclos de desarrollo. Consulta más información sobre las métricas de rendimiento de los modelos YOLO26 en la sección de modelos preentrenados de ImageNet.

  • El Desafío de reconocimiento visual a gran escala de ImageNet (ILSVRC), celebrado anualmente, impulsó los avances en visión artificial al ofrecer una plataforma competitiva para evaluar algoritmos con un conjunto de datos estandarizado a gran escala. Sus métricas de evaluación coherentes fomentaron la innovación en clasificación de imágenes, detección de objetos y segmentación de imágenes, ampliando continuamente los límites del aprendizaje profundo y la visión artificial.

Comentarios